Getreue Wiedergabe durch Erklärungen
Veröffentlichungsdaten und Alter der Quellen
Anzahl der Quellen: 2
Neueste datierte Quelle: 2025-04-03
Mindestens eine Quelle wurde innerhalb des 18-Monats-Zeitraums veröffentlicht.
Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.
Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.
Im Glossar öffnen Lesenotizen · Strukturierter Dateneintrag
Einfach erklärt
Ob eine Erklärung zutreffend wiedergibt, was eine Antwort beeinflusst hat, statt nur plausibel zu klingen. [1] [2]
Diese Erklärung zitieren oder eine Korrektur vorschlagen
Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen
Grenzen und Unterschiede
Eine richtige Antwort kann eine unvollständige Erklärung haben. Die zitierten Hinweisexperimente fanden Auslassungen bei bestimmten Modellen und Aufgaben; sie zeigen nicht, dass jede schrittweise Herleitung nutzlos ist. [1] [2]
Diese Erklärung zitieren oder eine Korrektur vorschlagen
Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen
Ausführlicher erklärt
Forschende können einen Hinweis hinzufügen, beobachten, ob er die Antwort verändert, und prüfen, ob die Erklärung ihn erwähnt. Solche Tests untersuchen einen bestimmten ursächlichen Einfluss, nicht jeden Schritt der zugrunde liegenden Berechnung. [1] [2]
Diese Erklärung zitieren oder eine Korrektur vorschlagen
Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen
Wie das zur Karte passt
Lesefrage im Atlas: Welche Belege verbinden eine Erklärung mit dem Vorgang, der die Antwort erzeugt hat? [1] [2]
Diese Erklärung zitieren oder eine Korrektur vorschlagen
Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen
Diese Seite teilen
https://theaiatlas.org/ideas/explanation-faithfulness/
Bild zum Teilen herunterladen · Vektorgrafik
Vorschaubilder sind Zusammenfassungen. Teile den Seitenlink mit, damit andere die Belege prüfen können.
Quellen und Umfang unserer Lektüre
1. Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting
Die Quelle ist über 18 Monate alt.
Veröffentlichungsdaten und Alter der Quellen
Anzahl der Quellen: 1
Neueste datierte Quelle: 2023-05-07
Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.
Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.
Zusammenfassung und Versionsverlauf gelesen. Die Experimente führten verzerrende Eingabemerkmale ein und untersuchten erzeugte Erklärungen von GPT-3.5 und Claude 1.0. Ihre Ergebnisse sind kein Urteil über jedes Modell oder jede Erklärung.
2. Reasoning models don’t always say what they think
Veröffentlichungsdaten und Alter der Quellen
Anzahl der Quellen: 1
Neueste datierte Quelle: 2025-04-03
Mindestens eine Quelle wurde innerhalb des 18-Monats-Zeitraums veröffentlicht.
Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.
Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.
Methoden, Ergebnisse und Einschränkungen wurden gelesen. Experimente mit Hinweisen nutzten Claude 3.7 Sonnet und DeepSeek R1 bei Auswahlfragen. Die Ergebnisse gelten nicht für jedes Modell, jede Aufgabe oder jede aufgezeichnete Gedankenkette.
Ausgabe und maschinenlesbare Belege
Inhaltsversion 0.20.0. Quellenstichtag 2026-09-15; das bedeutet nicht, dass jede Quelle an diesem Tag gelesen wurde.
Festgehaltenes vollständiges Datenpaket · Vollständige Quellennotizen · Anleitung für KI-Agenten