Mechanistische Interpretierbarkeit
Veröffentlichungsdaten und Alter der Quellen
Anzahl der Quellen: 4
Neueste datierte Quelle: 2025-07-31
Mindestens eine Quelle wurde innerhalb des 18-Monats-Zeitraums veröffentlicht.
Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.
Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.
Im Glossar öffnen Lesenotizen · Strukturierter Dateneintrag
Einfach erklärt
Forschung dazu, wie die gelernten internen Berechnungen eines Modells sein Verhalten hervorbringen. [1]
Diese Erklärung zitieren oder eine Korrektur vorschlagen
Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen
Grenzen und Unterschiede
Vom Modell erzeugte Denkschritte sind eine unvollständige Aufzeichnung, keine vollständige Darstellung der internen Berechnungen. Zusammen mit Belegen zu Aktionen und anderen Schutzmaßnahmen können sie dennoch bei der Überwachung helfen. [4]
Diese Erklärung zitieren oder eine Korrektur vorschlagen
Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen
Ausführlicher erklärt
Mechanistische Interpretierbarkeit versucht, verständliche Merkmale und die Berechnungen zwischen ihnen zu finden. Arbeiten zur Verfolgung von Schaltkreisen untersuchen ausgewählte Mechanismen und prüfen vorgeschlagene Erklärungen durch gezielte Eingriffe. [1] [2]
Diese Erklärung zitieren oder eine Korrektur vorschlagen
Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen
Wie das zur Karte passt
Eine Erklärung kann zur Bewertung beitragen, ohne eine Entwicklungspolitik festzulegen oder jeden Einsatz des Modells als sicher zu bestätigen. [3] [1]
Diese Erklärung zitieren oder eine Korrektur vorschlagen
Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen
Diese Seite teilen
https://theaiatlas.org/ideas/interpretability/
Bild zum Teilen herunterladen · Vektorgrafik
Vorschaubilder sind Zusammenfassungen. Teile den Seitenlink mit, damit andere die Belege prüfen können.
Quellen und Umfang unserer Lektüre
1. Circuit Tracing: Revealing Computational Graphs in Language Models
Veröffentlichungsdaten und Alter der Quellen
Anzahl der Quellen: 1
Neueste datierte Quelle: 2025-03-27
Mindestens eine Quelle wurde innerhalb des 18-Monats-Zeitraums veröffentlicht.
Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.
Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.
Einleitung, Methodenüberblick und Einschränkungen wurden gelesen, darunter Rekonstruktionsfehler, komplexe Graphen, globale Schaltkreise und die Genauigkeit der mechanistischen Erklärung. Die Ersatzmodell-Analysen der Autoren zeigen ausgewählte Mechanismen; sie erklären nicht das gesamte Verhalten vollständig. Spätere Forschung zur Nachverfolgung von Aufmerksamkeit wird daneben zitiert, damit die hier fehlende Aufmerksamkeitserfassung nicht als dauerhafte Grenze des gesamten Forschungsfelds erscheint.
2. Tracing Attention Computation Through Feature Interactions
Veröffentlichungsdaten und Alter der Quellen
Anzahl der Quellen: 1
Neueste datierte Quelle: 2025-07-31
Mindestens eine Quelle wurde innerhalb des 18-Monats-Zeitraums veröffentlicht.
Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.
Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.
Der direkte Abruf mit dem Browserwerkzeug scheiterte; das ursprüngliche HTML des Herausgebers wurde erfolgreich abgerufen. Gelesen wurden Einleitung, Zusammenfassungen der Fallstudien, QK-Zuordnungsmethode, die Einschränkung bei hemmenden Effekten und Abwägungen beim Aufbau der Graphen. Erweitert frühere Zuordnungsgraphen um Aufmerksamkeit; die Ergebnisse sind ausgewählte Studien mit offenen Fragen, keine vollständige Modellerklärung.
3. Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile
Die Quelle ist über 18 Monate alt.
Veröffentlichungsdaten und Alter der Quellen
Anzahl der Quellen: 1
Neueste datierte Quelle: 2024-07
Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.
Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.
Einleitung, Abschnitt 2.2 zu erfundenen Angaben und ausgewählte MEASURE-Maßnahmen 2.3, 2.5, 2.6, 2.7 und 2.9 wurden gelesen. Sie betreffen Prüfbelege, Verallgemeinerung, Zitate, Prüfung erzeugten Codes und Schutzmaßnahmen. Ein freiwilliges Risikomanagementprofil; es wird nicht behauptet, dass alle 64 Seiten oder jede zitierte Studie geprüft wurden.
4. Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety
Veröffentlichungsdaten und Alter der Quellen
Anzahl der Quellen: 1
Neueste datierte Quelle: 2025-07-15
Mindestens eine Quelle wurde innerhalb des 18-Monats-Zeitraums veröffentlicht.
Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.
Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.
Kurzfassung, Begründung, Forschungsfragen, Einschränkungen und Schlussfolgerung wurden gelesen. Ein wissenschaftliches Positionspapier: aufgezeichnete Denkschritte können die Überwachung unterstützen, bleiben aber unvollständig und möglicherweise empfindlich gegenüber Veränderungen. Die Ansichten der Autoren sind nicht zwingend die Positionen ihrer Institutionen; die zitierten Experimente wurden nicht alle unabhängig geprüft.
Ausgabe und maschinenlesbare Belege
Inhaltsversion 0.20.0. Quellenstichtag 2026-09-15; das bedeutet nicht, dass jede Quelle an diesem Tag gelesen wurde.
Festgehaltenes vollständiges Datenpaket · Vollständige Quellennotizen · Anleitung für KI-Agenten