Ein Wegweiser durch KI-Positionen

Mechanistische Interpretierbarkeit

Veröffentlichungsdaten und Alter der Quellen

Anzahl der Quellen: 4

Neueste datierte Quelle: 2025-07-31

Mindestens eine Quelle wurde innerhalb des 18-Monats-Zeitraums veröffentlicht.

Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.

Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.

Im Glossar öffnen Lesenotizen · Strukturierter Dateneintrag

Einfach erklärt

Forschung dazu, wie die gelernten internen Berechnungen eines Modells sein Verhalten hervorbringen. [1]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Grenzen und Unterschiede

Vom Modell erzeugte Denkschritte sind eine unvollständige Aufzeichnung, keine vollständige Darstellung der internen Berechnungen. Zusammen mit Belegen zu Aktionen und anderen Schutzmaßnahmen können sie dennoch bei der Überwachung helfen. [4]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Ausführlicher erklärt

Mechanistische Interpretierbarkeit versucht, verständliche Merkmale und die Berechnungen zwischen ihnen zu finden. Arbeiten zur Verfolgung von Schaltkreisen untersuchen ausgewählte Mechanismen und prüfen vorgeschlagene Erklärungen durch gezielte Eingriffe. [1] [2]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Wie das zur Karte passt

Eine Erklärung kann zur Bewertung beitragen, ohne eine Entwicklungspolitik festzulegen oder jeden Einsatz des Modells als sicher zu bestätigen. [3] [1]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Diese Seite teilen

https://theaiatlas.org/ideas/interpretability/

Bild zum Teilen herunterladen · Vektorgrafik

Vorschaubilder sind Zusammenfassungen. Teile den Seitenlink mit, damit andere die Belege prüfen können.

Quellen und Umfang unserer Lektüre

  1. 1. Circuit Tracing: Revealing Computational Graphs in Language Models

    Veröffentlichungsdaten und Alter der Quellen

    Anzahl der Quellen: 1

    Neueste datierte Quelle: 2025-03-27

    Mindestens eine Quelle wurde innerhalb des 18-Monats-Zeitraums veröffentlicht.

    Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.

    Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.

    Einleitung, Methodenüberblick und Einschränkungen wurden gelesen, darunter Rekonstruktionsfehler, komplexe Graphen, globale Schaltkreise und die Genauigkeit der mechanistischen Erklärung. Die Ersatzmodell-Analysen der Autoren zeigen ausgewählte Mechanismen; sie erklären nicht das gesamte Verhalten vollständig. Spätere Forschung zur Nachverfolgung von Aufmerksamkeit wird daneben zitiert, damit die hier fehlende Aufmerksamkeitserfassung nicht als dauerhafte Grenze des gesamten Forschungsfelds erscheint.

  2. 2. Tracing Attention Computation Through Feature Interactions

    Veröffentlichungsdaten und Alter der Quellen

    Anzahl der Quellen: 1

    Neueste datierte Quelle: 2025-07-31

    Mindestens eine Quelle wurde innerhalb des 18-Monats-Zeitraums veröffentlicht.

    Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.

    Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.

    Der direkte Abruf mit dem Browserwerkzeug scheiterte; das ursprüngliche HTML des Herausgebers wurde erfolgreich abgerufen. Gelesen wurden Einleitung, Zusammenfassungen der Fallstudien, QK-Zuordnungsmethode, die Einschränkung bei hemmenden Effekten und Abwägungen beim Aufbau der Graphen. Erweitert frühere Zuordnungsgraphen um Aufmerksamkeit; die Ergebnisse sind ausgewählte Studien mit offenen Fragen, keine vollständige Modellerklärung.

  3. 3. Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile

    Die Quelle ist über 18 Monate alt.

    Veröffentlichungsdaten und Alter der Quellen

    Anzahl der Quellen: 1

    Neueste datierte Quelle: 2024-07

    Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.

    Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.

    Einleitung, Abschnitt 2.2 zu erfundenen Angaben und ausgewählte MEASURE-Maßnahmen 2.3, 2.5, 2.6, 2.7 und 2.9 wurden gelesen. Sie betreffen Prüfbelege, Verallgemeinerung, Zitate, Prüfung erzeugten Codes und Schutzmaßnahmen. Ein freiwilliges Risikomanagementprofil; es wird nicht behauptet, dass alle 64 Seiten oder jede zitierte Studie geprüft wurden.

  4. 4. Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety

    Veröffentlichungsdaten und Alter der Quellen

    Anzahl der Quellen: 1

    Neueste datierte Quelle: 2025-07-15

    Mindestens eine Quelle wurde innerhalb des 18-Monats-Zeitraums veröffentlicht.

    Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.

    Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.

    Kurzfassung, Begründung, Forschungsfragen, Einschränkungen und Schlussfolgerung wurden gelesen. Ein wissenschaftliches Positionspapier: aufgezeichnete Denkschritte können die Überwachung unterstützen, bleiben aber unvollständig und möglicherweise empfindlich gegenüber Veränderungen. Die Ansichten der Autoren sind nicht zwingend die Positionen ihrer Institutionen; die zitierten Experimente wurden nicht alle unabhängig geprüft.

Ausgabe und maschinenlesbare Belege

Inhaltsversion 0.20.0. Quellenstichtag 2026-09-15; das bedeutet nicht, dass jede Quelle an diesem Tag gelesen wurde.

Festgehaltenes vollständiges Datenpaket · Vollständige Quellennotizen · Anleitung für KI-Agenten