Ein Wegweiser durch KI-Positionen

KI-Kontrolle

Veröffentlichungsdaten und Alter der Quellen

Anzahl der Quellen: 3

Neueste datierte Quelle: 2025-10-10

Mindestens eine Quelle wurde innerhalb des 18-Monats-Zeitraums veröffentlicht.

Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.

Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.

Im Glossar öffnen Lesenotizen · Strukturierter Dateneintrag

Einfach erklärt

Prüft, ob Schutzmaßnahmen schädliche Aktionen blockieren können, selbst wenn Modellausgaben gezielt zu ihrer Umgehung ausgewählt werden. Auch überwachende Modelle wurden in solchen Tests umgangen. [1] [2]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Grenzen und Unterschiede

Kontrolle kann Prüfungen rund um ein Modell ergänzen, ohne dessen gelernte Gewichte zu verändern. Sie kann die Arbeit an der Ausrichtung ergänzen. Ein bestandener Test stützt nur Aussagen über den benannten Aufbau und die geprüften Angriffe. [1] [2]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Ausführlicher erklärt

Forschende testen ganze Arbeitsabläufe gegen gezielt angreifendes Verhalten. Die ursprüngliche Kontrollstudie nutzte Programmieraufgaben und prüfte, wie ein weiteres Modell nicht vertrauenswürdigen Code kontrolliert oder überarbeitet. [1]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Wie das zur Karte passt

Kartenkontext: Verbindet Berechtigungen, Überwachung und Prüfung mit Schutzmaßnahmen rund um eingesetzte Software. [3]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Diese Seite teilen

https://theaiatlas.org/ideas/ai-control/

Bild zum Teilen herunterladen · Vektorgrafik

Vorschaubilder sind Zusammenfassungen. Teile den Seitenlink mit, damit andere die Belege prüfen können.

Quellen und Umfang unserer Lektüre

  1. 1. AI Control: Improving Safety Despite Intentional Subversion

    Die Quelle ist über 18 Monate alt.

    Veröffentlichungsdaten und Alter der Quellen

    Anzahl der Quellen: 1

    Neueste datierte Quelle: 2023-12-12

    Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.

    Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.

    Zusammenfassung, Einleitung und Abschnitte 5.1.2 und 5.2 gelesen. Experimente mit Programmieraufgaben, bei denen ein Modell die menschliche Prüfung simulierte. Kontrolle wird nicht als gelöst dargestellt.

  2. 2. Adaptive Attacks on Trusted Monitors Subvert AI Control Protocols

    Veröffentlichungsdaten und Alter der Quellen

    Anzahl der Quellen: 1

    Neueste datierte Quelle: 2025-10-10

    Mindestens eine Quelle wurde innerhalb des 18-Monats-Zeitraums veröffentlicht.

    Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.

    Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.

    Zusammenfassung und Versionsverlauf gelesen. Berichtet Prompt-Injection-Angriffe auf überwachende Modelle in zwei Kontrollbenchmarks. Die Ergebnisse betreffen geprüfte Verfahren, nicht jede mögliche Schutzmaßnahme.

  3. 3. Prioritizing threats for AI control

    Veröffentlichungsdaten und Alter der Quellen

    Anzahl der Quellen: 1

    Neueste datierte Quelle: 2025-03-19

    Mindestens eine Quelle wurde innerhalb des 18-Monats-Zeitraums veröffentlicht.

    Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.

    Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.

    Vorgeschlagene Bedrohungskategorien, Berechtigungsgrenzen und Erörterung einer blockierenden Prüfung gelesen. Vorausschauende Bedrohungsmodelle und Prioritäten des Autors, keine beobachteten Katastrophen.

Ausgabe und maschinenlesbare Belege

Inhaltsversion 0.20.0. Quellenstichtag 2026-09-15; das bedeutet nicht, dass jede Quelle an diesem Tag gelesen wurde.

Festgehaltenes vollständiges Datenpaket · Vollständige Quellennotizen · Anleitung für KI-Agenten