Ein Wegweiser durch KI-Positionen

Mesa-Optimierung und inneres Alignment

Die Quelle ist über 18 Monate alt.

Veröffentlichungsdaten und Alter der Quellen

Anzahl der Quellen: 1

Neueste datierte Quelle: 2019-06-05

Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.

Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.

Im Glossar öffnen Lesenotizen · Strukturierter Dateneintrag

Einfach erklärt

Die Möglichkeit, dass eine trainierte KI ein eigenes internes Ziel verfolgt, das von ihrem Trainingsziel abweicht. [1]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Grenzen und Unterschiede

Die Forschungsarbeit untersucht, wann das auftreten könnte. Sie belegt nicht, dass jedes neuronale Netz ein Optimierer ist oder heimlich ein verborgenes Ziel verfolgt. [1]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Ausführlicher erklärt

Durch Training kann ein Modell entstehen, das selbst nach Wegen sucht, ein Ziel zu erreichen. Forschende nennen das Mesa-Optimierung. Weicht sein Ziel von dem ab, was das Trainingsverfahren belohnt hat, entsteht ein Problem des inneren Alignments. [1]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Wie das zur Karte passt

Ein vorgeschlagener Fehlermechanismus für die Sicherheitsforschung, keine gemessene Katastrophenwahrscheinlichkeit. [1]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Diese Seite teilen

https://theaiatlas.org/ideas/mesa/

Bild zum Teilen herunterladen · Vektorgrafik

Vorschaubilder sind Zusammenfassungen. Teile den Seitenlink mit, damit andere die Belege prüfen können.

Quellen und Umfang unserer Lektüre

  1. 1. Risks from Learned Optimization in Advanced Machine Learning Systems

    Die Quelle ist über 18 Monate alt.

    Veröffentlichungsdaten und Alter der Quellen

    Anzahl der Quellen: 1

    Neueste datierte Quelle: 2019-06-05

    Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.

    Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.

    Kurzfassung und Überarbeitungsverlauf wurden gelesen; sie führen Mesa-Optimierung und das Verhältnis zwischen gelernten Zielen und Trainingszielen ein.

Ausgabe und maschinenlesbare Belege

Inhaltsversion 0.20.0. Quellenstichtag 2026-09-15; das bedeutet nicht, dass jede Quelle an diesem Tag gelesen wurde.

Festgehaltenes vollständiges Datenpaket · Vollständige Quellennotizen · Anleitung für KI-Agenten