Ein Wegweiser durch KI-Positionen

Reward Hacking: Belohnungsregeln ausnutzen

Die Quelle ist über 18 Monate alt.

Veröffentlichungsdaten und Alter der Quellen

Anzahl der Quellen: 1

Neueste datierte Quelle: 2016-06-21

Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.

Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.

Im Glossar öffnen Lesenotizen · Strukturierter Dateneintrag

Einfach erklärt

Wenn eine KI eine hohe Punktzahl erzielt, indem sie etwas anderes tut, als ihre Entwickler eigentlich wollten. [1]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Grenzen und Unterschiede

Ein Beispiel für Reward Hacking belegt für sich genommen weder Bewusstsein noch Boshaftigkeit oder ein Aussterbeszenario. [1]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Ausführlicher erklärt

Ein System erreicht nach seiner vorgegebenen Belohnungsregel eine hohe Bewertung, erfüllt aber nicht die Absicht seiner Entwickler. Messgröße und eigentliches Ziel fallen auseinander. [1]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Wie das zur Karte passt

Ein konkreter Grund, Ziele und Verhalten zu testen, auch bei Systemen weit unterhalb einer hypothetischen Superintelligenz. [1]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Diese Seite teilen

https://theaiatlas.org/ideas/reward-hacking/

Bild zum Teilen herunterladen · Vektorgrafik

Vorschaubilder sind Zusammenfassungen. Teile den Seitenlink mit, damit andere die Belege prüfen können.

Quellen und Umfang unserer Lektüre

  1. 1. Concrete Problems in AI Safety

    Die Quelle ist über 18 Monate alt.

    Veröffentlichungsdaten und Alter der Quellen

    Anzahl der Quellen: 1

    Neueste datierte Quelle: 2016-06-21

    Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.

    Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.

    Die fünf Probleme unbeabsichtigter Risiken in der Kurzfassung wurden gelesen, darunter das Ausnutzen von Belohnungsregeln und veränderte Datenverteilungen. Die Quelle nennt keine allgemeine Katastrophenwahrscheinlichkeit.

Ausgabe und maschinenlesbare Belege

Inhaltsversion 0.20.0. Quellenstichtag 2026-09-15; das bedeutet nicht, dass jede Quelle an diesem Tag gelesen wurde.

Festgehaltenes vollständiges Datenpaket · Vollständige Quellennotizen · Anleitung für KI-Agenten