KI-Sicherheit und Alignment
Veröffentlichungsdaten und Alter der Quellen
Anzahl der Quellen: 3
Neueste datierte Quelle: 2025-09-22
Mindestens eine Quelle wurde innerhalb des 18-Monats-Zeitraums veröffentlicht.
Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.
Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.
Im Glossar öffnen Lesenotizen · Strukturierter Dateneintrag
Einfach erklärt
Forschung mit dem Ziel, KI-Schäden zu verringern sowie Verlässlichkeit und Ausrichtung auf vorgesehene Ziele zu verbessern. Ein Sicherheitsziel oder ein Regelwerk beweist nicht, dass ein System sicher ist. [1] [2] [3]
Diese Erklärung zitieren oder eine Korrektur vorschlagen
Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen
Grenzen und Unterschiede
Ein Sicherheitsrahmen hält erklärte Schutzmaßnahmen fest. Er garantiert weder deren sichere Umsetzung noch liefert er eine gemessene Katastrophenwahrscheinlichkeit. [3]
Diese Erklärung zitieren oder eine Korrektur vorschlagen
Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen
Ausführlicher erklärt
Arbeit daran, dass sich KI-Systeme sicher und zuverlässig verhalten. Alignment betrifft das Verhältnis zwischen dem Verhalten eines Systems und beabsichtigten Zielen sowie menschlichen Werten. Die Verringerung katastrophaler Risiken ist ein Schwerpunkt der Sicherheitsarbeit. [1] [2]
Diese Erklärung zitieren oder eine Korrektur vorschlagen
Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen
Wie das zur Karte passt
Weder ein einzelner Akteur noch eine festgelegte Vorliebe beim Tempo. Forschung, Bewertung und Governance können unterschiedliche Entwicklungspolitiken unterstützen. [1] [3]
Diese Erklärung zitieren oder eine Korrektur vorschlagen
Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen
Diese Seite teilen
https://theaiatlas.org/ideas/safety/
Bild zum Teilen herunterladen · Vektorgrafik
Vorschaubilder sind Zusammenfassungen. Teile den Seitenlink mit, damit andere die Belege prüfen können.
Quellen und Umfang unserer Lektüre
1. Concrete Problems in AI Safety
Die Quelle ist über 18 Monate alt.
Veröffentlichungsdaten und Alter der Quellen
Anzahl der Quellen: 1
Neueste datierte Quelle: 2016-06-21
Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.
Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.
Die fünf Probleme unbeabsichtigter Risiken in der Kurzfassung wurden gelesen, darunter das Ausnutzen von Belohnungsregeln und veränderte Datenverteilungen. Die Quelle nennt keine allgemeine Katastrophenwahrscheinlichkeit.
2. Risks from Learned Optimization in Advanced Machine Learning Systems
Die Quelle ist über 18 Monate alt.
Veröffentlichungsdaten und Alter der Quellen
Anzahl der Quellen: 1
Neueste datierte Quelle: 2019-06-05
Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.
Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.
Kurzfassung und Überarbeitungsverlauf wurden gelesen; sie führen Mesa-Optimierung und das Verhältnis zwischen gelernten Zielen und Trainingszielen ein.
3. Strengthening our Frontier Safety Framework
Veröffentlichungsdaten und Alter der Quellen
Anzahl der Quellen: 1
Neueste datierte Quelle: 2025-09-22
Mindestens eine Quelle wurde innerhalb des 18-Monats-Zeitraums veröffentlicht.
Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.
Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.
Der Artikel enthält eine Aktualisierung vom April 2026. Ein veröffentlichtes Rahmenwerk belegt die erklärte Politik, keine Schätzung einer Katastrophenwahrscheinlichkeit.
Ausgabe und maschinenlesbare Belege
Inhaltsversion 0.20.0. Quellenstichtag 2026-09-15; das bedeutet nicht, dass jede Quelle an diesem Tag gelesen wurde.
Festgehaltenes vollständiges Datenpaket · Vollständige Quellennotizen · Anleitung für KI-Agenten