Ein Wegweiser durch KI-Positionen

Red Teaming / gezielte Fehlersuche

Die Quelle ist über 18 Monate alt.

Veröffentlichungsdaten und Alter der Quellen

Anzahl der Quellen: 1

Neueste datierte Quelle: 2022-02-07

Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.

Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.

Im Glossar öffnen Lesenotizen · Strukturierter Dateneintrag

Einfach erklärt

Ein System gezielt auf schädliches oder unerwünschtes Verhalten prüfen, damit Schwächen untersucht und behoben werden können. [1]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Grenzen und Unterschiede

Ein gefundener Fehler misst nicht, wie oft er im Alltag auftritt. Wenn keine Fehler gefunden werden, ist damit nicht jedes schädliche Verhalten ausgeschlossen. [1]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Ausführlicher erklärt

Testende erproben schwierige Fälle statt ausschließlich alltäglicher Anfragen. Menschen können die Tests entwerfen; Modelle können beim Erzeugen möglicher Testfälle helfen. Die zitierte Studie suchte mithilfe eines weiteren Sprachmodells nach problematischen Antworten. [1]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Wie das zur Karte passt

Lesefrage im Atlas: Wer hat das System geprüft, was wurde versucht, und was geschah mit den Ergebnissen? [1]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Diese Seite teilen

https://theaiatlas.org/ideas/red-teaming/

Bild zum Teilen herunterladen · Vektorgrafik

Vorschaubilder sind Zusammenfassungen. Teile den Seitenlink mit, damit andere die Belege prüfen können.

Quellen und Umfang unserer Lektüre

  1. 1. Red Teaming Language Models with Language Models

    Die Quelle ist über 18 Monate alt.

    Veröffentlichungsdaten und Alter der Quellen

    Anzahl der Quellen: 1

    Neueste datierte Quelle: 2022-02-07

    Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.

    Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.

    Zusammenfassung und Einreichungsangaben sowie die Forschungszusammenfassung der Autoren bei DeepMind gelesen. Die Arbeit untersucht automatisch erzeugte Tests und stellt sie als eine von mehreren Methoden vor, nicht als vollständige Sicherheitsprüfung.

Ausgabe und maschinenlesbare Belege

Inhaltsversion 0.20.0. Quellenstichtag 2026-09-15; das bedeutet nicht, dass jede Quelle an diesem Tag gelesen wurde.

Festgehaltenes vollständiges Datenpaket · Vollständige Quellennotizen · Anleitung für KI-Agenten