Evaluationen und Benchmarks
Die Quellen sind über 18 Monate alt.
Veröffentlichungsdaten und Alter der Quellen
Anzahl der Quellen: 2
Neueste datierte Quelle: 2024-07
Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.
Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.
Im Glossar öffnen Lesenotizen · Strukturierter Dateneintrag
Einfach erklärt
Tests, mit denen man herausfindet, was ein System gut kann, wo es scheitert und unter welchen Bedingungen. [1]
Diese Erklärung zitieren oder eine Korrektur vorschlagen
Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen
Grenzen und Unterschiede
Ein gutes Ergebnis gilt für die getesteten Bedingungen. Es entscheidet nicht über die Leistung bei jeder Aufgabe und bestätigt nicht die Sicherheit der gesamten Anwendung. [1] [2]
Diese Erklärung zitieren oder eine Korrektur vorschlagen
Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen
Ausführlicher erklärt
Eine Evaluation legt Aufgaben und Verfahren zur Beurteilung der Ergebnisse fest. Ein Benchmark bietet gemeinsame Aufgaben oder Messgrößen zum Vergleich. Verschiedene Tests können Genauigkeit, Beständigkeit, schädliche Ausgaben oder Ressourcenverbrauch untersuchen. [1]
Diese Erklärung zitieren oder eine Korrektur vorschlagen
Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen
Wie das zur Karte passt
Frage bei einem Testergebnis, welche Aufgaben, Modelle, Anweisungen und Messgrößen verglichen wurden. [1]
Diese Erklärung zitieren oder eine Korrektur vorschlagen
Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen
Diese Seite teilen
https://theaiatlas.org/ideas/evaluation/
Bild zum Teilen herunterladen · Vektorgrafik
Vorschaubilder sind Zusammenfassungen. Teile den Seitenlink mit, damit andere die Belege prüfen können.
Quellen und Umfang unserer Lektüre
1. Holistic Evaluation of Language Models
Die Quelle ist über 18 Monate alt.
Veröffentlichungsdaten und Alter der Quellen
Anzahl der Quellen: 1
Neueste datierte Quelle: 2022-11-16
Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.
Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.
Kurzfassung und Versionsverlauf wurden gelesen, darunter mehrere Anwendungsfälle und Maße, standardisierte Vergleiche und eingeräumte Lücken der Abdeckung. Verwendet für Prüfprinzipien; historische Modellwerte werden nicht als aktuelle Rangliste dargestellt.
2. Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile
Die Quelle ist über 18 Monate alt.
Veröffentlichungsdaten und Alter der Quellen
Anzahl der Quellen: 1
Neueste datierte Quelle: 2024-07
Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.
Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.
Einleitung, Abschnitt 2.2 zu erfundenen Angaben und ausgewählte MEASURE-Maßnahmen 2.3, 2.5, 2.6, 2.7 und 2.9 wurden gelesen. Sie betreffen Prüfbelege, Verallgemeinerung, Zitate, Prüfung erzeugten Codes und Schutzmaßnahmen. Ein freiwilliges Risikomanagementprofil; es wird nicht behauptet, dass alle 64 Seiten oder jede zitierte Studie geprüft wurden.
Ausgabe und maschinenlesbare Belege
Inhaltsversion 0.20.0. Quellenstichtag 2026-09-15; das bedeutet nicht, dass jede Quelle an diesem Tag gelesen wurde.
Festgehaltenes vollständiges Datenpaket · Vollständige Quellennotizen · Anleitung für KI-Agenten