Ein Wegweiser durch KI-Positionen

Transformer und Attention

Veröffentlichungsdaten und Alter der Quellen

Anzahl der Quellen: 4

Neueste datierte Quelle: 2025-07-31

Mindestens eine Quelle wurde innerhalb des 18-Monats-Zeitraums veröffentlicht.

Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.

Einige Veröffentlichungsdaten fehlen. Die neueste datierte Quelle ist daher nicht unbedingt die neueste Quelle insgesamt.

Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.

Im Glossar öffnen Lesenotizen · Strukturierter Dateneintrag

Einfach erklärt

Ein Aufbau für neuronale Netze, der Attention nutzt, um Informationen aus verschiedenen Teilen der Eingabe zu verbinden. [1]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Grenzen und Unterschiede

„Attention“, auf Deutsch Aufmerksamkeit, ist hier der Name einer mathematischen Operation. Ein Attention-Diagramm allein erklärt nicht vollständig, warum ein Modell eine bestimmte Antwort gegeben hat. [1] [3] [4]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Ausführlicher erklärt

Attention ist eine Berechnung, die einzelnen Informationen unterschiedlich viel Einfluss gibt. In einem Transformer helfen Schichten solcher Berechnungen dabei, Text in seinem Kontext abzubilden. Die ursprüngliche Transformer-Arbeit stellte den Aufbau unter anderem für Übersetzungsaufgaben vor. [1]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Wie das zur Karte passt

Nützliches Hintergrundwissen zu Erklärungen der LLM-Architektur, also zum Aufbau eines Modells. [2]

Diese Erklärung zitieren oder eine Korrektur vorschlagen

Link zu dieser Erklärung · Korrektur vorschlagen · So funktionieren Korrekturen

Diese Seite teilen

https://theaiatlas.org/ideas/transformer/

Bild zum Teilen herunterladen · Vektorgrafik

Vorschaubilder sind Zusammenfassungen. Teile den Seitenlink mit, damit andere die Belege prüfen können.

Quellen und Umfang unserer Lektüre

  1. 1. Attention Is All You Need

    Die Quelle ist über 18 Monate alt.

    Veröffentlichungsdaten und Alter der Quellen

    Anzahl der Quellen: 1

    Neueste datierte Quelle: 2017-06-12

    Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.

    Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.

    Kurzfassung, Modellarchitektur, gelernte Einbettungen und Wahrscheinlichkeiten des nächsten Tokens wurden im HTML-Artikel gelesen; Veröffentlichungs- und Überarbeitungsdaten wurden mit der arXiv-Kurzfassungsseite abgeglichen. Beschrieben ist die ursprüngliche Transformer-Architektur, nicht die Behauptung, jedes heutige LLM habe genau diesen Aufbau.

  2. 2. LLMs: What's a large language model?

    Veröffentlichungsdaten und Alter der Quellen

    Anzahl der Quellen: 1

    Die Veröffentlichungsdaten sind nicht bekannt.

    Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.

    Einige Veröffentlichungsdaten fehlen. Die neueste datierte Quelle ist daher nicht unbedingt die neueste Quelle insgesamt.

    Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.

    Tokenvorhersage, reine Encoder- und Decoder-Varianten sowie Selbstaufmerksamkeit wurden gelesen. Verwendet für Architektur und Begriffe; allgemeine Leistungsvergleiche und Aussagen über alle LLMs auf der Lehrseite werden nicht übernommen.

  3. 3. Circuit Tracing: Revealing Computational Graphs in Language Models

    Veröffentlichungsdaten und Alter der Quellen

    Anzahl der Quellen: 1

    Neueste datierte Quelle: 2025-03-27

    Mindestens eine Quelle wurde innerhalb des 18-Monats-Zeitraums veröffentlicht.

    Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.

    Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.

    Einleitung, Methodenüberblick und Einschränkungen wurden gelesen, darunter Rekonstruktionsfehler, komplexe Graphen, globale Schaltkreise und die Genauigkeit der mechanistischen Erklärung. Die Ersatzmodell-Analysen der Autoren zeigen ausgewählte Mechanismen; sie erklären nicht das gesamte Verhalten vollständig. Spätere Forschung zur Nachverfolgung von Aufmerksamkeit wird daneben zitiert, damit die hier fehlende Aufmerksamkeitserfassung nicht als dauerhafte Grenze des gesamten Forschungsfelds erscheint.

  4. 4. Tracing Attention Computation Through Feature Interactions

    Veröffentlichungsdaten und Alter der Quellen

    Anzahl der Quellen: 1

    Neueste datierte Quelle: 2025-07-31

    Mindestens eine Quelle wurde innerhalb des 18-Monats-Zeitraums veröffentlicht.

    Bewertet zum Quellenstichtag dieser Ausgabe: 2026-09-15. Grenze von 18 Monaten: 2025-03-15.

    Das Alter einer Veröffentlichung sagt nicht, ob eine Aussage noch zutrifft. Erneutes Lesen macht eine alte Veröffentlichung nicht neuer. Ein Aktualisierungsdatum belegt nicht, dass auch die von uns verwendete Passage überarbeitet wurde.

    Der direkte Abruf mit dem Browserwerkzeug scheiterte; das ursprüngliche HTML des Herausgebers wurde erfolgreich abgerufen. Gelesen wurden Einleitung, Zusammenfassungen der Fallstudien, QK-Zuordnungsmethode, die Einschränkung bei hemmenden Effekten und Abwägungen beim Aufbau der Graphen. Erweitert frühere Zuordnungsgraphen um Aufmerksamkeit; die Ergebnisse sind ausgewählte Studien mit offenen Fragen, keine vollständige Modellerklärung.

Ausgabe und maschinenlesbare Belege

Inhaltsversion 0.20.0. Quellenstichtag 2026-09-15; das bedeutet nicht, dass jede Quelle an diesem Tag gelesen wurde.

Festgehaltenes vollständiges Datenpaket · Vollständige Quellennotizen · Anleitung für KI-Agenten