Die Transformer-Architektur ist ein neuronales Netzwerk-Design, das ausschließlich auf Attention-Mechanismen statt auf Rekurrenz oder Faltung basiert. Sein zentrales Element ist die Self-Attention: Jedes Token einer Eingabesequenz berechnet aus Querys, Keys und Values eine gewichtete Aggregation aller anderen Tokens. Mehrere parallele "Attention-Heads" lernen unterschiedliche Beziehungen zwischen Tokens; ergänzt um Position Embeddings, Layer Normalization, Feed-Forward-Schichten und Residual-Verbindungen entstehen tiefe, parallel trainierbare Modelle. Varianten reichen von rein dekoderbasierten Architekturen (GPT, Claude, Llama) über reine Encoder (BERT) bis zu Encoder-Decoder-Aufbauten (T5, BART, klassische maschinelle Übersetzung).
Eingesetzt wird die Transformer-Architektur als Grundgerüst nahezu aller modernen Sprach-, Code-, Bild- und multimodalen Modelle. Vision Transformers (ViT) wenden Attention auf Bild-Patches an, Audio-Transformer (z. B. Whisper) auf Spektrogramme, multimodale Modelle (CLIP, Flamingo, Gemini, Claude 3, GPT-4o) verarbeiten gemeinsame Repräsentationen aus Text, Bild und Audio. Kommerzielle und Open-Source-LLMs basieren mit ganz wenigen Ausnahmen auf Transformer-Varianten oder Mixture-of-Experts-Erweiterungen davon.
Rekurrente Netze (RNNs, LSTMs) müssen Tokens sequentiell verarbeiten und sind dadurch schwer skalierbar; ihre Lerndynamik leidet zudem an Vanishing Gradients. Die Self-Attention im Transformer kann alle Token einer Sequenz parallel betrachten und auf moderner GPU-Hardware extrem effizient ausführen. Damit ermöglichte die Architektur das Training mit Milliarden Parametern und Billionen Tokens — eine Voraussetzung für die heutige LLM-Generation.
Historisch wurde die Architektur 2017 in dem Paper "Attention Is All You Need" von Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan Gomez, Łukasz Kaiser und Illia Polosukhin (Google Brain und Google Research) vorgestellt. Wichtige direkte Nachfolger sind BERT (Devlin et al., 2018), GPT-1 bis GPT-4 (OpenAI), T5, Switch Transformer (Mixture-of-Experts), Vision Transformer (Dosovitskiy et al., 2020), Longformer und FlashAttention (Tri Dao, 2022), das die effiziente Berechnung von Attention durch IO-bewusste Algorithmen revolutioniert hat.
Innerhalb weniger Jahre wurden alle dominanten NLP-Architekturen — RNNs, LSTMs, Convolutional Sequence Models — durch Transformer abgelöst. "Attention Is All You Need" gilt heute als eines der einflussreichsten Papiere des Jahrzehnts; mehrere der ursprünglichen Autorinnen und Autoren haben in den Folgejahren eigene KI-Unternehmen gegründet (u. a. Cohere, Adept, Character.AI), was die starke Kapitalisierung dieser Forschungsarbeit unterstreicht.