Transformer-Sprachmodelle: BERT, GPT und Pretraining
Begriffe vorab
- Encoder: Teil, der Eingabetext in Repräsentationen übersetzt.
- Decoder: Teil, der daraus Ausgabetext erzeugt.
- Parameter: die lernbaren Zahlenwerte eines Modells.
- Autoregressiv: jedes neue Token hängt von den vorher erzeugten ab.
Der Durchbruch durch Attention
Die 2017 vorgestellte Transformer-Architektur (Vaswani et al., „Attention Is All You Need“) verarbeitet eine Wortfolge nicht mehr sequenziell wie ein RNN, sondern nutzt einen Attention-Mechanismus, der für jedes Wort direkt berechnet, wie relevant jedes andere Wort der Eingabe für es ist – unabhängig vom Abstand. Das lässt sich zudem stark parallelisieren, was das Training auf großen Datenmengen praktikabel macht.
Zwei Grundfamilien
- BERT (Bidirectional Encoder Representations from Transformers), vorgestellt von Devlin et al. (Google, 2018/2019), liest einen Satz in beide Richtungen gleichzeitig und wird u. a. darauf trainiert, zufällig ausgeblendete Wörter aus ihrem Kontext zu erraten (Masked Language Modeling). Das macht BERT gut geeignet, um Text zu verstehen, etwa für Klassifikation oder Frage-Antwort-Aufgaben.
- GPT (Generative Pre-trained Transformer), eingeführt von Radford et al. (OpenAI, 2018), liest nur von links nach rechts und wird darauf trainiert, jeweils das nächste Wort vorherzusagen. Das macht die GPT-Familie besonders geeignet, um Text zu erzeugen.
Pretraining und Fine-Tuning
Beide Ansätze folgen demselben zweistufigen Muster: Im Pretraining lernt das Modell auf riesigen, unbeschrifteten Textmengen allgemeine Sprachmuster (z. B. Grammatik, Weltwissen, Stil). Im anschließenden Fine-Tuning wird dasselbe Modell mit vergleichsweise wenigen, aufgabenspezifischen Beispielen weiter angepasst, etwa für Sentiment-Klassifikation oder einen bestimmten Frage-Antwort-Stil. Dieses Muster – einmal teuer vortrainieren, dann günstig anpassen – ist die Grundlage fast aller heutigen großen Sprachmodelle.
Skalierung
Spätere GPT-Modelle zeigten, dass viele Fähigkeiten mit wachsender Modellgröße, Trainingsdatenmenge und Rechenaufwand zunehmen, teils sprunghaft bei bestimmten Aufgaben – ein Muster, das in der Forschung als Skalierungsgesetze bzw. teils als emergente Fähigkeiten diskutiert wird.
„Größer“ bedeutet nicht automatisch „besser für jede Aufgabe“ – die konkrete Trainingsdatenauswahl, Feinjustierung (etwa per RLHF, siehe das Paket zu KI-Sicherheit/Alignment) und Aufgabenstellung beeinflussen die tatsächliche Nützlichkeit oft stärker als die reine Parameteranzahl.
Ein Beispiel für Attention
Im Satz „Die Katze jagte die Maus, weil sie hungrig war“ muss das Modell klären, worauf sich „sie“ bezieht. Attention erlaubt es, für dieses Wort die Relevanz aller anderen Wörter zu berechnen und so die wahrscheinlichste Zuordnung zu finden – unabhängig davon, wie weit sie entfernt sind.
Drei Bauformen
- Nur Encoder (Beispiel BERT): stark im Verstehen und Klassifizieren.
- Nur Decoder (Beispiel GPT): stark im Erzeugen von Text.
- Encoder-Decoder: häufig bei Übersetzung und Zusammenfassung.
Nach dem Pretraining
Ein vortrainiertes Modell setzt Text zunächst nur fort. Durch zusätzliches Training mit Anweisungsbeispielen und Feedback wird es zum Assistenten, der Fragen beantwortet. Diese Schritte sind nicht Teil des Transformers selbst, sondern des Trainingsverfahrens darum herum.
Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.
Quellen
- Vaswani et al. – „Attention Is All You Need“ (NeurIPS, 2017)
- Devlin, Chang, Lee, Toutanova – „BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding“ (NAACL, 2019)
- Radford et al. – „Improving Language Understanding by Generative Pre-Training“ (OpenAI, 2018)