NLP: Sprachverarbeitung

Akademie

NLP: Sprachverarbeitung

Wie Computer geschriebene und gesprochene Sprache verarbeiten: von der klassischen Pipeline bis zu modernen Sprachmodellen.

Die klassische NLP-Pipeline

Begriffe vorab

  • Korpus: eine Sammlung von Texten, die als Datengrundlage dient.
  • Vokabular: die Menge aller unterschiedlichen Tokens eines Korpus.
  • Stoppwort: sehr häufiges Wort wie „der“ oder „und“ mit wenig Aussagekraft.

Vom Text zu verarbeitbaren Einheiten

Natural Language Processing (NLP) ist das Teilgebiet der KI, das sich mit dem Verstehen und Erzeugen menschlicher Sprache befasst. Bevor ein Computer mit Text „etwas anfangen“ kann, muss dieser in einer Reihe von Schritten aufbereitet werden – der klassischen NLP-Pipeline.

Tokenisierung

Tokenisierung zerlegt einen Text in kleinere Einheiten, sogenannte Tokens: meist Wörter oder Satzzeichen, bei modernen Sprachmodellen oft auch Wortteile (Subword-Tokens). Schon hier gibt es Tücken: Soll „can’t“ als ein Token oder als „can“ + „’t“ behandelt werden? Verschiedene Sprachen stellen unterschiedliche Anforderungen – im Chinesischen etwa gibt es keine Leerzeichen zwischen Wörtern.

Wortarten-Tagging (POS-Tagging)

Part-of-Speech-Tagging ordnet jedem Token seine grammatische Kategorie zu (Nomen, Verb, Adjektiv …). Das Wort „lieben“ kann je nach Kontext Verb oder (als „das Lieben“) eher nominal gebraucht sein – Tagging-Modelle nutzen den umgebenden Kontext, um solche Fälle aufzulösen.

Lemmatisierung und Stemming

Lemmatisierung führt ein Wort auf seine Grundform zurück (z. B. „gingen“ → „gehen“), unter Berücksichtigung der Wortart und grammatischer Regeln. Das gröbere Stemming schneidet stattdessen nach einfachen Regeln Endungen ab, ohne linguistisches Wissen – schneller, aber ungenauer.

Syntaktisches Parsing

Parsing analysiert die grammatische Struktur eines Satzes, etwa als Abhängigkeitsbaum (Dependency Parsing), der zeigt, welches Wort von welchem anderen grammatisch abhängt – Grundlage z. B. für die Frage, wer in einem Satz eigentlich was tut.

Moderne, auf neuronalen Netzen basierende NLP-Systeme führen viele dieser Schritte implizit innerhalb des Modells aus, statt sie als getrennte Pipeline-Stufen zu benötigen. Die Konzepte bleiben aber wichtig, um zu verstehen, welche Information ein System über Sprache überhaupt „sehen“ kann.

Ein durchgespieltes Beispiel

Der Satz „Die Kinder spielten im Garten.“ wird zuerst in Tokens zerlegt: Die | Kinder | spielten | im | Garten | Punkt. Das POS-Tagging ordnet zu: Artikel, Nomen, Verb, Präposition mit Artikel, Nomen. Die Lemmatisierung führt „spielten“ auf „spielen“ und „Kinder“ auf „Kind“ zurück. Das Parsing erkennt „Kinder“ als Subjekt von „spielten“. Jeder Schritt liefert dem nächsten Informationen.

Sprachen unterscheiden sich

Deutsch bildet lange Zusammensetzungen („Donaudampfschifffahrtsgesellschaft“), die sich als Ganzes schlecht zuordnen lassen. Türkisch hängt viele Endungen an ein Wort an. Chinesisch hat keine Leerzeichen zwischen Wörtern. Deshalb braucht jede Sprache angepasste Tokenisierung und Regeln; ein Werkzeug für Englisch lässt sich nicht einfach übertragen.

Fehler pflanzen sich fort

Macht der Tokenizer einen Fehler, leiden alle folgenden Schritte. Deshalb sind Stufenmodelle anfällig, und deshalb setzen moderne Systeme auf gemeinsam trainierte Modelle, die solche Schritte implizit mitlernen.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Dan Jurafsky, James H. Martin – „Speech and Language Processing“ (Standardlehrbuch der Computerlinguistik) (allgemeine Referenz, nicht Zeile für Zeile geprüft)
  • spaCy- und NLTK-Dokumentation – praktische Referenzen für Tokenisierung, POS-Tagging und Parsing (allgemeine Referenz, nicht Zeile für Zeile geprüft)

Evaluation in der NLP: BLEU, ROUGE, Perplexity

Begriffe vorab

  • Referenz: eine von Menschen erstellte Musterlösung.
  • n-Gramm-Überlappung: Anteil gemeinsamer Wortfolgen zwischen zwei Texten.
  • Human Evaluation: Bewertung durch Menschen, etwa nach Flüssigkeit und Korrektheit.

Warum eigene Metriken nötig sind

Menschliche Bewertung von Sprachausgaben (Übersetzungen, Zusammenfassungen) ist aussagekräftig, aber langsam und teuer, wenn Modelle während der Entwicklung ständig neu bewertet werden müssen. Automatische Metriken versuchen, diese Bewertung näherungsweise, aber schnell und reproduzierbar zu ersetzen.

BLEU (maschinelle Übersetzung)

BLEU (Bilingual Evaluation Understudy), vorgestellt von Papineni et al. (ACL, 2002), vergleicht eine maschinell erzeugte Übersetzung mit einer oder mehreren menschlichen Referenzübersetzungen, indem es überlappende Wortfolgen (n-Gramme, meist bis zu 4 Wörtern) zählt, ergänzt um eine Straffunktion für zu kurze Übersetzungen (Brevity Penalty). BLEU korreliert oft, aber nicht immer zuverlässig mit menschlichem Urteil.

ROUGE (Zusammenfassung)

ROUGE (Recall-Oriented Understudy for Gisting Evaluation), von Chin-Yew Lin (2004) vorgestellt, misst analog die Überlappung zwischen einer automatisch erzeugten und menschlichen Referenz-Zusammenfassungen – mit mehreren Varianten wie ROUGE-N (n-Gramm-Überlappung) und ROUGE-L (längste gemeinsame Teilsequenz).

Perplexity (Sprachmodelle)

Perplexity misst, wie „überrascht“ ein Sprachmodell von einem gegebenen Testtext ist – formal aus der Wahrscheinlichkeit berechnet, die das Modell dem Text zuweist. Eine niedrigere Perplexity bedeutet, dass das Modell den Text besser vorhersagen konnte. Perplexity bewertet aber nur die reine Sprachmodellierung, nicht, ob eine konkrete Ausgabe inhaltlich sinnvoll oder korrekt ist.

Klassifikationsmetriken

Für Aufgaben wie NER oder Sentiment-Klassifikation kommen dieselben Metriken zum Einsatz wie beim überwachten Lernen allgemein: Precision, Recall und F1-Score (siehe das Lernpaket „Maschinelles Lernen“).

Automatische Metriken wie BLEU und ROUGE messen Textüberlappung, nicht Bedeutung. Zwei inhaltlich gleichwertige, aber anders formulierte Übersetzungen können sehr unterschiedliche Werte erhalten – Metriken ersetzen menschliche Bewertung deshalb nicht vollständig.

Ein Beispiel, warum Überlappung täuscht

Referenz: „Das Haus ist sehr groß.“ System A: „Das Haus ist riesig.“ System B: „Haus das sehr groß ist.“ Überlappungsmetriken bewerten B wegen der vielen gemeinsamen Wörter möglicherweise höher, obwohl A sprachlich und inhaltlich besser ist. Deshalb werden sie nie allein genutzt.

Metriken sinnvoll einsetzen

  • Automatische Metriken eignen sich zum schnellen Vergleichen von Versionen desselben Systems.
  • Für Endurteile sind Stichproben durch Menschen nötig.
  • Mehrere Referenzen verbessern die Aussagekraft.

Neuere Ansätze

Weil Überlappung Bedeutung kaum erfasst, wurden Metriken entwickelt, die Bedeutungsähnlichkeit über Embeddings schätzen. Auch große Sprachmodelle werden als Bewerter eingesetzt; deren Urteile müssen ihrerseits gegen menschliche Bewertung geprüft werden.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Papineni, Roukos, Ward, Zhu – „BLEU: a Method for Automatic Evaluation of Machine Translation“ (ACL, 2002)
  • Chin-Yew Lin – „ROUGE: A Package for Automatic Evaluation of Summaries“ (ACL-Workshop, 2004)
  • Dan Jurafsky, James H. Martin – „Speech and Language Processing“, Kapitel zu Sprachmodell-Evaluation (allgemeine Referenz, nicht Zeile für Zeile geprüft)

Herausforderungen: Mehrsprachigkeit, Ambiguität, Halluzination, Bias

Begriffe vorab

  • Domänenwechsel: ein Modell wird in einem anderen Fachgebiet eingesetzt als dem, in dem es trainiert wurde.
  • Grounding: Antworten an überprüfbare Quellen binden.
  • Code-Switching: das Wechseln zwischen Sprachen innerhalb eines Textes.

Mehrsprachigkeit

Die meisten frühen NLP-Fortschritte konzentrierten sich auf Englisch; für Sprachen mit weniger digital verfügbaren Trainingsdaten (Low-Resource-Sprachen) fällt die Qualität oft deutlich ab. Mehrsprachige Modelle, die viele Sprachen gemeinsam trainieren, verringern diese Lücke teilweise, beheben sie aber nicht vollständig.

Ambiguität

Sprache ist von Natur aus mehrdeutig. Lexikalische Ambiguität („Der Schlüssel liegt auf dem Tisch“ – Werkzeug oder Lösung?) und syntaktische Ambiguität (wer tut in einem Satz mit mehreren möglichen Lesarten eigentlich was?) müssen durch Kontext aufgelöst werden – für Menschen meist mühelos, für Systeme eine ständige Fehlerquelle.

Halluzination

Generative Sprachmodelle können sprachlich flüssige, aber sachlich falsche oder erfundene Aussagen produzieren – etwa nicht existierende Quellenangaben oder falsche Zahlen. Das Modell optimiert primär plausibel wirkenden Text, nicht garantiert wahre Aussagen; Faktizität ist kein eingebautes Ziel des Trainingsverfahrens.

Bias in Sprachmodellen

Trainingsdaten spiegeln gesellschaftliche Verzerrungen wider. Bekannt geworden sind etwa Studien zu Geschlechter-Stereotypen in Word Embeddings (z. B. Assoziationen zwischen bestimmten Berufen und einem Geschlecht) und zu rassistischen oder diskriminierenden Mustern in generierten Texten. Solcher Bias entsteht nicht durch böswillige Absicht, sondern spiegelt die Häufigkeitsverteilungen in den Trainingsdaten.

Ein praktischer Umgang mit Halluzinationen: Sprachmodelle wo möglich mit tatsächlichen Quellen verknüpfen (Retrieval-Augmented Generation), Aussagen gegenprüfen lassen und Nutzende explizit darauf hinweisen, Fakten zu verifizieren, statt Modellaussagen blind zu vertrauen.

Ein Beispiel für Ambiguität

„Ich sah den Mann mit dem Fernglas“ kann heißen, dass ich ein Fernglas benutzte oder dass der Mann eines hatte. Menschen nutzen Kontext und Weltwissen; Systeme müssen beides erst lernen. Je weniger Kontext, desto größer das Risiko einer Fehldeutung.

Domänenwechsel

Ein Modell, das an Nachrichtentexten gelernt hat, versteht medizinische Fachsprache oder Jugendsprache schlechter. Für kritische Anwendungen lohnt sich Test und Nachtraining mit Texten der tatsächlichen Anwendungsdomäne.

Umgang mit Unsicherheit

  • Antworten mit Quellen belegen, wo Faktentreue zählt.
  • Das System darf offen sagen, wenn es eine Frage nicht zuverlässig beantworten kann.
  • Kritische Ausgaben werden von Menschen geprüft.
  • Vor dem Einsatz auf Bias und Fairness testen, insbesondere bei Entscheidungen über Personen.

Zum Selbermachen: Grenzen testen

  1. Gib einem Sprachmodell einen mehrdeutigen Satz und bitte um die möglichen Deutungen.
  2. Stelle dieselbe Frage in zwei Sprachen und vergleiche die Qualität.
  3. Frage nach einer Quelle zu einer Behauptung und prüfe sie.
  4. Teste, ob das Modell bei fehlenden Informationen nachfragt oder rät.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Dan Jurafsky, James H. Martin – „Speech and Language Processing“, Kapitel zu Bias und Fairness in NLP (allgemeine Referenz, nicht Zeile für Zeile geprüft)
  • Bolukbasi et al. – „Man is to Computer Programmer as Woman is to Homemaker? Debiasing Word Embeddings“ (NeurIPS, 2016)

Klassische Sprachmodelle: n-Gramme und RNNs

Begriffe vorab

  • Kontextfenster (n-Gramm): die feste Anzahl vorangehender Wörter, die das Modell berücksichtigt.
  • Glättung: Verfahren, die nie gesehenen Wortfolgen eine kleine Wahrscheinlichkeit statt null geben.
  • Hidden State: der interne Zustand eines RNN.

Was ist ein Sprachmodell?

Ein Sprachmodell schätzt, wie wahrscheinlich eine bestimmte Wortfolge ist – oder, äquivalent, wie wahrscheinlich das nächste Wort ist, gegeben die vorherigen. Das ist die Grundlage für Aufgaben wie Texterzeugung, Rechtschreibkorrektur oder Spracherkennung.

n-Gramm-Modelle

Ein n-Gramm-Modell schätzt die Wahrscheinlichkeit eines Wortes allein aus den n−1 vorhergehenden Wörtern, basierend auf Häufigkeiten in einem Trainingskorpus. Ein Bigramm-Modell (n=2) betrachtet nur das jeweils vorherige Wort. Der Vorteil ist Einfachheit und Effizienz; der Nachteil: Mit wachsendem n wächst die Zahl möglicher Wortfolgen explosionsartig, und die meisten längeren Folgen kommen im Trainingskorpus nie vor (Datensparsität). Zudem berücksichtigt ein n-Gramm-Modell per Definition nie mehr als n−1 Wörter Kontext.

Rekurrente neuronale Netze (RNNs)

RNNs verarbeiten eine Wortfolge Schritt für Schritt und halten dabei einen internen Zustand, der Information über alle vorherigen Wörter zusammenfasst – im Prinzip unbegrenzt viel Kontext, anders als ein festes n-Gramm-Fenster. In der Praxis „vergessen“ einfache RNNs aber Information aus weiter zurückliegenden Wörtern zunehmend (verschwindender Gradient).

LSTM: das Gedächtnisproblem entschärfen

LSTM-Netze (Long Short-Term Memory) ergänzen RNNs um steuerbare „Gatter“, die gezielt entscheiden, welche Information im internen Zustand behalten, überschrieben oder weitergegeben wird. Das erlaubt es, relevante Information über deutlich längere Sequenzen hinweg zu erhalten als bei einfachen RNNs.

Der historische Weg lässt sich so zusammenfassen: n-Gramme (fester, kurzer Kontext, aber einfach) → RNN/LSTM (variable Länge, aber sequenziell und damit langsam zu trainieren) → Transformer (siehe nächste Lektion), die beide Probleme zugleich adressieren.

Ein Beispiel für ein Bigramm-Modell

In einem Korpus folgt auf „guten“ in 50 Fällen „Morgen“, in 30 Fällen „Tag“ und in 20 Fällen „Abend“. Das Modell schätzt daraus für das Wort nach „guten“ Wahrscheinlichkeiten von 50 %, 30 % und 20 %. Es kann damit Text erzeugen und Wortfolgen bewerten, weiß aber nichts über Bedeutung oder weiter zurückliegenden Text.

Warum Glättung nötig ist

Kommt eine Wortfolge im Trainingskorpus nie vor, hätte sie Wahrscheinlichkeit null – und damit auch jeder Satz, der sie enthält. Glättungsverfahren verteilen einen kleinen Teil der Wahrscheinlichkeit auf ungesehene Folgen, damit das Modell nicht an jeder Lücke scheitert.

Die Grenzen, die zum nächsten Schritt führten

  • n-Gramme sehen nur wenige Wörter zurück, und die Zahl möglicher Folgen explodiert mit n.
  • RNNs lesen Wort für Wort und lassen sich deshalb schlecht parallel trainieren.
  • Auch LSTMs haben Mühe, sehr lange Abhängigkeiten zu bewahren.

Genau diese Schwächen adressiert die Transformer-Architektur.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind. Die Häufigkeiten im Bigramm-Beispiel (50/30/20 %) sind erfunden und dienen nur der Veranschaulichung.

Quellen

  • Dan Jurafsky, James H. Martin – „Speech and Language Processing“, Kapitel zu n-Gramm-Sprachmodellen (allgemeine Referenz, nicht Zeile für Zeile geprüft)
  • Sepp Hochreiter, Jürgen Schmidhuber – „Long Short-Term Memory“ (Neural Computation, 1997)

NLP-Aufgaben: NER, Sentiment, Übersetzung, Frage-Antwort

Begriffe vorab

  • Annotation: das Kennzeichnen von Texten mit der gewünschten Antwort durch Menschen.
  • Klassifikation: Zuordnung zu einer Kategorie.
  • Sequenzmarkierung: jedem Token eine Kategorie zuweisen, wie bei NER.

Named Entity Recognition (NER)

NER erkennt und klassifiziert benannte Entitäten in einem Text, etwa Personen, Organisationen, Orte oder Daten – wichtig z. B., um aus Nachrichtenartikeln automatisch strukturierte Information zu extrahieren.

Sentiment-Analyse

Sentiment-Analyse schätzt die emotionale Ausrichtung eines Textes, oft als positiv/negativ/neutral oder als feinere Skala. Sie wird u. a. zur automatisierten Auswertung von Produktbewertungen oder Social-Media-Beiträgen eingesetzt. Herausfordernd sind Ironie, Sarkasmus und Verneinungen, die die tatsächliche Stimmung gegenüber der wörtlichen Bedeutung umkehren können.

Maschinelle Übersetzung

Frühe Systeme nutzten regelbasierte oder statistische Verfahren; moderne neuronale maschinelle Übersetzung (NMT) setzt auf Encoder-Decoder-Architekturen (häufig Transformer-basiert), die einen Satz in der Ausgangssprache zunächst in eine interne Repräsentation kodieren und daraus dann den Zieltext erzeugen.

Frage-Antwort-Systeme und Zusammenfassung

Question Answering (QA) liefert zu einer Frage eine Antwort, entweder durch Extraktion einer Textstelle aus einem gegebenen Dokument (extraktives QA) oder durch freie Formulierung (generatives QA). Automatische Textzusammenfassung unterscheidet analog zwischen extraktiven Verfahren, die vorhandene Sätze auswählen und zusammenstellen, und abstraktiven Verfahren, die neue, kürzere Formulierungen generieren.

Viele dieser Aufgaben werden heute von einem einzigen, vielseitigen vortrainierten Sprachmodell übernommen, statt von separaten, aufgabenspezifisch trainierten Systemen – ein direkter Effekt des Pretraining/Fine-Tuning-Musters aus der vorigen Lektion.

Ein Beispiel für NER

Im Satz „Anna Schmidt reiste am 3. Mai nach Wien“ markiert ein NER-System „Anna Schmidt“ als Person, „3. Mai“ als Datum und „Wien“ als Ort. Daraus lassen sich Datenbankeinträge erzeugen, etwa aus Pressemitteilungen automatisch Veranstaltungen extrahieren.

Wie sich Aufgaben unterscheiden

  • Klassifikation: ein Label pro Text (Sentiment, Thema).
  • Sequenzmarkierung: ein Label pro Token (NER, POS).
  • Generierung: Text als Ausgabe (Übersetzung, Zusammenfassung, Antwort).

Woran es in der Praxis hängt

Für überwachte Aufgaben braucht man annotierte Daten, und Annotation ist teuer und nicht immer eindeutig: Zwei Personen können denselben Satz unterschiedlich bewerten. Große Sprachmodelle können viele Aufgaben mit wenigen Beispielen im Prompt erledigen, ersetzen aber nicht die Prüfung auf echten Daten.

Zum Selbermachen: eine Aufgabe zuordnen

  1. Nimm fünf Anwendungen aus dem Alltag (Spam-Filter, Übersetzungs-App, Sprachassistent, Suchmaschine, Rechtschreibprüfung).
  2. Ordne jede einer der Aufgabentypen zu: Klassifikation, Sequenzmarkierung oder Generierung.
  3. Überlege, welche Annotation du für das Training bräuchtest.
  4. Beurteile, wo ein Fehler besonders folgenreich wäre.

Wie man die richtige Aufgabe wählt

Am Anfang steht die Frage, welche Entscheidung oder Handlung die Ausgabe unterstützen soll. Eine Kundenservice-Abteilung möchte Anfragen automatisch an das passende Team leiten – das ist Klassifikation. Eine Rechtsabteilung möchte Vertragsparteien und Fristen extrahieren – das ist Sequenzmarkierung. Eine Redaktion möchte Entwürfe – das ist Generierung. Die Aufgabe bestimmt Daten, Metrik und Risiken.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Dan Jurafsky, James H. Martin – „Speech and Language Processing“, Kapitel zu Information Extraction, maschineller Übersetzung und Frage-Antwort-Systemen (allgemeine Referenz, nicht Zeile für Zeile geprüft)

Transformer-Sprachmodelle: BERT, GPT und Pretraining

Begriffe vorab

  • Encoder: Teil, der Eingabetext in Repräsentationen übersetzt.
  • Decoder: Teil, der daraus Ausgabetext erzeugt.
  • Parameter: die lernbaren Zahlenwerte eines Modells.
  • Autoregressiv: jedes neue Token hängt von den vorher erzeugten ab.

Der Durchbruch durch Attention

Die 2017 vorgestellte Transformer-Architektur (Vaswani et al., „Attention Is All You Need“) verarbeitet eine Wortfolge nicht mehr sequenziell wie ein RNN, sondern nutzt einen Attention-Mechanismus, der für jedes Wort direkt berechnet, wie relevant jedes andere Wort der Eingabe für es ist – unabhängig vom Abstand. Das lässt sich zudem stark parallelisieren, was das Training auf großen Datenmengen praktikabel macht.

Zwei Grundfamilien

  • BERT (Bidirectional Encoder Representations from Transformers), vorgestellt von Devlin et al. (Google, 2018/2019), liest einen Satz in beide Richtungen gleichzeitig und wird u. a. darauf trainiert, zufällig ausgeblendete Wörter aus ihrem Kontext zu erraten (Masked Language Modeling). Das macht BERT gut geeignet, um Text zu verstehen, etwa für Klassifikation oder Frage-Antwort-Aufgaben.
  • GPT (Generative Pre-trained Transformer), eingeführt von Radford et al. (OpenAI, 2018), liest nur von links nach rechts und wird darauf trainiert, jeweils das nächste Wort vorherzusagen. Das macht die GPT-Familie besonders geeignet, um Text zu erzeugen.

Pretraining und Fine-Tuning

Beide Ansätze folgen demselben zweistufigen Muster: Im Pretraining lernt das Modell auf riesigen, unbeschrifteten Textmengen allgemeine Sprachmuster (z. B. Grammatik, Weltwissen, Stil). Im anschließenden Fine-Tuning wird dasselbe Modell mit vergleichsweise wenigen, aufgabenspezifischen Beispielen weiter angepasst, etwa für Sentiment-Klassifikation oder einen bestimmten Frage-Antwort-Stil. Dieses Muster – einmal teuer vortrainieren, dann günstig anpassen – ist die Grundlage fast aller heutigen großen Sprachmodelle.

Skalierung

Spätere GPT-Modelle zeigten, dass viele Fähigkeiten mit wachsender Modellgröße, Trainingsdatenmenge und Rechenaufwand zunehmen, teils sprunghaft bei bestimmten Aufgaben – ein Muster, das in der Forschung als Skalierungsgesetze bzw. teils als emergente Fähigkeiten diskutiert wird.

„Größer“ bedeutet nicht automatisch „besser für jede Aufgabe“ – die konkrete Trainingsdatenauswahl, Feinjustierung (etwa per RLHF, siehe das Paket zu KI-Sicherheit/Alignment) und Aufgabenstellung beeinflussen die tatsächliche Nützlichkeit oft stärker als die reine Parameteranzahl.

Ein Beispiel für Attention

Im Satz „Die Katze jagte die Maus, weil sie hungrig war“ muss das Modell klären, worauf sich „sie“ bezieht. Attention erlaubt es, für dieses Wort die Relevanz aller anderen Wörter zu berechnen und so die wahrscheinlichste Zuordnung zu finden – unabhängig davon, wie weit sie entfernt sind.

Drei Bauformen

  • Nur Encoder (Beispiel BERT): stark im Verstehen und Klassifizieren.
  • Nur Decoder (Beispiel GPT): stark im Erzeugen von Text.
  • Encoder-Decoder: häufig bei Übersetzung und Zusammenfassung.

Nach dem Pretraining

Ein vortrainiertes Modell setzt Text zunächst nur fort. Durch zusätzliches Training mit Anweisungsbeispielen und Feedback wird es zum Assistenten, der Fragen beantwortet. Diese Schritte sind nicht Teil des Transformers selbst, sondern des Trainingsverfahrens darum herum.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Vaswani et al. – „Attention Is All You Need“ (NeurIPS, 2017)
  • Devlin, Chang, Lee, Toutanova – „BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding“ (NAACL, 2019)
  • Radford et al. – „Improving Language Understanding by Generative Pre-Training“ (OpenAI, 2018)

Wortrepräsentationen: von Bag-of-Words zu Word Embeddings

Begriffe vorab

  • Vektor: eine Liste von Zahlen, die einen Punkt im Raum beschreibt.
  • Dimension: eine Zahl in diesem Vektor.
  • Kosinus-Ähnlichkeit: Maß, wie ähnlich die Richtung zweier Vektoren ist.

Wie wird Text zu Zahlen?

Maschinelle Modelle rechnen mit Zahlen, nicht mit Wörtern. Wortrepräsentationen übersetzen Text in numerische Form – die Wahl der Methode prägt, welche Information dem Modell überhaupt zur Verfügung steht.

Bag-of-Words und TF-IDF

Das Bag-of-Words-Modell stellt einen Text als Vektor dar, der zählt, wie oft jedes Wort aus einem Vokabular vorkommt – die Wortreihenfolge geht dabei komplett verloren. TF-IDF (Term Frequency – Inverse Document Frequency) gewichtet diese Zählung zusätzlich: Wörter, die in vielen Dokumenten vorkommen (z. B. „der“, „die“, „und“), werden abgewertet, seltene, dokumentspezifische Wörter stärker gewichtet.

Das Problem der Sparsity

Bag-of-Words-Vektoren haben so viele Dimensionen wie das Vokabular Wörter enthält – bei großen Vokabularen zehntausende. Die meisten Einträge sind 0 (dünn besetzt, „sparse“), und ähnliche Wörter wie „Auto“ und „Wagen“ erhalten völlig unabhängige Dimensionen, obwohl sie semantisch verwandt sind.

Word Embeddings

Word Embeddings lösen dieses Problem: Sie bilden jedes Wort auf einen dichten Vektor mit relativ wenigen Dimensionen (oft 100–300) ab, der aus großen Textmengen gelernt wird. Ähnliche Wörter liegen dabei nah beieinander. word2vec (Mikolov et al., 2013) lernt solche Vektoren, indem es vorhersagt, welche Wörter typischerweise in der Nachbarschaft eines gegebenen Wortes stehen. GloVe (Pennington, Socher, Manning, 2014) nutzt stattdessen globale Wort-Kookkurrenz-Statistiken über einen gesamten Korpus.

Eine bekannte Eigenschaft

Word-Embedding-Räume zeigten in frühen Arbeiten oft überraschende lineare Zusammenhänge: Die Vektor-Rechnung „König“ − „Mann“ + „Frau“ ergibt einen Vektor nahe an „Königin“. Das illustriert, dass die gelernten Dimensionen tatsächlich etwas über Bedeutungsbeziehungen zwischen Wörtern einfangen.

Word Embeddings übernehmen auch Verzerrungen (Bias) aus ihren Trainingsdaten, etwa stereotype Geschlechterassoziationen bei Berufsbezeichnungen. Dieses Problem wird in der Lektion zu Herausforderungen vertieft.

Ein Beispiel für Ähnlichkeit

Bei Bag-of-Words sind „Auto“ und „Wagen“ völlig unterschiedliche Spalten; das Modell weiß nicht, dass sie Ähnliches meinen. In einem gelernten Embedding liegen beide nahe beieinander, weil sie in ähnlichen Kontexten vorkommen („das Auto fährt“, „der Wagen fährt“). Ähnlichkeit wird dort als Nähe der Vektoren messbar, zum Beispiel über die Kosinus-Ähnlichkeit.

Die Idee dahinter

Die Verteilungshypothese besagt: Wörter mit ähnlichem Kontext haben ähnliche Bedeutung. Embeddings nutzen genau das. Sie lernen Bedeutung nicht aus Wörterbüchern, sondern aus der Umgebung, in der Wörter vorkommen.

Grenzen statischer Embeddings

  • Ein Wort hat nur einen Vektor, auch wenn es mehrere Bedeutungen hat („Bank“ als Sitzgelegenheit oder Geldinstitut).
  • Sie übernehmen Verzerrungen der Trainingstexte.
  • Seltene Wörter werden schlecht abgebildet.

Moderne Sprachmodelle erzeugen deshalb kontextabhängige Vektoren: Dasselbe Wort bekommt je nach Satz einen anderen Vektor.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Mikolov, Chen, Corrado, Dean – „Efficient Estimation of Word Representations in Vector Space“ (2013, word2vec)
  • Pennington, Socher, Manning – „GloVe: Global Vectors for Word Representation“ (EMNLP, 2014)
  • Dan Jurafsky, James H. Martin – „Speech and Language Processing“, Kapitel zu Vektorsemantik (allgemeine Referenz, nicht Zeile für Zeile geprüft)