Klassische Sprachmodelle: n-Gramme und RNNs

LektionKlassische Sprachmodelleca. 3 Min. Lesezeit

Begriffe vorab

  • Kontextfenster (n-Gramm): die feste Anzahl vorangehender Wörter, die das Modell berücksichtigt.
  • Glättung: Verfahren, die nie gesehenen Wortfolgen eine kleine Wahrscheinlichkeit statt null geben.
  • Hidden State: der interne Zustand eines RNN.

Was ist ein Sprachmodell?

Ein Sprachmodell schätzt, wie wahrscheinlich eine bestimmte Wortfolge ist – oder, äquivalent, wie wahrscheinlich das nächste Wort ist, gegeben die vorherigen. Das ist die Grundlage für Aufgaben wie Texterzeugung, Rechtschreibkorrektur oder Spracherkennung.

n-Gramm-Modelle

Ein n-Gramm-Modell schätzt die Wahrscheinlichkeit eines Wortes allein aus den n−1 vorhergehenden Wörtern, basierend auf Häufigkeiten in einem Trainingskorpus. Ein Bigramm-Modell (n=2) betrachtet nur das jeweils vorherige Wort. Der Vorteil ist Einfachheit und Effizienz; der Nachteil: Mit wachsendem n wächst die Zahl möglicher Wortfolgen explosionsartig, und die meisten längeren Folgen kommen im Trainingskorpus nie vor (Datensparsität). Zudem berücksichtigt ein n-Gramm-Modell per Definition nie mehr als n−1 Wörter Kontext.

Rekurrente neuronale Netze (RNNs)

RNNs verarbeiten eine Wortfolge Schritt für Schritt und halten dabei einen internen Zustand, der Information über alle vorherigen Wörter zusammenfasst – im Prinzip unbegrenzt viel Kontext, anders als ein festes n-Gramm-Fenster. In der Praxis „vergessen“ einfache RNNs aber Information aus weiter zurückliegenden Wörtern zunehmend (verschwindender Gradient).

LSTM: das Gedächtnisproblem entschärfen

LSTM-Netze (Long Short-Term Memory) ergänzen RNNs um steuerbare „Gatter“, die gezielt entscheiden, welche Information im internen Zustand behalten, überschrieben oder weitergegeben wird. Das erlaubt es, relevante Information über deutlich längere Sequenzen hinweg zu erhalten als bei einfachen RNNs.

Der historische Weg lässt sich so zusammenfassen: n-Gramme (fester, kurzer Kontext, aber einfach) → RNN/LSTM (variable Länge, aber sequenziell und damit langsam zu trainieren) → Transformer (siehe nächste Lektion), die beide Probleme zugleich adressieren.

Ein Beispiel für ein Bigramm-Modell

In einem Korpus folgt auf „guten“ in 50 Fällen „Morgen“, in 30 Fällen „Tag“ und in 20 Fällen „Abend“. Das Modell schätzt daraus für das Wort nach „guten“ Wahrscheinlichkeiten von 50 %, 30 % und 20 %. Es kann damit Text erzeugen und Wortfolgen bewerten, weiß aber nichts über Bedeutung oder weiter zurückliegenden Text.

Warum Glättung nötig ist

Kommt eine Wortfolge im Trainingskorpus nie vor, hätte sie Wahrscheinlichkeit null – und damit auch jeder Satz, der sie enthält. Glättungsverfahren verteilen einen kleinen Teil der Wahrscheinlichkeit auf ungesehene Folgen, damit das Modell nicht an jeder Lücke scheitert.

Die Grenzen, die zum nächsten Schritt führten

  • n-Gramme sehen nur wenige Wörter zurück, und die Zahl möglicher Folgen explodiert mit n.
  • RNNs lesen Wort für Wort und lassen sich deshalb schlecht parallel trainieren.
  • Auch LSTMs haben Mühe, sehr lange Abhängigkeiten zu bewahren.

Genau diese Schwächen adressiert die Transformer-Architektur.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind. Die Häufigkeiten im Bigramm-Beispiel (50/30/20 %) sind erfunden und dienen nur der Veranschaulichung.

Quellen

  • Dan Jurafsky, James H. Martin – „Speech and Language Processing“, Kapitel zu n-Gramm-Sprachmodellen (allgemeine Referenz, nicht Zeile für Zeile geprüft)
  • Sepp Hochreiter, Jürgen Schmidhuber – „Long Short-Term Memory“ (Neural Computation, 1997)

Alles zu „Klassische Sprachmodelle“