NLP: Grundlagen

Akademie

NLP: Grundlagen

Die klassische NLP-Pipeline: Tokenisierung, Wortarten-Tagging, Lemmatisierung und Parsing.

Die klassische NLP-Pipeline

Begriffe vorab

  • Korpus: eine Sammlung von Texten, die als Datengrundlage dient.
  • Vokabular: die Menge aller unterschiedlichen Tokens eines Korpus.
  • Stoppwort: sehr häufiges Wort wie „der“ oder „und“ mit wenig Aussagekraft.

Vom Text zu verarbeitbaren Einheiten

Natural Language Processing (NLP) ist das Teilgebiet der KI, das sich mit dem Verstehen und Erzeugen menschlicher Sprache befasst. Bevor ein Computer mit Text „etwas anfangen“ kann, muss dieser in einer Reihe von Schritten aufbereitet werden – der klassischen NLP-Pipeline.

Tokenisierung

Tokenisierung zerlegt einen Text in kleinere Einheiten, sogenannte Tokens: meist Wörter oder Satzzeichen, bei modernen Sprachmodellen oft auch Wortteile (Subword-Tokens). Schon hier gibt es Tücken: Soll „can’t“ als ein Token oder als „can“ + „’t“ behandelt werden? Verschiedene Sprachen stellen unterschiedliche Anforderungen – im Chinesischen etwa gibt es keine Leerzeichen zwischen Wörtern.

Wortarten-Tagging (POS-Tagging)

Part-of-Speech-Tagging ordnet jedem Token seine grammatische Kategorie zu (Nomen, Verb, Adjektiv …). Das Wort „lieben“ kann je nach Kontext Verb oder (als „das Lieben“) eher nominal gebraucht sein – Tagging-Modelle nutzen den umgebenden Kontext, um solche Fälle aufzulösen.

Lemmatisierung und Stemming

Lemmatisierung führt ein Wort auf seine Grundform zurück (z. B. „gingen“ → „gehen“), unter Berücksichtigung der Wortart und grammatischer Regeln. Das gröbere Stemming schneidet stattdessen nach einfachen Regeln Endungen ab, ohne linguistisches Wissen – schneller, aber ungenauer.

Syntaktisches Parsing

Parsing analysiert die grammatische Struktur eines Satzes, etwa als Abhängigkeitsbaum (Dependency Parsing), der zeigt, welches Wort von welchem anderen grammatisch abhängt – Grundlage z. B. für die Frage, wer in einem Satz eigentlich was tut.

Moderne, auf neuronalen Netzen basierende NLP-Systeme führen viele dieser Schritte implizit innerhalb des Modells aus, statt sie als getrennte Pipeline-Stufen zu benötigen. Die Konzepte bleiben aber wichtig, um zu verstehen, welche Information ein System über Sprache überhaupt „sehen“ kann.

Ein durchgespieltes Beispiel

Der Satz „Die Kinder spielten im Garten.“ wird zuerst in Tokens zerlegt: Die | Kinder | spielten | im | Garten | Punkt. Das POS-Tagging ordnet zu: Artikel, Nomen, Verb, Präposition mit Artikel, Nomen. Die Lemmatisierung führt „spielten“ auf „spielen“ und „Kinder“ auf „Kind“ zurück. Das Parsing erkennt „Kinder“ als Subjekt von „spielten“. Jeder Schritt liefert dem nächsten Informationen.

Sprachen unterscheiden sich

Deutsch bildet lange Zusammensetzungen („Donaudampfschifffahrtsgesellschaft“), die sich als Ganzes schlecht zuordnen lassen. Türkisch hängt viele Endungen an ein Wort an. Chinesisch hat keine Leerzeichen zwischen Wörtern. Deshalb braucht jede Sprache angepasste Tokenisierung und Regeln; ein Werkzeug für Englisch lässt sich nicht einfach übertragen.

Fehler pflanzen sich fort

Macht der Tokenizer einen Fehler, leiden alle folgenden Schritte. Deshalb sind Stufenmodelle anfällig, und deshalb setzen moderne Systeme auf gemeinsam trainierte Modelle, die solche Schritte implizit mitlernen.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Dan Jurafsky, James H. Martin – „Speech and Language Processing“ (Standardlehrbuch der Computerlinguistik) (allgemeine Referenz, nicht Zeile für Zeile geprüft)
  • spaCy- und NLTK-Dokumentation – praktische Referenzen für Tokenisierung, POS-Tagging und Parsing (allgemeine Referenz, nicht Zeile für Zeile geprüft)