Wortrepräsentationen: von Bag-of-Words zu Word Embeddings
Begriffe vorab
- Vektor: eine Liste von Zahlen, die einen Punkt im Raum beschreibt.
- Dimension: eine Zahl in diesem Vektor.
- Kosinus-Ähnlichkeit: Maß, wie ähnlich die Richtung zweier Vektoren ist.
Wie wird Text zu Zahlen?
Maschinelle Modelle rechnen mit Zahlen, nicht mit Wörtern. Wortrepräsentationen übersetzen Text in numerische Form – die Wahl der Methode prägt, welche Information dem Modell überhaupt zur Verfügung steht.
Bag-of-Words und TF-IDF
Das Bag-of-Words-Modell stellt einen Text als Vektor dar, der zählt, wie oft jedes Wort aus einem Vokabular vorkommt – die Wortreihenfolge geht dabei komplett verloren. TF-IDF (Term Frequency – Inverse Document Frequency) gewichtet diese Zählung zusätzlich: Wörter, die in vielen Dokumenten vorkommen (z. B. „der“, „die“, „und“), werden abgewertet, seltene, dokumentspezifische Wörter stärker gewichtet.
Das Problem der Sparsity
Bag-of-Words-Vektoren haben so viele Dimensionen wie das Vokabular Wörter enthält – bei großen Vokabularen zehntausende. Die meisten Einträge sind 0 (dünn besetzt, „sparse“), und ähnliche Wörter wie „Auto“ und „Wagen“ erhalten völlig unabhängige Dimensionen, obwohl sie semantisch verwandt sind.
Word Embeddings
Word Embeddings lösen dieses Problem: Sie bilden jedes Wort auf einen dichten Vektor mit relativ wenigen Dimensionen (oft 100–300) ab, der aus großen Textmengen gelernt wird. Ähnliche Wörter liegen dabei nah beieinander. word2vec (Mikolov et al., 2013) lernt solche Vektoren, indem es vorhersagt, welche Wörter typischerweise in der Nachbarschaft eines gegebenen Wortes stehen. GloVe (Pennington, Socher, Manning, 2014) nutzt stattdessen globale Wort-Kookkurrenz-Statistiken über einen gesamten Korpus.
Eine bekannte Eigenschaft
Word-Embedding-Räume zeigten in frühen Arbeiten oft überraschende lineare Zusammenhänge: Die Vektor-Rechnung „König“ − „Mann“ + „Frau“ ergibt einen Vektor nahe an „Königin“. Das illustriert, dass die gelernten Dimensionen tatsächlich etwas über Bedeutungsbeziehungen zwischen Wörtern einfangen.
Word Embeddings übernehmen auch Verzerrungen (Bias) aus ihren Trainingsdaten, etwa stereotype Geschlechterassoziationen bei Berufsbezeichnungen. Dieses Problem wird in der Lektion zu Herausforderungen vertieft.
Ein Beispiel für Ähnlichkeit
Bei Bag-of-Words sind „Auto“ und „Wagen“ völlig unterschiedliche Spalten; das Modell weiß nicht, dass sie Ähnliches meinen. In einem gelernten Embedding liegen beide nahe beieinander, weil sie in ähnlichen Kontexten vorkommen („das Auto fährt“, „der Wagen fährt“). Ähnlichkeit wird dort als Nähe der Vektoren messbar, zum Beispiel über die Kosinus-Ähnlichkeit.
Die Idee dahinter
Die Verteilungshypothese besagt: Wörter mit ähnlichem Kontext haben ähnliche Bedeutung. Embeddings nutzen genau das. Sie lernen Bedeutung nicht aus Wörterbüchern, sondern aus der Umgebung, in der Wörter vorkommen.
Grenzen statischer Embeddings
- Ein Wort hat nur einen Vektor, auch wenn es mehrere Bedeutungen hat („Bank“ als Sitzgelegenheit oder Geldinstitut).
- Sie übernehmen Verzerrungen der Trainingstexte.
- Seltene Wörter werden schlecht abgebildet.
Moderne Sprachmodelle erzeugen deshalb kontextabhängige Vektoren: Dasselbe Wort bekommt je nach Satz einen anderen Vektor.
Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.
Quellen
- Mikolov, Chen, Corrado, Dean – „Efficient Estimation of Word Representations in Vector Space“ (2013, word2vec)
- Pennington, Socher, Manning – „GloVe: Global Vectors for Word Representation“ (EMNLP, 2014)
- Dan Jurafsky, James H. Martin – „Speech and Language Processing“, Kapitel zu Vektorsemantik (allgemeine Referenz, nicht Zeile für Zeile geprüft)