Begriffe vorab
- Referenz: eine von Menschen erstellte Musterlösung.
- n-Gramm-Überlappung: Anteil gemeinsamer Wortfolgen zwischen zwei Texten.
- Human Evaluation: Bewertung durch Menschen, etwa nach Flüssigkeit und Korrektheit.
Warum eigene Metriken nötig sind
Menschliche Bewertung von Sprachausgaben (Übersetzungen, Zusammenfassungen) ist aussagekräftig, aber langsam und teuer, wenn Modelle während der Entwicklung ständig neu bewertet werden müssen. Automatische Metriken versuchen, diese Bewertung näherungsweise, aber schnell und reproduzierbar zu ersetzen.
BLEU (maschinelle Übersetzung)
BLEU (Bilingual Evaluation Understudy), vorgestellt von Papineni et al. (ACL, 2002), vergleicht eine maschinell erzeugte Übersetzung mit einer oder mehreren menschlichen Referenzübersetzungen, indem es überlappende Wortfolgen (n-Gramme, meist bis zu 4 Wörtern) zählt, ergänzt um eine Straffunktion für zu kurze Übersetzungen (Brevity Penalty). BLEU korreliert oft, aber nicht immer zuverlässig mit menschlichem Urteil.
ROUGE (Zusammenfassung)
ROUGE (Recall-Oriented Understudy for Gisting Evaluation), von Chin-Yew Lin (2004) vorgestellt, misst analog die Überlappung zwischen einer automatisch erzeugten und menschlichen Referenz-Zusammenfassungen – mit mehreren Varianten wie ROUGE-N (n-Gramm-Überlappung) und ROUGE-L (längste gemeinsame Teilsequenz).
Perplexity (Sprachmodelle)
Perplexity misst, wie „überrascht“ ein Sprachmodell von einem gegebenen Testtext ist – formal aus der Wahrscheinlichkeit berechnet, die das Modell dem Text zuweist. Eine niedrigere Perplexity bedeutet, dass das Modell den Text besser vorhersagen konnte. Perplexity bewertet aber nur die reine Sprachmodellierung, nicht, ob eine konkrete Ausgabe inhaltlich sinnvoll oder korrekt ist.
Klassifikationsmetriken
Für Aufgaben wie NER oder Sentiment-Klassifikation kommen dieselben Metriken zum Einsatz wie beim überwachten Lernen allgemein: Precision, Recall und F1-Score (siehe das Lernpaket „Maschinelles Lernen“).
Automatische Metriken wie BLEU und ROUGE messen Textüberlappung, nicht Bedeutung. Zwei inhaltlich gleichwertige, aber anders formulierte Übersetzungen können sehr unterschiedliche Werte erhalten – Metriken ersetzen menschliche Bewertung deshalb nicht vollständig.
Ein Beispiel, warum Überlappung täuscht
Referenz: „Das Haus ist sehr groß.“ System A: „Das Haus ist riesig.“ System B: „Haus das sehr groß ist.“ Überlappungsmetriken bewerten B wegen der vielen gemeinsamen Wörter möglicherweise höher, obwohl A sprachlich und inhaltlich besser ist. Deshalb werden sie nie allein genutzt.
Metriken sinnvoll einsetzen
- Automatische Metriken eignen sich zum schnellen Vergleichen von Versionen desselben Systems.
- Für Endurteile sind Stichproben durch Menschen nötig.
- Mehrere Referenzen verbessern die Aussagekraft.
Neuere Ansätze
Weil Überlappung Bedeutung kaum erfasst, wurden Metriken entwickelt, die Bedeutungsähnlichkeit über Embeddings schätzen. Auch große Sprachmodelle werden als Bewerter eingesetzt; deren Urteile müssen ihrerseits gegen menschliche Bewertung geprüft werden.
Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.
Quellen
- Papineni, Roukos, Ward, Zhu – „BLEU: a Method for Automatic Evaluation of Machine Translation“ (ACL, 2002)
- Chin-Yew Lin – „ROUGE: A Package for Automatic Evaluation of Summaries“ (ACL-Workshop, 2004)
- Dan Jurafsky, James H. Martin – „Speech and Language Processing“, Kapitel zu Sprachmodell-Evaluation (allgemeine Referenz, nicht Zeile für Zeile geprüft)