Evaluation & Validierung

Akademie

Evaluation & Validierung

Metriken, Overfitting/Underfitting, Kreuzvalidierung und der Bias-Varianz-Kompromiss.

Evaluation, Overfitting und Kreuzvalidierung

Begriffe vorab

  • Generalisierung: Leistung auf neuen, ungesehenen Daten.
  • Baseline: ein einfacher Vergleichsmaßstab, z. B. immer die häufigste Klasse vorherzusagen.
  • Konfusionsmatrix: Tabelle der richtigen und falschen Vorhersagen je Klasse.

Over- und Underfitting

Overfitting (Überanpassung) liegt vor, wenn ein Modell die Trainingsdaten inklusive ihres Rauschens quasi auswendig lernt und dadurch auf neuen Daten schlecht abschneidet. Underfitting (Unteranpassung) ist das Gegenteil: Das Modell ist zu einfach, um selbst die grundlegenden Muster der Trainingsdaten zu erfassen. Dazwischen liegt der Bias-Varianz-Kompromiss: Ein zu einfaches Modell hat hohen Bias (systematische Fehler), ein zu komplexes Modell hohe Varianz (reagiert überempfindlich auf die spezifischen Trainingsdaten).

Kreuzvalidierung

Ein einzelner Train/Test-Split kann zufällig günstig oder ungünstig ausfallen. Bei der k-fachen Kreuzvalidierung wird der Datensatz in k gleich große Teile aufgeteilt; das Modell wird k-mal trainiert, wobei jeweils ein anderer Teil als Testdaten zurückgehalten wird. Der Durchschnitt der k Ergebnisse liefert eine robustere Schätzung der tatsächlichen Modellleistung als ein einzelner Split.

Metriken für Klassifikation

  • Accuracy (Genauigkeit): Anteil korrekter Vorhersagen – irreführend bei unausgewogenen Klassen (wenn z. B. 95 % aller Beispiele „kein Betrug“ sind, erreicht ein Modell, das immer „kein Betrug“ vorhersagt, 95 % Accuracy, ohne je einen Betrugsfall zu erkennen).
  • Precision (Präzision): von allen als positiv vorhergesagten Fällen, wie viele tatsächlich positiv waren.
  • Recall (Trefferquote/Sensitivität): von allen tatsächlich positiven Fällen, wie viele erkannt wurden.
  • F1-Score: das harmonische Mittel aus Precision und Recall, nützlich als ein einziger Kompromisswert.
  • ROC-Kurve und AUC: zeigen den Kompromiss zwischen Trefferquote und Falsch-Positiv-Rate über verschiedene Entscheidungsschwellen; die AUC (Fläche unter der Kurve) fasst das in einer Zahl zusammen.

Metriken für Regression

Gängig sind der mittlere absolute Fehler (MAE), der mittlere quadratische Fehler (MSE), der stärker große Ausreißer bestraft, und das Bestimmtheitsmaß R², das angibt, welcher Anteil der Streuung in den Daten durch das Modell erklärt wird.

Eine hohe Genauigkeit auf dem Testdatensatz ist kein Freibrief: Wurde bei der Modellauswahl wiederholt auf demselben Testdatensatz optimiert, „leckt“ auch dieser Datensatz Information ins Modell – dafür dient der zusätzliche, separate Validierungsdatensatz.

Ein Beispiel für Precision und Recall

Ein Test erkennt eine seltene Krankheit. Von 1.000 Personen sind 10 krank. Der Test findet 8 davon (Recall 80 %), meldet aber auch 40 Gesunde fälschlich als krank. Von 48 positiven Meldungen sind 8 richtig (Precision etwa 17 %). Die Accuracy liegt trotzdem bei etwa 96 %, weil fast alle Gesunden richtig erkannt werden – ein Beispiel dafür, warum Accuracy allein täuscht.

Je nach Zweck anders gewichten

Bei einer Krebsvorsorge ist ein übersehener Fall schlimmer als ein Fehlalarm – hier zählt Recall. Bei einem Spam-Filter ist eine fälschlich aussortierte wichtige Mail schlimmer – hier zählt Precision. Die passende Metrik ergibt sich aus den Kosten der Fehlerarten.

Gute Bewertungspraxis

  • Immer gegen eine Baseline vergleichen.
  • Testdaten erst am Ende einmal anfassen.
  • Bei zeitlichen Daten chronologisch trennen, nicht zufällig.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind. Das Zahlenbeispiel ist konstruiert (Precision 8/48 ≈ 16,7 %, Accuracy 958/1000 = 95,8 %) und von mir nachgerechnet.

Quellen

  • Trevor Hastie, Robert Tibshirani, Jerome Friedman – „The Elements of Statistical Learning“, Kapitel 7
  • scikit-learn-Dokumentation – „Model evaluation“, „Cross-validation“ (allgemeine Referenz, nicht Zeile für Zeile geprüft)
  • Christopher M. Bishop – „Pattern Recognition and Machine Learning“, Kapitel 1.3 (Model Selection)