Evaluation & Datensätze

Akademie

Evaluation & Datensätze

Metriken wie IoU und mAP sowie Referenzdatensätze wie ImageNet und COCO.

Evaluation & Datensätze: IoU, mAP, ImageNet, COCO

Begriffe vorab

  • Ground Truth: die von Menschen festgelegte richtige Markierung.
  • Precision-Recall-Kurve: zeigt, wie sich Genauigkeit und Trefferquote bei wechselndem Schwellenwert verändern.
  • Benchmark: ein festgelegter Testdatensatz mit Metrik zum Vergleich von Verfahren.

Metriken für Klassifikation

Für reine Bildklassifikation gelten dieselben Grundmetriken wie beim überwachten Lernen allgemein (Accuracy, Precision, Recall, F1 – siehe Lernpaket „Maschinelles Lernen“). Bei Aufgaben mit sehr vielen möglichen Klassen wird oft zusätzlich Top-5-Accuracy angegeben: Ein Ergebnis zählt bereits als richtig, wenn die korrekte Klasse unter den fünf wahrscheinlichsten Vorhersagen des Modells liegt.

Intersection over Union (IoU)

Für Aufgaben mit Bounding Boxes oder Segmentierungsmasken braucht es ein Maß dafür, wie gut eine vorhergesagte Fläche mit der tatsächlichen übereinstimmt. IoU berechnet das Verhältnis der Überlappungsfläche zwischen Vorhersage und tatsächlicher Markierung zu ihrer gemeinsamen Gesamtfläche. Ein IoU von 1 bedeutet perfekte Übereinstimmung, ein IoU von 0 keine Überlappung. Häufig wird eine Vorhersage nur als „Treffer“ gewertet, wenn ihr IoU über einem festgelegten Schwellenwert liegt (oft 0,5).

Mean Average Precision (mAP)

Für Objekterkennung ist mAP die gebräuchlichste zusammenfassende Metrik: Sie berechnet für jede Objektklasse die Precision-Recall-Kurve (abhängig vom gewählten IoU-Schwellenwert und der Vorhersagesicherheit), fasst diese in einem Average-Precision-Wert je Klasse zusammen und bildet daraus den Mittelwert über alle Klassen.

Referenzdatensätze

  • ImageNet (Deng et al., 2009), initiiert u. a. von Fei-Fei Li, umfasst Millionen von Bildern über tausende Kategorien und wurde durch den zugehörigen jährlichen Wettbewerb (ILSVRC) zu einem zentralen Antrieb der Deep-Learning-Entwicklung in der Bildverarbeitung, insbesondere durch AlexNets Sieg 2012.
  • COCO (Common Objects in Context) (Lin et al., 2014) enthält komplexe Alltagsszenen mit mehreren Objekten pro Bild, jeweils mit Bounding Boxes und pixelgenauen Segmentierungsmasken – ein Standarddatensatz für Objekterkennung und Segmentierung.

Ein Modell, das auf einem Standarddatensatz wie ImageNet oder COCO gut abschneidet, ist damit noch nicht automatisch für jeden realen Anwendungsfall geeignet – die Bildverteilung in der eigenen Anwendung kann deutlich von diesen Referenzdatensätzen abweichen.

Ein Rechenbeispiel für IoU

Die markierte Fläche und die vorhergesagte Box überlappen auf 60 Flächeneinheiten. Zusammen decken sie 100 Einheiten ab. IoU = 60 / 100 = 0,6. Bei einem Schwellenwert von 0,5 zählt die Vorhersage als Treffer, bei 0,75 nicht. Strengere Schwellenwerte verlangen genauere Boxen.

Wie mAP zustande kommt

Für jede Klasse werden Vorhersagen nach Konfidenz sortiert; je nach IoU-Schwelle gelten sie als richtig oder falsch. Daraus entsteht eine Precision-Recall-Kurve, deren Fläche die Average Precision ist. Der Mittelwert über alle Klassen ist die mAP. Benchmarks wie COCO mitteln zusätzlich über mehrere IoU-Schwellen.

Grenzen von Benchmarks

  • Datensätze bilden die Welt nicht vollständig ab; Ergebnisse übertragen sich nicht automatisch.
  • Wiederholtes Optimieren auf demselben Benchmark kann zu optimistischen Ergebnissen führen.
  • Fehlerarten unterscheiden sich: Ein Durchschnittswert verbirgt, welche Fälle scheitern.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Deng, Dong, Socher, Li, Li, Fei-Fei – „ImageNet: A Large-Scale Hierarchical Image Database“ (CVPR, 2009)
  • Lin et al. – „Microsoft COCO: Common Objects in Context“ (ECCV, 2014)