CV-Aufgaben

Akademie

CV-Aufgaben

Klassifikation, Objekterkennung und Bildsegmentierung.

CV-Aufgaben: Klassifikation, Objekterkennung, Segmentierung

Begriffe vorab

  • Region Proposal: ein vorgeschlagener Bildausschnitt, der ein Objekt enthalten könnte.
  • Non-Maximum Suppression: Verfahren, das mehrfach erkannte Boxen desselben Objekts auf eine reduziert.
  • Konfidenz: die Sicherheit, mit der das Modell eine Vorhersage abgibt.

Bildklassifikation

Die einfachste Aufgabe: Einem ganzen Bild wird eine von mehreren möglichen Klassen zugeordnet (z. B. „Katze“ oder „Hund“). Das Modell macht keine Aussage darüber, wo im Bild sich das Objekt befindet.

Objekterkennung

Objekterkennung (Object Detection) geht weiter: Sie findet alle Objekte in einem Bild, gibt für jedes eine Klasse an und umschließt es mit einer Bounding Box (Begrenzungsrahmen). Zwei einflussreiche Ansätze:

  • Faster R-CNN (Ren et al., 2015) erzeugt zunächst eine Reihe vielversprechender Regionen (Region Proposals) und klassifiziert diese anschließend – zweistufig, aber sehr genau.
  • YOLO (You Only Look Once) (Redmon et al., CVPR 2016) sagt Bounding Boxes und Klassen in einem einzigen Durchlauf des Netzes vorher – einstufig und deutlich schneller, historisch mit etwas geringerer Genauigkeit als zweistufige Verfahren, wobei spätere YOLO-Versionen diese Lücke deutlich verkleinert haben.

Bildsegmentierung

Segmentierung geht noch feiner vor: Statt eines groben Rahmens wird jedem einzelnen Pixel eine Klasse zugeordnet.

  • Semantische Segmentierung klassifiziert jeden Pixel nach Objektkategorie (z. B. „Straße“, „Himmel“, „Auto“), unterscheidet aber nicht zwischen mehreren Objekten derselben Kategorie.
  • Instanzsegmentierung unterscheidet zusätzlich einzelne Objektexemplare voneinander (z. B. „Auto 1“ und „Auto 2“ separat).

Warum die Wahl der Aufgabe zählt

Ein autonomes Fahrzeug braucht typischerweise präzise Segmentierung der Fahrbahn und Objekterkennung für andere Verkehrsteilnehmer; eine einfache Bildsortierungs-App kommt oft mit reiner Klassifikation aus. Die Wahl der Aufgabe bestimmt maßgeblich, wie aufwendig Training und benötigte Trainingsdaten (insbesondere deren Annotation) ausfallen.

Annotation wird mit steigender Aufgabenkomplexität deutlich teurer: Ein Klassifikationslabel pro Bild ist schnell vergeben, pixelgenaue Segmentierungsmasken für dieselbe Bildmenge zu erstellen kann um ein Vielfaches aufwendiger sein.

Ein Beispiel: Verkehrsszene

Klassifikation sagt nur „Straßenszene“. Objekterkennung markiert zusätzlich Autos, Fußgänger und Ampeln mit Rahmen. Semantische Segmentierung färbt jeden Pixel als Straße, Gehweg, Himmel oder Fahrzeug. Instanzsegmentierung trennt zusätzlich jedes einzelne Auto. Mit jeder Stufe steigt der Informationsgehalt – und der Aufwand für Daten und Berechnung.

Schwellen einstellen

Ein Detektor liefert zu jeder Box eine Konfidenz. Ein hoher Schwellenwert erzeugt weniger Fehlalarme, übersieht aber mehr Objekte; ein niedriger findet mehr, erzeugt aber mehr falsche Treffer. Die richtige Einstellung hängt von den Kosten der Fehler ab – bei einer Sicherheitsanwendung meist niedriger als bei einer Foto-App.

Typische Probleme

  • Kleine oder teilweise verdeckte Objekte werden leicht übersehen.
  • Ungewöhnliche Perspektiven und Lichtverhältnisse senken die Genauigkeit.
  • Klassen, die in den Trainingsdaten selten waren, werden schlechter erkannt.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Redmon, Divvala, Girshick, Farhadi – „You Only Look Once: Unified, Real-Time Object Detection“ (CVPR, 2016)
  • Ren, He, Girshick, Sun – „Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks“ (2015)