Computer Vision

Akademie

Computer Vision

Wie Computer Bilder und Videos interpretieren: von Pixeln über CNNs bis zu generativen Modellen und ihren ethischen Fragen.

CNN-Architekturen: von LeNet bis ResNet

Begriffe vorab

  • Top-5-Fehler: Anteil der Bilder, bei denen die richtige Klasse nicht unter den fünf wahrscheinlichsten lag.
  • Transfer Learning: ein vortrainiertes Modell für eine neue Aufgabe weiterverwenden.
  • Verschwindender Gradient: Lernsignale werden in tiefen Netzen zu klein.

LeNet: der frühe Beweis

LeNet (LeNet-5; LeCun, Bottou, Bengio und Haffner, 1998) zeigte bereits, dass CNNs handgeschriebene Ziffern zuverlässig erkennen können – lange vor dem heutigen Deep-Learning-Boom, aber mit begrenzter Rechenleistung und kleinen Datensätzen.

AlexNet: der Durchbruch 2012

AlexNet (Krizhevsky, Sutskever, Hinton, 2012) gewann den ImageNet-Wettbewerb (ILSVRC) mit einem Top-5-Fehler von 15,3 % gegenüber 26,2 % beim Zweitplatzierten. Zu den Schlüsselzutaten gehörten das Training auf Grafikprozessoren (GPUs), die ReLU-Aktivierungsfunktion und Dropout zur Regularisierung. AlexNet gilt als der Moment, der den Deep-Learning-Boom in der Bildverarbeitung auslöste.

VGGNet: Tiefe durch Einfachheit

VGGNet (Simonyan und Zisserman, 2014) zeigte, dass sich die Leistung durch systematisches Stapeln vieler gleichartiger, kleiner 3×3-Filter-Schichten deutlich steigern lässt – ein einfaches, aber sehr tiefes Design.

ResNet: das Tiefenproblem lösen

Mit wachsender Netztiefe wurde das Training zunehmend schwieriger (u. a. durch verschwindende Gradienten). ResNet (He et al., Microsoft Research, 2015/2016) löste das mit Residual- bzw. Skip-Verbindungen: Statt jede Schicht die volle Transformation lernen zu lassen, lernt sie nur die Differenz (das „Residuum“) zu ihrer Eingabe, die per Sprungverbindung direkt durchgereicht wird. Das ermöglichte stabiles Training von Netzen mit über 100 Schichten (im Paper bis zu 152); ein ResNet-Ensemble gewann 2015 die Klassifikationsaufgabe des ImageNet-Wettbewerbs mit 3,57 % Top-5-Fehler.

Warum diese Geschichte wichtig ist

Jede dieser Architekturen löste ein konkretes Problem der vorherigen Generation: fehlende Rechenleistung/Daten (LeNet → AlexNet), die Frage nach dem richtigen Aufbau (AlexNet → VGGNet), und das Trainieren wirklich tiefer Netze (VGGNet → ResNet). Das Prinzip der Skip-Verbindungen aus ResNet findet sich heute weit über die Bildverarbeitung hinaus, u. a. auch in Transformer-Architekturen.

Diese Architekturen dienen bis heute häufig als vortrainierte Basis (Backbone), auf der speziellere Bildverarbeitungsaufgaben aufbauen, statt jedes Mal von Grund auf neu zu trainieren.

Transfer Learning in der Praxis

Statt ein Netz von Grund auf zu trainieren, nimmt man ein auf ImageNet vortrainiertes Modell und trainiert nur die letzten Schichten mit eigenen Bildern nach. Das spart Daten und Rechenzeit, weil die frühen Schichten allgemeine Muster wie Kanten und Texturen bereits beherrschen. So lässt sich etwa mit wenigen hundert Bildern ein Modell für Pflanzenkrankheiten anpassen.

Was die Meilensteine verbindet

Mit jeder Generation wurden Netze tiefer und genauer, die Hürde lag aber jeweils woanders: bei Daten und Rechenleistung, bei der Architekturwahl, beim Training tiefer Netze. Praktisch folgt daraus: Bei Bildproblemen beginnt man mit einem bewährten Modell und passt es an, statt eine Architektur neu zu erfinden.

Wahl des Modells

  • Kleinere Modelle für mobile Geräte und Echtzeit.
  • Größere Modelle, wenn Genauigkeit zählt und Rechenleistung verfügbar ist.
  • Immer auf eigenen Daten testen, nicht nur Ergebnisse auf Standarddatensätzen vergleichen.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • LeCun, Bottou, Bengio, Haffner – „Gradient-Based Learning Applied to Document Recognition“ (Proceedings of the IEEE, 1998)
  • Krizhevsky, Sutskever, Hinton – „ImageNet Classification with Deep Convolutional Neural Networks“ (NeurIPS/NIPS, 2012)
  • Simonyan, Zisserman – „Very Deep Convolutional Networks for Large-Scale Image Recognition“ (VGGNet, 2014)
  • He, Zhang, Ren, Sun – „Deep Residual Learning for Image Recognition“ (CVPR, 2016)

CV-Aufgaben: Klassifikation, Objekterkennung, Segmentierung

Begriffe vorab

  • Region Proposal: ein vorgeschlagener Bildausschnitt, der ein Objekt enthalten könnte.
  • Non-Maximum Suppression: Verfahren, das mehrfach erkannte Boxen desselben Objekts auf eine reduziert.
  • Konfidenz: die Sicherheit, mit der das Modell eine Vorhersage abgibt.

Bildklassifikation

Die einfachste Aufgabe: Einem ganzen Bild wird eine von mehreren möglichen Klassen zugeordnet (z. B. „Katze“ oder „Hund“). Das Modell macht keine Aussage darüber, wo im Bild sich das Objekt befindet.

Objekterkennung

Objekterkennung (Object Detection) geht weiter: Sie findet alle Objekte in einem Bild, gibt für jedes eine Klasse an und umschließt es mit einer Bounding Box (Begrenzungsrahmen). Zwei einflussreiche Ansätze:

  • Faster R-CNN (Ren et al., 2015) erzeugt zunächst eine Reihe vielversprechender Regionen (Region Proposals) und klassifiziert diese anschließend – zweistufig, aber sehr genau.
  • YOLO (You Only Look Once) (Redmon et al., CVPR 2016) sagt Bounding Boxes und Klassen in einem einzigen Durchlauf des Netzes vorher – einstufig und deutlich schneller, historisch mit etwas geringerer Genauigkeit als zweistufige Verfahren, wobei spätere YOLO-Versionen diese Lücke deutlich verkleinert haben.

Bildsegmentierung

Segmentierung geht noch feiner vor: Statt eines groben Rahmens wird jedem einzelnen Pixel eine Klasse zugeordnet.

  • Semantische Segmentierung klassifiziert jeden Pixel nach Objektkategorie (z. B. „Straße“, „Himmel“, „Auto“), unterscheidet aber nicht zwischen mehreren Objekten derselben Kategorie.
  • Instanzsegmentierung unterscheidet zusätzlich einzelne Objektexemplare voneinander (z. B. „Auto 1“ und „Auto 2“ separat).

Warum die Wahl der Aufgabe zählt

Ein autonomes Fahrzeug braucht typischerweise präzise Segmentierung der Fahrbahn und Objekterkennung für andere Verkehrsteilnehmer; eine einfache Bildsortierungs-App kommt oft mit reiner Klassifikation aus. Die Wahl der Aufgabe bestimmt maßgeblich, wie aufwendig Training und benötigte Trainingsdaten (insbesondere deren Annotation) ausfallen.

Annotation wird mit steigender Aufgabenkomplexität deutlich teurer: Ein Klassifikationslabel pro Bild ist schnell vergeben, pixelgenaue Segmentierungsmasken für dieselbe Bildmenge zu erstellen kann um ein Vielfaches aufwendiger sein.

Ein Beispiel: Verkehrsszene

Klassifikation sagt nur „Straßenszene“. Objekterkennung markiert zusätzlich Autos, Fußgänger und Ampeln mit Rahmen. Semantische Segmentierung färbt jeden Pixel als Straße, Gehweg, Himmel oder Fahrzeug. Instanzsegmentierung trennt zusätzlich jedes einzelne Auto. Mit jeder Stufe steigt der Informationsgehalt – und der Aufwand für Daten und Berechnung.

Schwellen einstellen

Ein Detektor liefert zu jeder Box eine Konfidenz. Ein hoher Schwellenwert erzeugt weniger Fehlalarme, übersieht aber mehr Objekte; ein niedriger findet mehr, erzeugt aber mehr falsche Treffer. Die richtige Einstellung hängt von den Kosten der Fehler ab – bei einer Sicherheitsanwendung meist niedriger als bei einer Foto-App.

Typische Probleme

  • Kleine oder teilweise verdeckte Objekte werden leicht übersehen.
  • Ungewöhnliche Perspektiven und Lichtverhältnisse senken die Genauigkeit.
  • Klassen, die in den Trainingsdaten selten waren, werden schlechter erkannt.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Redmon, Divvala, Girshick, Farhadi – „You Only Look Once: Unified, Real-Time Object Detection“ (CVPR, 2016)
  • Ren, He, Girshick, Sun – „Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks“ (2015)

Ethik & Gesellschaft: Bias, Überwachung, Deepfakes

Begriffe vorab

  • Biometrische Daten: körperliche Merkmale, die eine Person identifizieren, etwa das Gesicht.
  • Verifikation: prüfen, ob jemand die behauptete Person ist (1:1).
  • Identifikation: eine Person in einer Menge finden (1:n).

Bias in Gesichtserkennung

Die Studie „Gender Shades“ von Joy Buolamwini und Timnit Gebru (2018) untersuchte drei kommerzielle Systeme, die aus Gesichtsbildern das Geschlecht bestimmen. Die Fehlerraten unterschieden sich stark zwischen Gruppen: Bei dunkelhäutigen Frauen lagen sie bei bis zu 34,7 %, bei hellhäutigen Männern bei höchstens 0,8 %. Ursache war unter anderem eine Trainings- und Testdatenbasis, die bestimmte Bevölkerungsgruppen unterrepräsentierte.

Überwachung im öffentlichen Raum

Computer-Vision-Systeme ermöglichen automatisierte Gesichtserkennung und Verhaltensanalyse in Überwachungskameras in einem Maßstab, der mit menschlicher Auswertung nicht erreichbar wäre. Das wirft Fragen zu Verhältnismäßigkeit, Zweckbindung und der Möglichkeit flächendeckender Bewegungsprofile auf – Themen, die je nach Land und Rechtsordnung unterschiedlich geregelt sind und öffentlich diskutiert werden.

Deepfakes

Als Deepfakes bezeichnet man mittels generativer Modelle (siehe vorige Lektion) erzeugte, täuschend echt wirkende, aber gefälschte Bilder, Videos oder Audioaufnahmen – etwa Gesichter, die in ein fremdes Video montiert werden. Die Technologie hat legitime Anwendungen (z. B. in der Filmproduktion), birgt aber auch Missbrauchspotenzial für Desinformation, Betrug oder nicht einvernehmlich erstellte Inhalte.

Umgang mit diesen Risiken

Gegenmaßnahmen umfassen technische Erkennung von generierten Inhalten (mit begrenzter, sich ständig weiterentwickelnder Zuverlässigkeit), Provenienz-/Wasserzeichen-Standards, die die Herkunft eines Bildes markieren sollen, sowie rechtliche Regelungen wie die bereits erwähnte EU-KI-Verordnung, die für bestimmte KI-generierte Inhalte Kennzeichnungspflichten vorsieht.

Technische Erkennungsverfahren für Deepfakes liefern keine hundertprozentige Sicherheit und verbessern sich im ständigen Wettlauf mit den Erzeugungsverfahren selbst – ein rein technisches Problem, aber keine rein technische Lösung.

Ein wichtiger Unterschied

Das Entsperren eines Telefons per Gesicht ist Verifikation mit Einwilligung der Person. Gesichtserkennung im öffentlichen Raum identifiziert dagegen viele Unbeteiligte ohne ihr Zutun. Beides nutzt dieselbe Technik, wirft aber ganz unterschiedliche rechtliche und ethische Fragen auf.

Fehler haben unterschiedliche Folgen

Bei Fehlerraten, die zwischen Gruppen abweichen, treffen Fehlidentifikationen bestimmte Menschen häufiger als andere. Ein falscher Treffer kann zu Verdächtigungen führen. Deshalb sind Tests nach Gruppen, klare Einsatzgrenzen und menschliche Überprüfung bei folgenreichen Entscheidungen wichtig.

Fragen vor einem Einsatz

  • Gibt es eine Rechtsgrundlage, und ist der Einsatz verhältnismäßig?
  • Wurde auf Unterschiede zwischen Gruppen getestet?
  • Welche Daten werden gespeichert, wie lange und von wem eingesehen?
  • Gibt es Widerspruchs- und Kontrollmöglichkeiten für Betroffene?

Zum Selbermachen: einen Einsatz bewerten

  1. Wähle einen Einsatz von Bilderkennung (Gesichtserkennung am Eingang, Gepäckkontrolle, automatische Fotosortierung).
  2. Lege fest, ob Verifikation oder Identifikation stattfindet.
  3. Liste auf, wer betroffen ist und welche Folgen ein Fehler hätte.
  4. Entscheide, welche Schutzmaßnahmen nötig wären.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Joy Buolamwini, Timnit Gebru – „Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification“ (FAT*/ACM, 2018)
  • Verordnung (EU) 2024/1689 (KI-Verordnung, AI Act), Bestimmungen zur Kennzeichnung von KI-generierten Inhalten

Evaluation & Datensätze: IoU, mAP, ImageNet, COCO

Begriffe vorab

  • Ground Truth: die von Menschen festgelegte richtige Markierung.
  • Precision-Recall-Kurve: zeigt, wie sich Genauigkeit und Trefferquote bei wechselndem Schwellenwert verändern.
  • Benchmark: ein festgelegter Testdatensatz mit Metrik zum Vergleich von Verfahren.

Metriken für Klassifikation

Für reine Bildklassifikation gelten dieselben Grundmetriken wie beim überwachten Lernen allgemein (Accuracy, Precision, Recall, F1 – siehe Lernpaket „Maschinelles Lernen“). Bei Aufgaben mit sehr vielen möglichen Klassen wird oft zusätzlich Top-5-Accuracy angegeben: Ein Ergebnis zählt bereits als richtig, wenn die korrekte Klasse unter den fünf wahrscheinlichsten Vorhersagen des Modells liegt.

Intersection over Union (IoU)

Für Aufgaben mit Bounding Boxes oder Segmentierungsmasken braucht es ein Maß dafür, wie gut eine vorhergesagte Fläche mit der tatsächlichen übereinstimmt. IoU berechnet das Verhältnis der Überlappungsfläche zwischen Vorhersage und tatsächlicher Markierung zu ihrer gemeinsamen Gesamtfläche. Ein IoU von 1 bedeutet perfekte Übereinstimmung, ein IoU von 0 keine Überlappung. Häufig wird eine Vorhersage nur als „Treffer“ gewertet, wenn ihr IoU über einem festgelegten Schwellenwert liegt (oft 0,5).

Mean Average Precision (mAP)

Für Objekterkennung ist mAP die gebräuchlichste zusammenfassende Metrik: Sie berechnet für jede Objektklasse die Precision-Recall-Kurve (abhängig vom gewählten IoU-Schwellenwert und der Vorhersagesicherheit), fasst diese in einem Average-Precision-Wert je Klasse zusammen und bildet daraus den Mittelwert über alle Klassen.

Referenzdatensätze

  • ImageNet (Deng et al., 2009), initiiert u. a. von Fei-Fei Li, umfasst Millionen von Bildern über tausende Kategorien und wurde durch den zugehörigen jährlichen Wettbewerb (ILSVRC) zu einem zentralen Antrieb der Deep-Learning-Entwicklung in der Bildverarbeitung, insbesondere durch AlexNets Sieg 2012.
  • COCO (Common Objects in Context) (Lin et al., 2014) enthält komplexe Alltagsszenen mit mehreren Objekten pro Bild, jeweils mit Bounding Boxes und pixelgenauen Segmentierungsmasken – ein Standarddatensatz für Objekterkennung und Segmentierung.

Ein Modell, das auf einem Standarddatensatz wie ImageNet oder COCO gut abschneidet, ist damit noch nicht automatisch für jeden realen Anwendungsfall geeignet – die Bildverteilung in der eigenen Anwendung kann deutlich von diesen Referenzdatensätzen abweichen.

Ein Rechenbeispiel für IoU

Die markierte Fläche und die vorhergesagte Box überlappen auf 60 Flächeneinheiten. Zusammen decken sie 100 Einheiten ab. IoU = 60 / 100 = 0,6. Bei einem Schwellenwert von 0,5 zählt die Vorhersage als Treffer, bei 0,75 nicht. Strengere Schwellenwerte verlangen genauere Boxen.

Wie mAP zustande kommt

Für jede Klasse werden Vorhersagen nach Konfidenz sortiert; je nach IoU-Schwelle gelten sie als richtig oder falsch. Daraus entsteht eine Precision-Recall-Kurve, deren Fläche die Average Precision ist. Der Mittelwert über alle Klassen ist die mAP. Benchmarks wie COCO mitteln zusätzlich über mehrere IoU-Schwellen.

Grenzen von Benchmarks

  • Datensätze bilden die Welt nicht vollständig ab; Ergebnisse übertragen sich nicht automatisch.
  • Wiederholtes Optimieren auf demselben Benchmark kann zu optimistischen Ergebnissen führen.
  • Fehlerarten unterscheiden sich: Ein Durchschnittswert verbirgt, welche Fälle scheitern.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Deng, Dong, Socher, Li, Li, Fei-Fei – „ImageNet: A Large-Scale Hierarchical Image Database“ (CVPR, 2009)
  • Lin et al. – „Microsoft COCO: Common Objects in Context“ (ECCV, 2014)

Generative Bildmodelle: GANs und Diffusionsmodelle

Begriffe vorab

  • Latenter Raum: eine komprimierte, abstrakte Darstellung, aus der Bilder erzeugt werden können.
  • Prompt: die textliche Beschreibung, die ein Bildmodell steuert.
  • Sampling: das Erzeugen eines neuen Beispiels aus dem Modell.

Generative Adversarial Networks (GANs)

GANs (Goodfellow et al., 2014) bestehen aus zwei gegeneinander trainierten neuronalen Netzen: einem Generator, der versucht, möglichst realistisch wirkende Bilder zu erzeugen, und einem Diskriminator, der versucht, echte von generierten Bildern zu unterscheiden. Beide werden gemeinsam trainiert: Wird der Generator besser, muss der Diskriminator mitziehen, und umgekehrt – ein Wettstreit, der im Idealfall zu immer realistischeren generierten Bildern führt.

Diffusionsmodelle

Diffusionsmodelle (u. a. Ho, Jain, Abbeel, 2020, „Denoising Diffusion Probabilistic Models“) verfolgen einen anderen Ansatz: Beim Training wird einem echten Bild schrittweise Rauschen hinzugefügt, bis reines Rauschen übrig bleibt. Das Modell lernt, diesen Prozess umzukehren – aus reinem Rauschen Schritt für Schritt ein Bild zu „entrauschen“. Zur Bilderzeugung startet man mit zufälligem Rauschen und lässt das Modell es iterativ in ein Bild verwandeln.

Warum Diffusionsmodelle GANs in vielen Anwendungen abgelöst haben

GANs sind wegen des gegenläufigen Trainings zweier Netze oft instabil zu trainieren (ein Problem ist etwa der „Mode Collapse“, bei dem der Generator nur noch wenige Variationen erzeugt). Diffusionsmodelle gelten als tendenziell stabiler zu trainieren und liefern bei vielen Bildgenerierungsaufgaben eine höhere Detailvielfalt, benötigen dafür aber typischerweise mehr Rechenschritte zur Erzeugung eines einzelnen Bildes.

Textgesteuerte Bildgenerierung

Kombiniert man ein solches generatives Bildmodell mit einem Sprachmodell oder einer gemeinsamen Text-Bild-Repräsentation, lässt sich die Bilderzeugung durch eine Textbeschreibung steuern (Text-to-Image) – die Grundlage moderner Bildgenerierungssysteme.

Generative Bildmodelle werfen eigene Fragen auf: Urheberrecht an Trainingsbildern, die Möglichkeit, täuschend echte Fälschungen (Deepfakes) zu erzeugen, und die Frage, wie erzeugte Bilder als solche kennzeichenbar bleiben – vertieft in der Lektion zu Ethik & Gesellschaft.

Ein Beispiel für den Ablauf bei Diffusion

Zum Training wird ein Foto in vielen Schritten verrauscht, bis nur noch Rauschen übrig ist; das Modell lernt, jeden Schritt rückgängig zu machen. Zur Erzeugung startet man mit reinem Rauschen und entrauscht es Schritt für Schritt, geführt durch einen Text wie „ein Leuchtturm bei Sonnenuntergang“. Jeder Durchlauf mit anderem Startrauschen ergibt ein anderes Bild.

Stärken und Schwächen

  • Stärken: hohe Bildqualität, große stilistische Vielfalt, textgesteuerte Bedienung.
  • Schwächen: Schwierigkeiten bei Details wie Händen oder Schrift, Verzerrungen aus den Trainingsdaten, hoher Rechenbedarf.

Verantwortungsvoll einsetzen

Erzeugte Bilder sollten als solche gekennzeichnet werden, wo Täuschung möglich ist. Bei Bildern realer Personen sind Persönlichkeitsrechte zu beachten, bei der Nutzung fremder Stile und Werke urheberrechtliche Fragen, die rechtlich teils noch nicht abschließend geklärt sind.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Goodfellow et al. – „Generative Adversarial Nets“ (NIPS, 2014)
  • Ho, Jain, Abbeel – „Denoising Diffusion Probabilistic Models“ (NeurIPS, 2020)

Grundlagen: Pixel, Farbräume, klassische Merkmale

Begriffe vorab

  • Auflösung: Anzahl der Pixel in Breite und Höhe.
  • Kanal: eine Ebene des Bildes, bei RGB etwa Rot, Grün oder Blau.
  • Histogramm: Verteilung der Helligkeitswerte im Bild.

Ein Bild als Zahlenraster

Für einen Computer ist ein digitales Bild nichts anderes als ein Raster von Pixeln, wobei jeder Pixel einen oder mehrere Zahlenwerte trägt. Ein Graustufenbild speichert pro Pixel einen Helligkeitswert; ein Farbbild üblicherweise drei Werte für Rot, Grün und Blau (RGB-Farbraum).

Farbräume

Neben RGB gibt es weitere Farbräume, die für bestimmte Aufgaben praktischer sind. HSV (Hue, Saturation, Value – Farbton, Sättigung, Helligkeit) trennt die Farbe eines Pixels von seiner Helligkeit, was etwa die Erkennung von Objekten bei wechselnder Beleuchtung erleichtert. Graustufenbilder reduzieren ein Bild auf reine Helligkeitsinformation, oft als erster Vereinfachungsschritt.

Klassische Merkmale vor Deep Learning

Bevor neuronale Netze Bildmerkmale selbst lernten, mussten sie von Hand entworfen werden. Kantenerkennung (etwa über den Sobel- oder Canny-Operator) markiert Stellen starker Helligkeitsänderung, typischerweise Objektkonturen. Verfahren wie SIFT (Scale-Invariant Feature Transform) beschreiben markante, wiedererkennbare Bildpunkte unabhängig von Skalierung und Rotation – nützlich etwa, um dasselbe Objekt in zwei unterschiedlich aufgenommenen Fotos wiederzufinden.

Bildvorverarbeitung und Augmentation

Vor dem eigentlichen Training werden Bilder oft vorverarbeitet: auf eine einheitliche Größe skaliert, normalisiert (Pixelwerte in einen festen Wertebereich gebracht) oder farblich angepasst. Datenaugmentation erzeugt künstlich zusätzliche, leicht veränderte Trainingsbeispiele – etwa durch Drehen, Spiegeln, Zuschneiden oder Helligkeitsänderungen eines Originalbildes – und hilft Modellen, robuster gegenüber solchen Variationen zu werden, ohne mehr echte Trainingsdaten sammeln zu müssen.

Ein Bild „sieht“ für ein Modell zunächst nur aus Zahlen. Alles, was ein Modell über ein Bild lernen kann, muss sich irgendwie aus dieser reinen Zahlenmatrix ableiten lassen – ein Grund, warum Vorverarbeitung und Augmentation die spätere Modellleistung stark beeinflussen.

Ein Beispiel für die Größe von Bilddaten

Ein Farbfoto mit 1000 × 1000 Pixeln hat drei Millionen Zahlenwerte (1000 × 1000 × 3). Schon kleine Bilder erzeugen also große Eingaben. Deshalb werden Bilder für Modelle oft verkleinert, etwa auf 224 × 224 Pixel, was Rechenaufwand und Speicher begrenzt, aber Details kostet.

Warum Vorverarbeitung die Ergebnisse prägt

  • Normalisierung: einheitliche Wertebereiche erleichtern das Training.
  • Gleiche Größe: die meisten Netze erwarten feste Bildmaße.
  • Konsistenz: im Einsatz müssen Bilder genauso aufbereitet werden wie im Training, sonst verschlechtern sich die Ergebnisse.

Was Augmentation leistet und was nicht

Augmentation hilft, wenn Variationen im echten Einsatz vorkommen – etwa gedrehte oder unterschiedlich belichtete Bilder. Sie ersetzt nicht fehlende Vielfalt: Ein Modell, das nie eine Nachtaufnahme gesehen hat, lernt sie nicht allein durch Spiegeln und Drehen.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Richard Szeliski – „Computer Vision: Algorithms and Applications“ (Standardlehrbuch) (allgemeine Referenz, nicht Zeile für Zeile geprüft)
  • David G. Lowe – „Distinctive Image Features from Scale-Invariant Keypoints“ (SIFT, International Journal of Computer Vision, 2004)

Wie Convolutional Neural Networks Bilder lesen

Begriffe vorab

  • Kernel: ein anderer Name für den Filter einer Faltung.
  • Stride: die Schrittweite, mit der der Filter verschoben wird.
  • Padding: Auffüllen des Bildrands, damit der Filter auch am Rand passt.

Warum nicht einfach ein normales neuronales Netz?

Ein Bild in seine einzelnen Pixel zu zerlegen und direkt einem klassischen, voll verbundenen Netz zu übergeben, wäre für größere Bilder schnell unpraktikabel: Schon ein kleines Farbbild hat zehntausende Pixelwerte, und ein solches Netz würde die räumliche Struktur des Bildes – dass benachbarte Pixel zusammengehören – komplett ignorieren.

Die Convolution (Faltung)

Ein Convolutional Neural Network (CNN) schiebt stattdessen kleine, lernbare Filter (z. B. 3×3 Pixel groß) über das Bild. Jeder Filter reagiert auf ein bestimmtes lokales Muster – etwa eine Kante in einer bestimmten Richtung – und erzeugt daraus eine Feature Map, die anzeigt, wo im Bild dieses Muster auftritt. Entscheidend: Derselbe Filter wird über das gesamte Bild wiederverwendet (Parameter-Sharing), was die Anzahl der zu lernenden Parameter drastisch reduziert.

Pooling

Pooling-Schichten (meist Max-Pooling) verkleinern eine Feature Map, indem sie z. B. aus jedem 2×2-Block nur den größten Wert beibehalten. Das reduziert die Datenmenge für die nächste Schicht und macht die erkannten Muster etwas unempfindlicher gegenüber kleinen Verschiebungen im Bild.

Hierarchische Merkmale

Frühe Schichten eines CNN erkennen einfache Muster wie Kanten und Farbübergänge. Tiefere Schichten kombinieren diese zu komplexeren Formen (Ecken, Texturen) und schließlich zu ganzen Objektteilen oder Objekten – eine Hierarchie, die sich beim Training aus den Daten ergibt, nicht von Hand vorgegeben wird.

Vom CNN zur Vorhersage

Nach mehreren Convolution- und Pooling-Schichten folgt meist eine oder mehrere voll verbundene Schichten, die aus den extrahierten Merkmalen die eigentliche Vorhersage berechnen, etwa die Wahrscheinlichkeit jeder möglichen Bildklasse.

CNNs lernen die für eine Aufgabe nützlichen Merkmale aus den Trainingsdaten – enthalten diese Daten systematische Lücken (z. B. fast nur Fotos bei Tageslicht), generalisiert das Modell oft schlecht auf abweichende Bedingungen (z. B. Nachtaufnahmen).

Ein Beispiel für einen Filter

Ein 3×3-Filter mit den Werten, die links dunkel und rechts hell gewichten, reagiert auf senkrechte Kanten. Er wird Pixel für Pixel über das Bild geschoben; überall, wo dunkel auf hell trifft, ist die Antwort stark. Im Training lernt das Netz solche Filter selbst, statt dass man sie vorgibt.

Was sich durch Schichten ändert

Mit jeder Pooling-Stufe wird die Feature Map räumlich kleiner, aber es kommen meist mehr Filter hinzu. Das Netz tauscht räumliche Genauigkeit gegen abstraktere Information: Am Ende steht nicht mehr „wo ist welcher Pixel“, sondern „welche Muster sind überhaupt vorhanden“.

Wichtige Eigenschaften

  • Verschiebungen des Objekts im Bild beeinträchtigen die Erkennung kaum.
  • Drehung und starke Größenänderung werden nicht automatisch berücksichtigt.
  • Das Modell lernt, worauf es in den Trainingsdaten ankam – nicht zwingend, was Menschen für wichtig halten.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Ian Goodfellow, Yoshua Bengio, Aaron Courville – „Deep Learning“ (MIT Press, 2016), Kapitel zu Convolutional Networks (allgemeine Referenz, nicht Zeile für Zeile geprüft)
  • Richard Szeliski – „Computer Vision: Algorithms and Applications“ (allgemeine Referenz, nicht Zeile für Zeile geprüft)