Begriffe vorab
- Auflösung: Anzahl der Pixel in Breite und Höhe.
- Kanal: eine Ebene des Bildes, bei RGB etwa Rot, Grün oder Blau.
- Histogramm: Verteilung der Helligkeitswerte im Bild.
Ein Bild als Zahlenraster
Für einen Computer ist ein digitales Bild nichts anderes als ein Raster von Pixeln, wobei jeder Pixel einen oder mehrere Zahlenwerte trägt. Ein Graustufenbild speichert pro Pixel einen Helligkeitswert; ein Farbbild üblicherweise drei Werte für Rot, Grün und Blau (RGB-Farbraum).
Farbräume
Neben RGB gibt es weitere Farbräume, die für bestimmte Aufgaben praktischer sind. HSV (Hue, Saturation, Value – Farbton, Sättigung, Helligkeit) trennt die Farbe eines Pixels von seiner Helligkeit, was etwa die Erkennung von Objekten bei wechselnder Beleuchtung erleichtert. Graustufenbilder reduzieren ein Bild auf reine Helligkeitsinformation, oft als erster Vereinfachungsschritt.
Klassische Merkmale vor Deep Learning
Bevor neuronale Netze Bildmerkmale selbst lernten, mussten sie von Hand entworfen werden. Kantenerkennung (etwa über den Sobel- oder Canny-Operator) markiert Stellen starker Helligkeitsänderung, typischerweise Objektkonturen. Verfahren wie SIFT (Scale-Invariant Feature Transform) beschreiben markante, wiedererkennbare Bildpunkte unabhängig von Skalierung und Rotation – nützlich etwa, um dasselbe Objekt in zwei unterschiedlich aufgenommenen Fotos wiederzufinden.
Bildvorverarbeitung und Augmentation
Vor dem eigentlichen Training werden Bilder oft vorverarbeitet: auf eine einheitliche Größe skaliert, normalisiert (Pixelwerte in einen festen Wertebereich gebracht) oder farblich angepasst. Datenaugmentation erzeugt künstlich zusätzliche, leicht veränderte Trainingsbeispiele – etwa durch Drehen, Spiegeln, Zuschneiden oder Helligkeitsänderungen eines Originalbildes – und hilft Modellen, robuster gegenüber solchen Variationen zu werden, ohne mehr echte Trainingsdaten sammeln zu müssen.
Ein Bild „sieht“ für ein Modell zunächst nur aus Zahlen. Alles, was ein Modell über ein Bild lernen kann, muss sich irgendwie aus dieser reinen Zahlenmatrix ableiten lassen – ein Grund, warum Vorverarbeitung und Augmentation die spätere Modellleistung stark beeinflussen.
Ein Beispiel für die Größe von Bilddaten
Ein Farbfoto mit 1000 × 1000 Pixeln hat drei Millionen Zahlenwerte (1000 × 1000 × 3). Schon kleine Bilder erzeugen also große Eingaben. Deshalb werden Bilder für Modelle oft verkleinert, etwa auf 224 × 224 Pixel, was Rechenaufwand und Speicher begrenzt, aber Details kostet.
Warum Vorverarbeitung die Ergebnisse prägt
- Normalisierung: einheitliche Wertebereiche erleichtern das Training.
- Gleiche Größe: die meisten Netze erwarten feste Bildmaße.
- Konsistenz: im Einsatz müssen Bilder genauso aufbereitet werden wie im Training, sonst verschlechtern sich die Ergebnisse.
Was Augmentation leistet und was nicht
Augmentation hilft, wenn Variationen im echten Einsatz vorkommen – etwa gedrehte oder unterschiedlich belichtete Bilder. Sie ersetzt nicht fehlende Vielfalt: Ein Modell, das nie eine Nachtaufnahme gesehen hat, lernt sie nicht allein durch Spiegeln und Drehen.
Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.
Quellen
- Richard Szeliski – „Computer Vision: Algorithms and Applications“ (Standardlehrbuch) (allgemeine Referenz, nicht Zeile für Zeile geprüft)
- David G. Lowe – „Distinctive Image Features from Scale-Invariant Keypoints“ (SIFT, International Journal of Computer Vision, 2004)