Begriffe vorab
- Kernel: ein anderer Name für den Filter einer Faltung.
- Stride: die Schrittweite, mit der der Filter verschoben wird.
- Padding: Auffüllen des Bildrands, damit der Filter auch am Rand passt.
Warum nicht einfach ein normales neuronales Netz?
Ein Bild in seine einzelnen Pixel zu zerlegen und direkt einem klassischen, voll verbundenen Netz zu übergeben, wäre für größere Bilder schnell unpraktikabel: Schon ein kleines Farbbild hat zehntausende Pixelwerte, und ein solches Netz würde die räumliche Struktur des Bildes – dass benachbarte Pixel zusammengehören – komplett ignorieren.
Die Convolution (Faltung)
Ein Convolutional Neural Network (CNN) schiebt stattdessen kleine, lernbare Filter (z. B. 3×3 Pixel groß) über das Bild. Jeder Filter reagiert auf ein bestimmtes lokales Muster – etwa eine Kante in einer bestimmten Richtung – und erzeugt daraus eine Feature Map, die anzeigt, wo im Bild dieses Muster auftritt. Entscheidend: Derselbe Filter wird über das gesamte Bild wiederverwendet (Parameter-Sharing), was die Anzahl der zu lernenden Parameter drastisch reduziert.
Pooling
Pooling-Schichten (meist Max-Pooling) verkleinern eine Feature Map, indem sie z. B. aus jedem 2×2-Block nur den größten Wert beibehalten. Das reduziert die Datenmenge für die nächste Schicht und macht die erkannten Muster etwas unempfindlicher gegenüber kleinen Verschiebungen im Bild.
Hierarchische Merkmale
Frühe Schichten eines CNN erkennen einfache Muster wie Kanten und Farbübergänge. Tiefere Schichten kombinieren diese zu komplexeren Formen (Ecken, Texturen) und schließlich zu ganzen Objektteilen oder Objekten – eine Hierarchie, die sich beim Training aus den Daten ergibt, nicht von Hand vorgegeben wird.
Vom CNN zur Vorhersage
Nach mehreren Convolution- und Pooling-Schichten folgt meist eine oder mehrere voll verbundene Schichten, die aus den extrahierten Merkmalen die eigentliche Vorhersage berechnen, etwa die Wahrscheinlichkeit jeder möglichen Bildklasse.
CNNs lernen die für eine Aufgabe nützlichen Merkmale aus den Trainingsdaten – enthalten diese Daten systematische Lücken (z. B. fast nur Fotos bei Tageslicht), generalisiert das Modell oft schlecht auf abweichende Bedingungen (z. B. Nachtaufnahmen).
Ein Beispiel für einen Filter
Ein 3×3-Filter mit den Werten, die links dunkel und rechts hell gewichten, reagiert auf senkrechte Kanten. Er wird Pixel für Pixel über das Bild geschoben; überall, wo dunkel auf hell trifft, ist die Antwort stark. Im Training lernt das Netz solche Filter selbst, statt dass man sie vorgibt.
Was sich durch Schichten ändert
Mit jeder Pooling-Stufe wird die Feature Map räumlich kleiner, aber es kommen meist mehr Filter hinzu. Das Netz tauscht räumliche Genauigkeit gegen abstraktere Information: Am Ende steht nicht mehr „wo ist welcher Pixel“, sondern „welche Muster sind überhaupt vorhanden“.
Wichtige Eigenschaften
- Verschiebungen des Objekts im Bild beeinträchtigen die Erkennung kaum.
- Drehung und starke Größenänderung werden nicht automatisch berücksichtigt.
- Das Modell lernt, worauf es in den Trainingsdaten ankam – nicht zwingend, was Menschen für wichtig halten.
Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.
Quellen
- Ian Goodfellow, Yoshua Bengio, Aaron Courville – „Deep Learning“ (MIT Press, 2016), Kapitel zu Convolutional Networks (allgemeine Referenz, nicht Zeile für Zeile geprüft)
- Richard Szeliski – „Computer Vision: Algorithms and Applications“ (allgemeine Referenz, nicht Zeile für Zeile geprüft)