Convolutional Neural Networks

Akademie

Convolutional Neural Networks

Wie faltende neuronale Netze Bildmerkmale lernen: Convolution, Pooling und der Aufbau eines CNN.

CNN-Architekturen: von LeNet bis ResNet

Begriffe vorab

  • Top-5-Fehler: Anteil der Bilder, bei denen die richtige Klasse nicht unter den fünf wahrscheinlichsten lag.
  • Transfer Learning: ein vortrainiertes Modell für eine neue Aufgabe weiterverwenden.
  • Verschwindender Gradient: Lernsignale werden in tiefen Netzen zu klein.

LeNet: der frühe Beweis

LeNet (LeNet-5; LeCun, Bottou, Bengio und Haffner, 1998) zeigte bereits, dass CNNs handgeschriebene Ziffern zuverlässig erkennen können – lange vor dem heutigen Deep-Learning-Boom, aber mit begrenzter Rechenleistung und kleinen Datensätzen.

AlexNet: der Durchbruch 2012

AlexNet (Krizhevsky, Sutskever, Hinton, 2012) gewann den ImageNet-Wettbewerb (ILSVRC) mit einem Top-5-Fehler von 15,3 % gegenüber 26,2 % beim Zweitplatzierten. Zu den Schlüsselzutaten gehörten das Training auf Grafikprozessoren (GPUs), die ReLU-Aktivierungsfunktion und Dropout zur Regularisierung. AlexNet gilt als der Moment, der den Deep-Learning-Boom in der Bildverarbeitung auslöste.

VGGNet: Tiefe durch Einfachheit

VGGNet (Simonyan und Zisserman, 2014) zeigte, dass sich die Leistung durch systematisches Stapeln vieler gleichartiger, kleiner 3×3-Filter-Schichten deutlich steigern lässt – ein einfaches, aber sehr tiefes Design.

ResNet: das Tiefenproblem lösen

Mit wachsender Netztiefe wurde das Training zunehmend schwieriger (u. a. durch verschwindende Gradienten). ResNet (He et al., Microsoft Research, 2015/2016) löste das mit Residual- bzw. Skip-Verbindungen: Statt jede Schicht die volle Transformation lernen zu lassen, lernt sie nur die Differenz (das „Residuum“) zu ihrer Eingabe, die per Sprungverbindung direkt durchgereicht wird. Das ermöglichte stabiles Training von Netzen mit über 100 Schichten (im Paper bis zu 152); ein ResNet-Ensemble gewann 2015 die Klassifikationsaufgabe des ImageNet-Wettbewerbs mit 3,57 % Top-5-Fehler.

Warum diese Geschichte wichtig ist

Jede dieser Architekturen löste ein konkretes Problem der vorherigen Generation: fehlende Rechenleistung/Daten (LeNet → AlexNet), die Frage nach dem richtigen Aufbau (AlexNet → VGGNet), und das Trainieren wirklich tiefer Netze (VGGNet → ResNet). Das Prinzip der Skip-Verbindungen aus ResNet findet sich heute weit über die Bildverarbeitung hinaus, u. a. auch in Transformer-Architekturen.

Diese Architekturen dienen bis heute häufig als vortrainierte Basis (Backbone), auf der speziellere Bildverarbeitungsaufgaben aufbauen, statt jedes Mal von Grund auf neu zu trainieren.

Transfer Learning in der Praxis

Statt ein Netz von Grund auf zu trainieren, nimmt man ein auf ImageNet vortrainiertes Modell und trainiert nur die letzten Schichten mit eigenen Bildern nach. Das spart Daten und Rechenzeit, weil die frühen Schichten allgemeine Muster wie Kanten und Texturen bereits beherrschen. So lässt sich etwa mit wenigen hundert Bildern ein Modell für Pflanzenkrankheiten anpassen.

Was die Meilensteine verbindet

Mit jeder Generation wurden Netze tiefer und genauer, die Hürde lag aber jeweils woanders: bei Daten und Rechenleistung, bei der Architekturwahl, beim Training tiefer Netze. Praktisch folgt daraus: Bei Bildproblemen beginnt man mit einem bewährten Modell und passt es an, statt eine Architektur neu zu erfinden.

Wahl des Modells

  • Kleinere Modelle für mobile Geräte und Echtzeit.
  • Größere Modelle, wenn Genauigkeit zählt und Rechenleistung verfügbar ist.
  • Immer auf eigenen Daten testen, nicht nur Ergebnisse auf Standarddatensätzen vergleichen.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • LeCun, Bottou, Bengio, Haffner – „Gradient-Based Learning Applied to Document Recognition“ (Proceedings of the IEEE, 1998)
  • Krizhevsky, Sutskever, Hinton – „ImageNet Classification with Deep Convolutional Neural Networks“ (NeurIPS/NIPS, 2012)
  • Simonyan, Zisserman – „Very Deep Convolutional Networks for Large-Scale Image Recognition“ (VGGNet, 2014)
  • He, Zhang, Ren, Sun – „Deep Residual Learning for Image Recognition“ (CVPR, 2016)

Wie Convolutional Neural Networks Bilder lesen

Begriffe vorab

  • Kernel: ein anderer Name für den Filter einer Faltung.
  • Stride: die Schrittweite, mit der der Filter verschoben wird.
  • Padding: Auffüllen des Bildrands, damit der Filter auch am Rand passt.

Warum nicht einfach ein normales neuronales Netz?

Ein Bild in seine einzelnen Pixel zu zerlegen und direkt einem klassischen, voll verbundenen Netz zu übergeben, wäre für größere Bilder schnell unpraktikabel: Schon ein kleines Farbbild hat zehntausende Pixelwerte, und ein solches Netz würde die räumliche Struktur des Bildes – dass benachbarte Pixel zusammengehören – komplett ignorieren.

Die Convolution (Faltung)

Ein Convolutional Neural Network (CNN) schiebt stattdessen kleine, lernbare Filter (z. B. 3×3 Pixel groß) über das Bild. Jeder Filter reagiert auf ein bestimmtes lokales Muster – etwa eine Kante in einer bestimmten Richtung – und erzeugt daraus eine Feature Map, die anzeigt, wo im Bild dieses Muster auftritt. Entscheidend: Derselbe Filter wird über das gesamte Bild wiederverwendet (Parameter-Sharing), was die Anzahl der zu lernenden Parameter drastisch reduziert.

Pooling

Pooling-Schichten (meist Max-Pooling) verkleinern eine Feature Map, indem sie z. B. aus jedem 2×2-Block nur den größten Wert beibehalten. Das reduziert die Datenmenge für die nächste Schicht und macht die erkannten Muster etwas unempfindlicher gegenüber kleinen Verschiebungen im Bild.

Hierarchische Merkmale

Frühe Schichten eines CNN erkennen einfache Muster wie Kanten und Farbübergänge. Tiefere Schichten kombinieren diese zu komplexeren Formen (Ecken, Texturen) und schließlich zu ganzen Objektteilen oder Objekten – eine Hierarchie, die sich beim Training aus den Daten ergibt, nicht von Hand vorgegeben wird.

Vom CNN zur Vorhersage

Nach mehreren Convolution- und Pooling-Schichten folgt meist eine oder mehrere voll verbundene Schichten, die aus den extrahierten Merkmalen die eigentliche Vorhersage berechnen, etwa die Wahrscheinlichkeit jeder möglichen Bildklasse.

CNNs lernen die für eine Aufgabe nützlichen Merkmale aus den Trainingsdaten – enthalten diese Daten systematische Lücken (z. B. fast nur Fotos bei Tageslicht), generalisiert das Modell oft schlecht auf abweichende Bedingungen (z. B. Nachtaufnahmen).

Ein Beispiel für einen Filter

Ein 3×3-Filter mit den Werten, die links dunkel und rechts hell gewichten, reagiert auf senkrechte Kanten. Er wird Pixel für Pixel über das Bild geschoben; überall, wo dunkel auf hell trifft, ist die Antwort stark. Im Training lernt das Netz solche Filter selbst, statt dass man sie vorgibt.

Was sich durch Schichten ändert

Mit jeder Pooling-Stufe wird die Feature Map räumlich kleiner, aber es kommen meist mehr Filter hinzu. Das Netz tauscht räumliche Genauigkeit gegen abstraktere Information: Am Ende steht nicht mehr „wo ist welcher Pixel“, sondern „welche Muster sind überhaupt vorhanden“.

Wichtige Eigenschaften

  • Verschiebungen des Objekts im Bild beeinträchtigen die Erkennung kaum.
  • Drehung und starke Größenänderung werden nicht automatisch berücksichtigt.
  • Das Modell lernt, worauf es in den Trainingsdaten ankam – nicht zwingend, was Menschen für wichtig halten.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Ian Goodfellow, Yoshua Bengio, Aaron Courville – „Deep Learning“ (MIT Press, 2016), Kapitel zu Convolutional Networks (allgemeine Referenz, nicht Zeile für Zeile geprüft)
  • Richard Szeliski – „Computer Vision: Algorithms and Applications“ (allgemeine Referenz, nicht Zeile für Zeile geprüft)