Begriffe vorab
- Top-5-Fehler: Anteil der Bilder, bei denen die richtige Klasse nicht unter den fünf wahrscheinlichsten lag.
- Transfer Learning: ein vortrainiertes Modell für eine neue Aufgabe weiterverwenden.
- Verschwindender Gradient: Lernsignale werden in tiefen Netzen zu klein.
LeNet: der frühe Beweis
LeNet (LeNet-5; LeCun, Bottou, Bengio und Haffner, 1998) zeigte bereits, dass CNNs handgeschriebene Ziffern zuverlässig erkennen können – lange vor dem heutigen Deep-Learning-Boom, aber mit begrenzter Rechenleistung und kleinen Datensätzen.
AlexNet: der Durchbruch 2012
AlexNet (Krizhevsky, Sutskever, Hinton, 2012) gewann den ImageNet-Wettbewerb (ILSVRC) mit einem Top-5-Fehler von 15,3 % gegenüber 26,2 % beim Zweitplatzierten. Zu den Schlüsselzutaten gehörten das Training auf Grafikprozessoren (GPUs), die ReLU-Aktivierungsfunktion und Dropout zur Regularisierung. AlexNet gilt als der Moment, der den Deep-Learning-Boom in der Bildverarbeitung auslöste.
VGGNet: Tiefe durch Einfachheit
VGGNet (Simonyan und Zisserman, 2014) zeigte, dass sich die Leistung durch systematisches Stapeln vieler gleichartiger, kleiner 3×3-Filter-Schichten deutlich steigern lässt – ein einfaches, aber sehr tiefes Design.
ResNet: das Tiefenproblem lösen
Mit wachsender Netztiefe wurde das Training zunehmend schwieriger (u. a. durch verschwindende Gradienten). ResNet (He et al., Microsoft Research, 2015/2016) löste das mit Residual- bzw. Skip-Verbindungen: Statt jede Schicht die volle Transformation lernen zu lassen, lernt sie nur die Differenz (das „Residuum“) zu ihrer Eingabe, die per Sprungverbindung direkt durchgereicht wird. Das ermöglichte stabiles Training von Netzen mit über 100 Schichten (im Paper bis zu 152); ein ResNet-Ensemble gewann 2015 die Klassifikationsaufgabe des ImageNet-Wettbewerbs mit 3,57 % Top-5-Fehler.
Warum diese Geschichte wichtig ist
Jede dieser Architekturen löste ein konkretes Problem der vorherigen Generation: fehlende Rechenleistung/Daten (LeNet → AlexNet), die Frage nach dem richtigen Aufbau (AlexNet → VGGNet), und das Trainieren wirklich tiefer Netze (VGGNet → ResNet). Das Prinzip der Skip-Verbindungen aus ResNet findet sich heute weit über die Bildverarbeitung hinaus, u. a. auch in Transformer-Architekturen.
Diese Architekturen dienen bis heute häufig als vortrainierte Basis (Backbone), auf der speziellere Bildverarbeitungsaufgaben aufbauen, statt jedes Mal von Grund auf neu zu trainieren.
Transfer Learning in der Praxis
Statt ein Netz von Grund auf zu trainieren, nimmt man ein auf ImageNet vortrainiertes Modell und trainiert nur die letzten Schichten mit eigenen Bildern nach. Das spart Daten und Rechenzeit, weil die frühen Schichten allgemeine Muster wie Kanten und Texturen bereits beherrschen. So lässt sich etwa mit wenigen hundert Bildern ein Modell für Pflanzenkrankheiten anpassen.
Was die Meilensteine verbindet
Mit jeder Generation wurden Netze tiefer und genauer, die Hürde lag aber jeweils woanders: bei Daten und Rechenleistung, bei der Architekturwahl, beim Training tiefer Netze. Praktisch folgt daraus: Bei Bildproblemen beginnt man mit einem bewährten Modell und passt es an, statt eine Architektur neu zu erfinden.
Wahl des Modells
- Kleinere Modelle für mobile Geräte und Echtzeit.
- Größere Modelle, wenn Genauigkeit zählt und Rechenleistung verfügbar ist.
- Immer auf eigenen Daten testen, nicht nur Ergebnisse auf Standarddatensätzen vergleichen.
Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.
Quellen
- LeCun, Bottou, Bengio, Haffner – „Gradient-Based Learning Applied to Document Recognition“ (Proceedings of the IEEE, 1998)
- Krizhevsky, Sutskever, Hinton – „ImageNet Classification with Deep Convolutional Neural Networks“ (NeurIPS/NIPS, 2012)
- Simonyan, Zisserman – „Very Deep Convolutional Networks for Large-Scale Image Recognition“ (VGGNet, 2014)
- He, Zhang, Ren, Sun – „Deep Residual Learning for Image Recognition“ (CVPR, 2016)