Neuronale Netze und Deep Learning
Begriffe vorab
- Gewicht: ein lernbarer Zahlenwert, der die Stärke einer Verbindung bestimmt.
- Schicht (Layer): eine Gruppe von Neuronen auf gleicher Stufe.
- Epoche: ein vollständiger Durchlauf durch alle Trainingsdaten.
- Regularisierung: Verfahren, die Überanpassung verhindern, z. B. Dropout.
Vom Perzeptron zum tiefen Netz
Ein künstliches Neuron berechnet eine gewichtete Summe seiner Eingaben, addiert einen Bias-Wert und wendet eine nicht-lineare Aktivierungsfunktion an (z. B. ReLU oder Sigmoid). Ein neuronales Netz verschaltet viele solcher Neuronen in Schichten (Layern): eine Eingabeschicht, eine oder mehrere versteckte Schichten und eine Ausgabeschicht. Hat ein Netz mehrere versteckte Schichten, spricht man von Deep Learning.
Wie ein Netz lernt: Backpropagation
Beim Training berechnet das Netz zunächst eine Vorhersage (Forward Pass) und vergleicht sie über eine Verlustfunktion mit dem tatsächlichen Label. Der Backpropagation-Algorithmus (Rumelhart, Hinton und Williams, 1986) berechnet dann rückwärts durch das Netz, wie stark jedes einzelne Gewicht zum Fehler beigetragen hat, und der Gradientenabstieg passt die Gewichte entsprechend an. Dieser Zyklus wird über viele Trainingsbeispiele und mehrere Durchläufe (Epochen) wiederholt.
Wichtige Architekturen
- CNN (Convolutional Neural Network, faltendes neuronales Netz): nutzt lokale Filter, die über ein Bild geschoben werden, um Muster wie Kanten oder Formen zu erkennen – die Standardarchitektur für Bildverarbeitung.
- RNN (Recurrent Neural Network): verarbeitet Sequenzen (z. B. Text oder Zeitreihen) und behält dabei einen internen Zustand über vorherige Eingaben; Varianten wie LSTM lindern das Problem, dass sich weit zurückliegende Information sonst „verliert“.
- Transformer: die 2017 vorgestellte Architektur hinter modernen Sprachmodellen. Statt sequenziell zu verarbeiten, nutzt sie einen Attention-Mechanismus, der für jedes Element direkt berechnet, wie relevant jedes andere Element der Eingabe für es ist.
Warum Deep Learning erst ab den 2010ern durchstartete
Die grundlegenden Ideen sind Jahrzehnte alt; der Durchbruch kam erst mit großen, gelabelten Datensätzen (z. B. ImageNet), leistungsfähigen GPUs für parallele Berechnungen und praktischen Verbesserungen wie besseren Aktivierungsfunktionen und Regularisierungstechniken.
Ein tieferes Netz ist nicht automatisch besser: Mehr Schichten bedeuten mehr Parameter, mehr Trainingsdaten- und Rechenbedarf und ein höheres Risiko für Overfitting, wenn die Datenmenge nicht mitwächst.
Ein Beispiel: Ziffernerkennung
Ein Bild einer handgeschriebenen Ziffer wird als Zahlenraster eingegeben. Frühe Schichten reagieren auf Kanten, mittlere auf Bögen und Linienkreuzungen, die letzte Schicht liefert zehn Werte – einen je Ziffer. Der höchste Wert ist die Vorhersage. Beim Training werden die Gewichte so angepasst, dass die richtige Ziffer immer höher bewertet wird.
Warum die Aktivierungsfunktion zählt
Ohne nichtlineare Aktivierung ließe sich ein ganzes Netz auf eine einzige lineare Rechnung zusammenfassen und könnte nur lineare Zusammenhänge lernen. Erst die Nichtlinearität erlaubt es, komplexe Muster abzubilden.
Praktische Hinweise
- Vor dem Training Eingaben skalieren.
- Auf einer kleinen Datenmenge prüfen, ob das Modell sie überhaupt lernen kann, bevor man groß trainiert.
- Verlauf von Trainings- und Validierungsfehler beobachten, um Überanpassung früh zu erkennen.
Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.
Quellen
- Ian Goodfellow, Yoshua Bengio, Aaron Courville – „Deep Learning“ (MIT Press, 2016) (allgemeine Referenz, nicht Zeile für Zeile geprüft)
- Rumelhart, Hinton, Williams – „Learning representations by back-propagating errors“ (Nature, 1986)
- Vaswani et al. – „Attention Is All You Need“ (NeurIPS, 2017)