ML: Lernparadigmen

Akademie

ML: Lernparadigmen

Die drei großen Grundformen des maschinellen Lernens: überwacht, unüberwacht und bestärkend.

Reinforcement Learning: Agent, Belohnung, Policy

Begriffe vorab

  • Episode: ein vollständiger Durchlauf von Start bis Ende, etwa eine Spielrunde.
  • Diskontierung: spätere Belohnungen zählen weniger als sofortige.
  • Umgebung (Environment): alles, womit der Agent interagiert.

Lernen durch Ausprobieren

Reinforcement Learning (RL, bestärkendes Lernen) unterscheidet sich grundlegend von überwachtem und unüberwachtem Lernen: Ein Agent interagiert mit einer Umgebung (Environment), trifft Aktionen und erhält dafür ein Feedback-Signal, die Belohnung (Reward). Ziel ist es, eine Strategie (Policy) zu lernen, die die kumulierte Belohnung über die Zeit maximiert – nicht die sofortige, sondern die langfristige.

Die Grundbegriffe

  • Zustand (State): die aktuelle Situation, die der Agent wahrnimmt.
  • Aktion (Action): was der Agent in diesem Zustand tun kann.
  • Belohnung (Reward): ein Zahlenwert, der signalisiert, wie gut oder schlecht eine Aktion in der jeweiligen Situation war.
  • Policy: die (oft wahrscheinlichkeitsbasierte) Regel, nach der der Agent Aktionen wählt.
  • Value Function: eine Schätzung, wie viel zukünftige Belohnung von einem Zustand aus zu erwarten ist.

Erforschen versus Ausnutzen

Ein zentrales Dilemma ist der Explore-Exploit-Trade-off: Soll der Agent eine bekannte, gut funktionierende Aktion wiederholen (Exploit), oder eine unbekannte Aktion ausprobieren, die sich am Ende als noch besser herausstellen könnte (Explore)? Reine Ausnutzung verpasst möglicherweise bessere Strategien, reine Erforschung verschenkt bereits bekannten Nutzen.

Bekannte Meilensteine

DeepMinds AlphaGo (2016) besiegte erstmals einen menschlichen Weltklassespieler im Brettspiel Go, unter anderem mit Reinforcement Learning kombiniert mit tiefen neuronalen Netzen. Auch das Training moderner Sprachmodelle nutzt RL-Techniken, etwa RLHF (Reinforcement Learning from Human Feedback), bei dem menschliche Bewertungen als Belohnungssignal dienen, um Modellantworten hilfreicher und sicherer zu machen.

RL-Agenten optimieren exakt das Belohnungssignal, das man ihnen vorgibt – nicht notwendigerweise das, was man eigentlich gemeint hat. Schlecht entworfene Belohnungen führen zu unerwünschtem, aber im Sinne der Belohnung „korrektem“ Verhalten (Reward Hacking).

Ein durchgespieltes Beispiel: Labyrinth

Ein Agent soll in einem Gitter zum Ausgang finden. Jeder Schritt kostet eine kleine Strafe, der Ausgang bringt eine große Belohnung. Anfangs bewegt er sich zufällig, merkt sich aber, welche Schritte in welchen Feldern langfristig zur Belohnung führten. Nach vielen Episoden wählt er den kürzesten Weg. Er musste nie wissen, wie das Labyrinth aussieht – nur Erfahrung sammeln.

Warum das schwierig ist

  • Verzögerte Belohnung: Welcher frühere Schritt war für den späteren Erfolg verantwortlich?
  • Datenhunger: Oft sind sehr viele Versuche nötig, die in der Realität teuer oder gefährlich wären. Deshalb trainiert man häufig in Simulationen.
  • Belohnungsdesign: Schlecht gewählte Belohnungen führen zu unerwünschtem Verhalten.

Wo es eingesetzt wird

Bei Spielen, Robotersteuerung und Empfehlungssystemen. Wo echte Fehlversuche teuer sind, kombiniert man es oft mit Simulation oder mit Lernen aus vorhandenen Daten.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Richard S. Sutton, Andrew G. Barto – „Reinforcement Learning: An Introduction“ (2. Auflage, MIT Press, 2018)
  • Silver et al. – „Mastering the game of Go with deep neural networks and tree search“ (Nature, 2016)
  • OpenAI/Anthropic – Veröffentlichungen zu RLHF beim Training von Sprachmodellen

Supervised Learning: Regression und Klassifikation

Begriffe vorab

  • Überwachtes Lernen: Lernen aus Beispielen mit bekannter richtiger Antwort.
  • Zielgröße: der Wert, den das Modell vorhersagen soll.
  • Hyperparameter: Einstellungen des Verfahrens, die man vor dem Training festlegt, etwa die Baumtiefe.

Lernen mit Lehrer

Beim überwachten Lernen (Supervised Learning) bekommt das Modell zu jedem Trainingsbeispiel die richtige Antwort (das Label) mitgeliefert. Es lernt eine Funktion, die von Eingaben auf diese Ausgaben abbildet, und wendet sie danach auf neue, unbeschriftete Beispiele an.

Zwei Grundaufgaben

  • Regression: Die Ausgabe ist eine kontinuierliche Zahl, z. B. der vorhergesagte Hauspreis oder die Temperatur morgen. Klassisches Beispiel: die lineare Regression, die eine Gerade (oder Hyperebene) durch die Datenpunkte legt.
  • Klassifikation: Die Ausgabe ist eine von mehreren Kategorien, z. B. „Spam“/„kein Spam“ oder eine von zehn Ziffern auf einem Bild. Klassische Verfahren sind die logistische Regression, Entscheidungsbäume, Random Forests und Support Vector Machines.

Wie das Training abläuft

Ein Algorithmus (häufig eine Variante des Gradientenabstiegs) passt die Modellparameter schrittweise so an, dass eine Verlustfunktion (Loss Function) minimiert wird – ein Maß dafür, wie stark die Vorhersagen von den echten Labels abweichen. Bei Regression ist das oft der mittlere quadratische Fehler, bei Klassifikation häufig die Kreuzentropie.

Typische Algorithmen im Überblick

  • k-nächste Nachbarn (k-NN): sagt anhand der ähnlichsten bekannten Beispiele voraus, ohne ein explizites Modell zu „lernen“.
  • Entscheidungsbäume: teilen die Daten anhand einer Folge von Ja/Nein-Fragen auf; leicht interpretierbar.
  • Random Forest: kombiniert viele Entscheidungsbäume zu einem robusteren Gesamtmodell (Ensemble-Methode).
  • Support Vector Machines (SVM): suchen die Trennlinie mit dem größten Abstand zu den Datenpunkten beider Klassen.

Ein Modell, das auf den Trainingsdaten perfekt abschneidet, aber auf Testdaten deutlich schlechter, hat wahrscheinlich die Trainingsdaten überangepasst (Overfitting, siehe die Lektion zu Evaluation) statt echte, verallgemeinerbare Muster gelernt.

Ein Beispiel für jede Aufgabe

Regression: Aus Wohnfläche, Lage und Baujahr soll der Mietpreis geschätzt werden. Das Ergebnis ist eine Zahl. Klassifikation: Aus Laborwerten soll eine Diagnosekategorie bestimmt werden. Das Ergebnis ist eine Klasse. Der Unterschied liegt allein in der Art der Zielgröße, nicht im Grundprinzip.

Wie man ein Verfahren wählt

Einfache Modelle wie die lineare oder logistische Regression sind schnell und gut erklärbar; sie eignen sich als Ausgangspunkt. Bäume und Random Forests kommen mit nichtlinearen Zusammenhängen zurecht und benötigen wenig Vorverarbeitung. Komplexere Modelle lohnen sich erst, wenn einfache nachweislich nicht reichen. Ein vernünftiger Ablauf: mit einem einfachen Modell beginnen, als Vergleichsmaßstab behalten und nur bei echtem Gewinn steigern.

Typische Fehler

  • Merkmale verwenden, die erst nach dem Ereignis bekannt sind (Datenleck) – das Modell wirkt im Test hervorragend und versagt im Einsatz.
  • Unausgewogene Klassen ignorieren.
  • Nur auf einer einzigen Aufteilung der Daten bewerten.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Christopher M. Bishop – „Pattern Recognition and Machine Learning“ (Springer, 2006)
  • Trevor Hastie, Robert Tibshirani, Jerome Friedman – „The Elements of Statistical Learning“ (2. Auflage, Springer)
  • scikit-learn-Dokumentation – „Supervised learning“ (allgemeine Referenz, nicht Zeile für Zeile geprüft)

Unsupervised Learning: Clustering und Dimensionsreduktion

Begriffe vorab

  • Cluster: eine Gruppe ähnlicher Datenpunkte.
  • Distanzmaß: Regel, nach der man die Ähnlichkeit zweier Punkte misst, etwa den euklidischen Abstand.
  • Hauptkomponente: eine neue Achse, die möglichst viel Streuung der Daten erfasst.

Lernen ohne Lehrer

Beim unüberwachten Lernen gibt es keine Labels – das Modell soll allein aus der Struktur der Daten Muster, Gruppen oder eine kompaktere Darstellung finden. Das ist nützlich, wenn Labels fehlen, zu teuer in der Beschaffung sind oder man die Daten zunächst überhaupt erst verstehen möchte.

Clustering: Gruppen finden

Clustering fasst ähnliche Datenpunkte zu Gruppen (Clustern) zusammen. Der bekannteste Algorithmus ist k-Means: Er wählt k Zentren, ordnet jeden Punkt dem nächsten Zentrum zu und verschiebt die Zentren anschließend wiederholt an den Mittelpunkt ihrer Gruppe, bis sich nichts mehr ändert. Die Zahl k muss vorab festgelegt werden, etwa mit Hilfe der „Ellbogen-Methode“. Andere Verfahren wie DBSCAN finden Cluster beliebiger Form und erkennen dabei auch Ausreißer (Rauschen), ohne die Clusterzahl vorher zu kennen.

Dimensionsreduktion: Komplexität verringern

Daten mit vielen Merkmalen (hochdimensionale Daten) sind schwer zu visualisieren und rechnerisch aufwendig. Dimensionsreduktion bildet sie auf weniger Dimensionen ab und behält dabei möglichst viel der relevanten Information.

  • PCA (Principal Component Analysis, Hauptkomponentenanalyse): findet die Richtungen im Datenraum mit der größten Streuung und projiziert die Daten darauf.
  • t-SNE und UMAP: moderne Verfahren, die vor allem zur zweidimensionalen Visualisierung hochdimensionaler Daten (z. B. Worteinbettungen) genutzt werden, aber nicht unbedingt globale Abstände korrekt wiedergeben.

Anwendungsbeispiele

Kundensegmentierung im Marketing, Anomalieerkennung in Netzwerkverkehr oder Banktransaktionen, Themenfindung in großen Textsammlungen und die Vorverarbeitung von Bildern oder Gensequenzen vor einer weiteren Analyse.

Anders als bei überwachtem Lernen gibt es beim unüberwachten Lernen keine „richtige“ Antwort zum Nachrechnen – die Bewertung, ob ein gefundenes Cluster sinnvoll ist, bleibt oft eine fachliche, nicht nur eine rein mathematische Frage.

Ein Beispiel: Kundensegmente

Ein Shop hat Kaufdaten, aber keine Kundentypen. Clustering gruppiert Kundschaft nach Kaufverhalten: etwa Seltenkäufer mit hohem Warenkorb, Stammkunden mit kleinen Einkäufen, Schnäppchenjäger. Die Gruppen sind Vorschläge; erst das Fachwissen entscheidet, ob sie sinnvoll und nutzbar sind.

Worauf es ankommt

  • Skalierung: Merkmale in unterschiedlichen Größenordnungen sollten vorher angeglichen werden, sonst dominiert das größte Merkmal das Distanzmaß.
  • Clusterzahl: bei k-Means muss sie vorab gewählt werden; Kennzahlen und Fachwissen helfen bei der Entscheidung.
  • Stabilität: Ergebnisse mit verschiedenen Startwerten wiederholen und prüfen, ob sie ähnlich bleiben.

Dimensionsreduktion praktisch

PCA wird oft vor weiteren Verfahren eingesetzt, um Rauschen zu verringern oder Daten in zwei Dimensionen darzustellen. Dabei geht Information verloren; man prüft, wie viel der Streuung die behaltenen Komponenten noch erklären.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Christopher M. Bishop – „Pattern Recognition and Machine Learning“, Kapitel 9 (Clustering)
  • Trevor Hastie, Robert Tibshirani, Jerome Friedman – „The Elements of Statistical Learning“, Kapitel 14
  • scikit-learn-Dokumentation – „Clustering“ und „Decomposing signals (PCA)“ (allgemeine Referenz, nicht Zeile für Zeile geprüft)