Begriffe vorab
- Episode: ein vollständiger Durchlauf von Start bis Ende, etwa eine Spielrunde.
- Diskontierung: spätere Belohnungen zählen weniger als sofortige.
- Umgebung (Environment): alles, womit der Agent interagiert.
Lernen durch Ausprobieren
Reinforcement Learning (RL, bestärkendes Lernen) unterscheidet sich grundlegend von überwachtem und unüberwachtem Lernen: Ein Agent interagiert mit einer Umgebung (Environment), trifft Aktionen und erhält dafür ein Feedback-Signal, die Belohnung (Reward). Ziel ist es, eine Strategie (Policy) zu lernen, die die kumulierte Belohnung über die Zeit maximiert – nicht die sofortige, sondern die langfristige.
Die Grundbegriffe
- Zustand (State): die aktuelle Situation, die der Agent wahrnimmt.
- Aktion (Action): was der Agent in diesem Zustand tun kann.
- Belohnung (Reward): ein Zahlenwert, der signalisiert, wie gut oder schlecht eine Aktion in der jeweiligen Situation war.
- Policy: die (oft wahrscheinlichkeitsbasierte) Regel, nach der der Agent Aktionen wählt.
- Value Function: eine Schätzung, wie viel zukünftige Belohnung von einem Zustand aus zu erwarten ist.
Erforschen versus Ausnutzen
Ein zentrales Dilemma ist der Explore-Exploit-Trade-off: Soll der Agent eine bekannte, gut funktionierende Aktion wiederholen (Exploit), oder eine unbekannte Aktion ausprobieren, die sich am Ende als noch besser herausstellen könnte (Explore)? Reine Ausnutzung verpasst möglicherweise bessere Strategien, reine Erforschung verschenkt bereits bekannten Nutzen.
Bekannte Meilensteine
DeepMinds AlphaGo (2016) besiegte erstmals einen menschlichen Weltklassespieler im Brettspiel Go, unter anderem mit Reinforcement Learning kombiniert mit tiefen neuronalen Netzen. Auch das Training moderner Sprachmodelle nutzt RL-Techniken, etwa RLHF (Reinforcement Learning from Human Feedback), bei dem menschliche Bewertungen als Belohnungssignal dienen, um Modellantworten hilfreicher und sicherer zu machen.
RL-Agenten optimieren exakt das Belohnungssignal, das man ihnen vorgibt – nicht notwendigerweise das, was man eigentlich gemeint hat. Schlecht entworfene Belohnungen führen zu unerwünschtem, aber im Sinne der Belohnung „korrektem“ Verhalten (Reward Hacking).
Ein durchgespieltes Beispiel: Labyrinth
Ein Agent soll in einem Gitter zum Ausgang finden. Jeder Schritt kostet eine kleine Strafe, der Ausgang bringt eine große Belohnung. Anfangs bewegt er sich zufällig, merkt sich aber, welche Schritte in welchen Feldern langfristig zur Belohnung führten. Nach vielen Episoden wählt er den kürzesten Weg. Er musste nie wissen, wie das Labyrinth aussieht – nur Erfahrung sammeln.
Warum das schwierig ist
- Verzögerte Belohnung: Welcher frühere Schritt war für den späteren Erfolg verantwortlich?
- Datenhunger: Oft sind sehr viele Versuche nötig, die in der Realität teuer oder gefährlich wären. Deshalb trainiert man häufig in Simulationen.
- Belohnungsdesign: Schlecht gewählte Belohnungen führen zu unerwünschtem Verhalten.
Wo es eingesetzt wird
Bei Spielen, Robotersteuerung und Empfehlungssystemen. Wo echte Fehlversuche teuer sind, kombiniert man es oft mit Simulation oder mit Lernen aus vorhandenen Daten.
Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.
Quellen
- Richard S. Sutton, Andrew G. Barto – „Reinforcement Learning: An Introduction“ (2. Auflage, MIT Press, 2018)
- Silver et al. – „Mastering the game of Go with deep neural networks and tree search“ (Nature, 2016)
- OpenAI/Anthropic – Veröffentlichungen zu RLHF beim Training von Sprachmodellen