Grundlagen, Lernparadigmen, neuronale Netze, Evaluation, Praxis und Ethik des maschinellen Lernens.
Ethik und Verantwortung im maschinellen Lernen
Begriffe vorab
Geschütztes Merkmal: z. B. Geschlecht, Herkunft oder Alter, nach dem nicht diskriminiert werden darf.
Proxy-Variable: ein scheinbar harmloses Merkmal, das ein geschütztes Merkmal indirekt abbildet, etwa die Postleitzahl.
Human in the Loop: ein Mensch trifft oder prüft die Entscheidung.
Bias beginnt in den Daten
Ein ML-Modell lernt die Muster, die in seinen Trainingsdaten stecken – einschließlich historischer Vorurteile und Ungleichgewichte. Sind bestimmte Gruppen in den Trainingsdaten unter- oder überrepräsentiert, oder spiegeln die Daten vergangene diskriminierende Praxis wider, übernimmt das Modell diesen Bias, selbst wenn niemand ihn beabsichtigt hat. Ein bekanntes Beispiel sind Systeme zur automatisierten Vorauswahl von Bewerbungen, die historische Einstellungsmuster reproduzieren, statt sie zu korrigieren.
Fairness messen
Es gibt keine einzige, universelle Definition von „Fairness“ – verschiedene, mathematisch zum Teil unvereinbare Kriterien konkurrieren, etwa ob Fehlerraten über Gruppen hinweg gleich sein sollen (Equal Opportunity) oder ob Vorhersagen unabhängig von einem geschützten Merkmal sein sollen (Demographic Parity). Werkzeuge wie IBMs AI Fairness 360 oder Microsofts Fairlearn helfen, solche Metriken zu berechnen und Modelle entsprechend anzupassen.
Erklärbarkeit (Explainable AI, XAI)
Viele leistungsfähige Modelle, insbesondere tiefe neuronale Netze, sind für Menschen schwer nachzuvollziehen (Black-Box-Problem). Methoden wie SHAP oder LIME versuchen, für eine einzelne Vorhersage zu erklären, welche Eingabemerkmale sie wie stark beeinflusst haben – wichtig, wenn Entscheidungen (Kreditvergabe, medizinische Diagnosen) für Betroffene nachvollziehbar und anfechtbar sein müssen.
Regulatorischer Rahmen
Die EU-KI-Verordnung (AI Act) stuft KI-Systeme nach Risiko ein und verlangt für Hochrisiko-Anwendungen unter anderem Dokumentation, menschliche Aufsicht und Tests auf Diskriminierung. Das NIST AI Risk Management Framework in den USA liefert ein freiwilliges, aber breit rezipiertes Vorgehensmodell, um Risiken von KI-Systemen über ihren gesamten Lebenszyklus zu identifizieren und zu steuern.
„Die Daten sagen es einfach so“ ist keine neutrale Aussage. Datensammlung, Feature-Auswahl und die Definition des Vorhersageziels sind menschliche Entscheidungen mit Wertungen – auch wenn das fertige Modell rein mathematisch wirkt.
Ein Beispiel für indirekte Diskriminierung
Ein Modell für Kreditentscheidungen darf das Geschlecht nicht verwenden. Es nutzt aber Merkmale wie Teilzeitbeschäftigung oder Berufsgruppe, die stark mit dem Geschlecht zusammenhängen. Das Modell kann so dieselbe Verzerrung reproduzieren, obwohl das geschützte Merkmal gar nicht enthalten ist. Das Entfernen eines Merkmals genügt deshalb nicht; man muss die Ergebnisse gruppenweise prüfen.
Fragen vor dem Einsatz
Wer ist von Entscheidungen betroffen, und können sie widersprechen?
Welche Kosten haben Fehler für wen?
Ist das Ergebnis erklärbar genug für die Situation?
Wer trägt die Verantwortung?
Verantwortung bleibt menschlich
Ein Modell kann Entscheidungen vorbereiten; die Verantwortung bleibt bei Menschen und Organisationen. Bei Entscheidungen mit erheblicher Wirkung auf Personen sind Dokumentation, Überprüfbarkeit und menschliche Aufsicht zentrale Anforderungen.
Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.
IBM – AI Fairness 360 Toolkit; Microsoft – Fairlearn-Dokumentation
Ribeiro, Singh, Guestrin – „Why Should I Trust You? Explaining the Predictions of Any Classifier“ (LIME, KDD 2016)
Evaluation, Overfitting und Kreuzvalidierung
Begriffe vorab
Generalisierung: Leistung auf neuen, ungesehenen Daten.
Baseline: ein einfacher Vergleichsmaßstab, z. B. immer die häufigste Klasse vorherzusagen.
Konfusionsmatrix: Tabelle der richtigen und falschen Vorhersagen je Klasse.
Over- und Underfitting
Overfitting (Überanpassung) liegt vor, wenn ein Modell die Trainingsdaten inklusive ihres Rauschens quasi auswendig lernt und dadurch auf neuen Daten schlecht abschneidet. Underfitting (Unteranpassung) ist das Gegenteil: Das Modell ist zu einfach, um selbst die grundlegenden Muster der Trainingsdaten zu erfassen. Dazwischen liegt der Bias-Varianz-Kompromiss: Ein zu einfaches Modell hat hohen Bias (systematische Fehler), ein zu komplexes Modell hohe Varianz (reagiert überempfindlich auf die spezifischen Trainingsdaten).
Kreuzvalidierung
Ein einzelner Train/Test-Split kann zufällig günstig oder ungünstig ausfallen. Bei der k-fachen Kreuzvalidierung wird der Datensatz in k gleich große Teile aufgeteilt; das Modell wird k-mal trainiert, wobei jeweils ein anderer Teil als Testdaten zurückgehalten wird. Der Durchschnitt der k Ergebnisse liefert eine robustere Schätzung der tatsächlichen Modellleistung als ein einzelner Split.
Metriken für Klassifikation
Accuracy (Genauigkeit): Anteil korrekter Vorhersagen – irreführend bei unausgewogenen Klassen (wenn z. B. 95 % aller Beispiele „kein Betrug“ sind, erreicht ein Modell, das immer „kein Betrug“ vorhersagt, 95 % Accuracy, ohne je einen Betrugsfall zu erkennen).
Precision (Präzision): von allen als positiv vorhergesagten Fällen, wie viele tatsächlich positiv waren.
Recall (Trefferquote/Sensitivität): von allen tatsächlich positiven Fällen, wie viele erkannt wurden.
F1-Score: das harmonische Mittel aus Precision und Recall, nützlich als ein einziger Kompromisswert.
ROC-Kurve und AUC: zeigen den Kompromiss zwischen Trefferquote und Falsch-Positiv-Rate über verschiedene Entscheidungsschwellen; die AUC (Fläche unter der Kurve) fasst das in einer Zahl zusammen.
Metriken für Regression
Gängig sind der mittlere absolute Fehler (MAE), der mittlere quadratische Fehler (MSE), der stärker große Ausreißer bestraft, und das Bestimmtheitsmaß R², das angibt, welcher Anteil der Streuung in den Daten durch das Modell erklärt wird.
Eine hohe Genauigkeit auf dem Testdatensatz ist kein Freibrief: Wurde bei der Modellauswahl wiederholt auf demselben Testdatensatz optimiert, „leckt“ auch dieser Datensatz Information ins Modell – dafür dient der zusätzliche, separate Validierungsdatensatz.
Ein Beispiel für Precision und Recall
Ein Test erkennt eine seltene Krankheit. Von 1.000 Personen sind 10 krank. Der Test findet 8 davon (Recall 80 %), meldet aber auch 40 Gesunde fälschlich als krank. Von 48 positiven Meldungen sind 8 richtig (Precision etwa 17 %). Die Accuracy liegt trotzdem bei etwa 96 %, weil fast alle Gesunden richtig erkannt werden – ein Beispiel dafür, warum Accuracy allein täuscht.
Je nach Zweck anders gewichten
Bei einer Krebsvorsorge ist ein übersehener Fall schlimmer als ein Fehlalarm – hier zählt Recall. Bei einem Spam-Filter ist eine fälschlich aussortierte wichtige Mail schlimmer – hier zählt Precision. Die passende Metrik ergibt sich aus den Kosten der Fehlerarten.
Gute Bewertungspraxis
Immer gegen eine Baseline vergleichen.
Testdaten erst am Ende einmal anfassen.
Bei zeitlichen Daten chronologisch trennen, nicht zufällig.
Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind. Das Zahlenbeispiel ist konstruiert (Precision 8/48 ≈ 16,7 %, Accuracy 958/1000 = 95,8 %) und von mir nachgerechnet.
Quellen
Trevor Hastie, Robert Tibshirani, Jerome Friedman – „The Elements of Statistical Learning“, Kapitel 7
scikit-learn-Dokumentation – „Model evaluation“, „Cross-validation“ (allgemeine Referenz, nicht Zeile für Zeile geprüft)
Christopher M. Bishop – „Pattern Recognition and Machine Learning“, Kapitel 1.3 (Model Selection)
ML in der Praxis: Daten, Features, MLOps
Begriffe vorab
Pipeline: die Folge von Schritten von den Rohdaten bis zur Vorhersage.
Datenleck: Information aus den Testdaten oder der Zukunft fließt unbeabsichtigt ins Training.
Drift: die schleichende Veränderung von Daten oder Zusammenhängen.
Der meiste Aufwand liegt nicht im Modell
In realen Projekten verbringen Teams oft den größten Teil ihrer Zeit mit Datenbeschaffung, -bereinigung und -aufbereitung statt mit dem eigentlichen Modelltraining. Fehlende Werte, falsche Formate, Ausreißer und inkonsistente Kategorien müssen behandelt werden, bevor überhaupt trainiert werden kann.
Feature Engineering
Feature Engineering bezeichnet das gezielte Konstruieren und Auswählen von Eingabemerkmalen, die einem Modell helfen, Muster leichter zu erkennen – etwa das Ableiten des Wochentags aus einem Zeitstempel oder das Kombinieren zweier Rohwerte zu einem aussagekräftigeren Verhältnis. Bei Deep-Learning-Modellen übernimmt das Netz einen Teil dieser Merkmalsextraktion selbst, klassische Verfahren profitieren dagegen stärker von manuell konstruierten Features.
MLOps: Vom Notebook in den Betrieb
MLOps (Machine Learning Operations) übertragt Praktiken aus der Softwareentwicklung (Versionskontrolle, automatisierte Tests, kontinuierliche Integration) auf ML-Projekte, ergänzt um ML-spezifische Aufgaben:
Versionierung nicht nur von Code, sondern auch von Daten und trainierten Modellen.
Deployment: das Modell wird als Dienst (z. B. über eine API) bereitgestellt, damit andere Systeme Vorhersagen abrufen können.
Monitoring: laufende Überwachung der Vorhersagequalität in Produktion, nicht nur einmalig beim Training.
Retraining: das Modell wird periodisch mit neuen Daten neu trainiert.
Data Drift und Model Decay
Die Welt ändert sich, und mit ihr die Daten: Data Drift bezeichnet Verschiebungen in der Verteilung der Eingabedaten gegenüber den Trainingsdaten (z. B. neues Kundenverhalten nach einer Krise). Dadurch kann die Modellqualität mit der Zeit abnehmen, selbst wenn sich am Modell selbst nichts geändert hat – ein Phänomen, das oft als Model Decay bezeichnet wird und laufendes Monitoring nötig macht.
Ein Modell, das im Notebook auf historischen Daten gut funktioniert, ist erst der Anfang. Ob es in Produktion, mit echten, sich wandelnden Daten und unter echten Zeit- und Ressourcenbeschränkungen funktioniert, zeigt sich erst im Betrieb.
Ein Beispiel für ein Datenleck
Ein Modell soll Kreditausfälle vorhersagen und verwendet ein Merkmal „wurde Mahnung versendet“. Dieses Merkmal entsteht erst nach dem Zahlungsproblem. Im Test wirkt das Modell hervorragend, im Einsatz fehlt das Merkmal zum Zeitpunkt der Entscheidung. Deshalb muss man bei jedem Merkmal fragen: Ist es zum Vorhersagezeitpunkt wirklich bekannt?
Reihenfolge eines Projekts
Fachliche Frage und Erfolgsmaß klären.
Daten beschaffen, prüfen und bereinigen.
Einfache Baseline bauen.
Modell verbessern und sauber validieren.
Ausrollen, überwachen und bei Drift neu trainieren.
Häufige Stolpersteine
Kein Verantwortlicher für den Betrieb des Modells.
Unterschiedliche Datenaufbereitung in Training und Produktion.
Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.
Quellen
Google Cloud – „MLOps: Continuous delivery and automation pipelines in machine learning“ (allgemeine Referenz, nicht Zeile für Zeile geprüft)
D. Sculley et al. – „Hidden Technical Debt in Machine Learning Systems“ (NeurIPS, 2015)
scikit-learn-Dokumentation – „Preprocessing data“ (allgemeine Referenz, nicht Zeile für Zeile geprüft)
Neuronale Netze und Deep Learning
Begriffe vorab
Gewicht: ein lernbarer Zahlenwert, der die Stärke einer Verbindung bestimmt.
Schicht (Layer): eine Gruppe von Neuronen auf gleicher Stufe.
Epoche: ein vollständiger Durchlauf durch alle Trainingsdaten.
Regularisierung: Verfahren, die Überanpassung verhindern, z. B. Dropout.
Vom Perzeptron zum tiefen Netz
Ein künstliches Neuron berechnet eine gewichtete Summe seiner Eingaben, addiert einen Bias-Wert und wendet eine nicht-lineare Aktivierungsfunktion an (z. B. ReLU oder Sigmoid). Ein neuronales Netz verschaltet viele solcher Neuronen in Schichten (Layern): eine Eingabeschicht, eine oder mehrere versteckte Schichten und eine Ausgabeschicht. Hat ein Netz mehrere versteckte Schichten, spricht man von Deep Learning.
Wie ein Netz lernt: Backpropagation
Beim Training berechnet das Netz zunächst eine Vorhersage (Forward Pass) und vergleicht sie über eine Verlustfunktion mit dem tatsächlichen Label. Der Backpropagation-Algorithmus (Rumelhart, Hinton und Williams, 1986) berechnet dann rückwärts durch das Netz, wie stark jedes einzelne Gewicht zum Fehler beigetragen hat, und der Gradientenabstieg passt die Gewichte entsprechend an. Dieser Zyklus wird über viele Trainingsbeispiele und mehrere Durchläufe (Epochen) wiederholt.
Wichtige Architekturen
CNN (Convolutional Neural Network, faltendes neuronales Netz): nutzt lokale Filter, die über ein Bild geschoben werden, um Muster wie Kanten oder Formen zu erkennen – die Standardarchitektur für Bildverarbeitung.
RNN (Recurrent Neural Network): verarbeitet Sequenzen (z. B. Text oder Zeitreihen) und behält dabei einen internen Zustand über vorherige Eingaben; Varianten wie LSTM lindern das Problem, dass sich weit zurückliegende Information sonst „verliert“.
Transformer: die 2017 vorgestellte Architektur hinter modernen Sprachmodellen. Statt sequenziell zu verarbeiten, nutzt sie einen Attention-Mechanismus, der für jedes Element direkt berechnet, wie relevant jedes andere Element der Eingabe für es ist.
Warum Deep Learning erst ab den 2010ern durchstartete
Die grundlegenden Ideen sind Jahrzehnte alt; der Durchbruch kam erst mit großen, gelabelten Datensätzen (z. B. ImageNet), leistungsfähigen GPUs für parallele Berechnungen und praktischen Verbesserungen wie besseren Aktivierungsfunktionen und Regularisierungstechniken.
Ein tieferes Netz ist nicht automatisch besser: Mehr Schichten bedeuten mehr Parameter, mehr Trainingsdaten- und Rechenbedarf und ein höheres Risiko für Overfitting, wenn die Datenmenge nicht mitwächst.
Ein Beispiel: Ziffernerkennung
Ein Bild einer handgeschriebenen Ziffer wird als Zahlenraster eingegeben. Frühe Schichten reagieren auf Kanten, mittlere auf Bögen und Linienkreuzungen, die letzte Schicht liefert zehn Werte – einen je Ziffer. Der höchste Wert ist die Vorhersage. Beim Training werden die Gewichte so angepasst, dass die richtige Ziffer immer höher bewertet wird.
Warum die Aktivierungsfunktion zählt
Ohne nichtlineare Aktivierung ließe sich ein ganzes Netz auf eine einzige lineare Rechnung zusammenfassen und könnte nur lineare Zusammenhänge lernen. Erst die Nichtlinearität erlaubt es, komplexe Muster abzubilden.
Praktische Hinweise
Vor dem Training Eingaben skalieren.
Auf einer kleinen Datenmenge prüfen, ob das Modell sie überhaupt lernen kann, bevor man groß trainiert.
Verlauf von Trainings- und Validierungsfehler beobachten, um Überanpassung früh zu erkennen.
Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.
Quellen
Ian Goodfellow, Yoshua Bengio, Aaron Courville – „Deep Learning“ (MIT Press, 2016) (allgemeine Referenz, nicht Zeile für Zeile geprüft)
Rumelhart, Hinton, Williams – „Learning representations by back-propagating errors“ (Nature, 1986)
Vaswani et al. – „Attention Is All You Need“ (NeurIPS, 2017)
Reinforcement Learning: Agent, Belohnung, Policy
Begriffe vorab
Episode: ein vollständiger Durchlauf von Start bis Ende, etwa eine Spielrunde.
Diskontierung: spätere Belohnungen zählen weniger als sofortige.
Umgebung (Environment): alles, womit der Agent interagiert.
Lernen durch Ausprobieren
Reinforcement Learning (RL, bestärkendes Lernen) unterscheidet sich grundlegend von überwachtem und unüberwachtem Lernen: Ein Agent interagiert mit einer Umgebung (Environment), trifft Aktionen und erhält dafür ein Feedback-Signal, die Belohnung (Reward). Ziel ist es, eine Strategie (Policy) zu lernen, die die kumulierte Belohnung über die Zeit maximiert – nicht die sofortige, sondern die langfristige.
Die Grundbegriffe
Zustand (State): die aktuelle Situation, die der Agent wahrnimmt.
Aktion (Action): was der Agent in diesem Zustand tun kann.
Belohnung (Reward): ein Zahlenwert, der signalisiert, wie gut oder schlecht eine Aktion in der jeweiligen Situation war.
Policy: die (oft wahrscheinlichkeitsbasierte) Regel, nach der der Agent Aktionen wählt.
Value Function: eine Schätzung, wie viel zukünftige Belohnung von einem Zustand aus zu erwarten ist.
Erforschen versus Ausnutzen
Ein zentrales Dilemma ist der Explore-Exploit-Trade-off: Soll der Agent eine bekannte, gut funktionierende Aktion wiederholen (Exploit), oder eine unbekannte Aktion ausprobieren, die sich am Ende als noch besser herausstellen könnte (Explore)? Reine Ausnutzung verpasst möglicherweise bessere Strategien, reine Erforschung verschenkt bereits bekannten Nutzen.
Bekannte Meilensteine
DeepMinds AlphaGo (2016) besiegte erstmals einen menschlichen Weltklassespieler im Brettspiel Go, unter anderem mit Reinforcement Learning kombiniert mit tiefen neuronalen Netzen. Auch das Training moderner Sprachmodelle nutzt RL-Techniken, etwa RLHF (Reinforcement Learning from Human Feedback), bei dem menschliche Bewertungen als Belohnungssignal dienen, um Modellantworten hilfreicher und sicherer zu machen.
RL-Agenten optimieren exakt das Belohnungssignal, das man ihnen vorgibt – nicht notwendigerweise das, was man eigentlich gemeint hat. Schlecht entworfene Belohnungen führen zu unerwünschtem, aber im Sinne der Belohnung „korrektem“ Verhalten (Reward Hacking).
Ein durchgespieltes Beispiel: Labyrinth
Ein Agent soll in einem Gitter zum Ausgang finden. Jeder Schritt kostet eine kleine Strafe, der Ausgang bringt eine große Belohnung. Anfangs bewegt er sich zufällig, merkt sich aber, welche Schritte in welchen Feldern langfristig zur Belohnung führten. Nach vielen Episoden wählt er den kürzesten Weg. Er musste nie wissen, wie das Labyrinth aussieht – nur Erfahrung sammeln.
Warum das schwierig ist
Verzögerte Belohnung: Welcher frühere Schritt war für den späteren Erfolg verantwortlich?
Datenhunger: Oft sind sehr viele Versuche nötig, die in der Realität teuer oder gefährlich wären. Deshalb trainiert man häufig in Simulationen.
Belohnungsdesign: Schlecht gewählte Belohnungen führen zu unerwünschtem Verhalten.
Wo es eingesetzt wird
Bei Spielen, Robotersteuerung und Empfehlungssystemen. Wo echte Fehlversuche teuer sind, kombiniert man es oft mit Simulation oder mit Lernen aus vorhandenen Daten.
Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.
Quellen
Richard S. Sutton, Andrew G. Barto – „Reinforcement Learning: An Introduction“ (2. Auflage, MIT Press, 2018)
Silver et al. – „Mastering the game of Go with deep neural networks and tree search“ (Nature, 2016)
OpenAI/Anthropic – Veröffentlichungen zu RLHF beim Training von Sprachmodellen
Supervised Learning: Regression und Klassifikation
Begriffe vorab
Überwachtes Lernen: Lernen aus Beispielen mit bekannter richtiger Antwort.
Zielgröße: der Wert, den das Modell vorhersagen soll.
Hyperparameter: Einstellungen des Verfahrens, die man vor dem Training festlegt, etwa die Baumtiefe.
Lernen mit Lehrer
Beim überwachten Lernen (Supervised Learning) bekommt das Modell zu jedem Trainingsbeispiel die richtige Antwort (das Label) mitgeliefert. Es lernt eine Funktion, die von Eingaben auf diese Ausgaben abbildet, und wendet sie danach auf neue, unbeschriftete Beispiele an.
Zwei Grundaufgaben
Regression: Die Ausgabe ist eine kontinuierliche Zahl, z. B. der vorhergesagte Hauspreis oder die Temperatur morgen. Klassisches Beispiel: die lineare Regression, die eine Gerade (oder Hyperebene) durch die Datenpunkte legt.
Klassifikation: Die Ausgabe ist eine von mehreren Kategorien, z. B. „Spam“/„kein Spam“ oder eine von zehn Ziffern auf einem Bild. Klassische Verfahren sind die logistische Regression, Entscheidungsbäume, Random Forests und Support Vector Machines.
Wie das Training abläuft
Ein Algorithmus (häufig eine Variante des Gradientenabstiegs) passt die Modellparameter schrittweise so an, dass eine Verlustfunktion (Loss Function) minimiert wird – ein Maß dafür, wie stark die Vorhersagen von den echten Labels abweichen. Bei Regression ist das oft der mittlere quadratische Fehler, bei Klassifikation häufig die Kreuzentropie.
Typische Algorithmen im Überblick
k-nächste Nachbarn (k-NN): sagt anhand der ähnlichsten bekannten Beispiele voraus, ohne ein explizites Modell zu „lernen“.
Entscheidungsbäume: teilen die Daten anhand einer Folge von Ja/Nein-Fragen auf; leicht interpretierbar.
Random Forest: kombiniert viele Entscheidungsbäume zu einem robusteren Gesamtmodell (Ensemble-Methode).
Support Vector Machines (SVM): suchen die Trennlinie mit dem größten Abstand zu den Datenpunkten beider Klassen.
Ein Modell, das auf den Trainingsdaten perfekt abschneidet, aber auf Testdaten deutlich schlechter, hat wahrscheinlich die Trainingsdaten überangepasst (Overfitting, siehe die Lektion zu Evaluation) statt echte, verallgemeinerbare Muster gelernt.
Ein Beispiel für jede Aufgabe
Regression: Aus Wohnfläche, Lage und Baujahr soll der Mietpreis geschätzt werden. Das Ergebnis ist eine Zahl. Klassifikation: Aus Laborwerten soll eine Diagnosekategorie bestimmt werden. Das Ergebnis ist eine Klasse. Der Unterschied liegt allein in der Art der Zielgröße, nicht im Grundprinzip.
Wie man ein Verfahren wählt
Einfache Modelle wie die lineare oder logistische Regression sind schnell und gut erklärbar; sie eignen sich als Ausgangspunkt. Bäume und Random Forests kommen mit nichtlinearen Zusammenhängen zurecht und benötigen wenig Vorverarbeitung. Komplexere Modelle lohnen sich erst, wenn einfache nachweislich nicht reichen. Ein vernünftiger Ablauf: mit einem einfachen Modell beginnen, als Vergleichsmaßstab behalten und nur bei echtem Gewinn steigern.
Typische Fehler
Merkmale verwenden, die erst nach dem Ereignis bekannt sind (Datenleck) – das Modell wirkt im Test hervorragend und versagt im Einsatz.
Unausgewogene Klassen ignorieren.
Nur auf einer einzigen Aufteilung der Daten bewerten.
Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.
Quellen
Christopher M. Bishop – „Pattern Recognition and Machine Learning“ (Springer, 2006)
Trevor Hastie, Robert Tibshirani, Jerome Friedman – „The Elements of Statistical Learning“ (2. Auflage, Springer)
scikit-learn-Dokumentation – „Supervised learning“ (allgemeine Referenz, nicht Zeile für Zeile geprüft)
Unsupervised Learning: Clustering und Dimensionsreduktion
Begriffe vorab
Cluster: eine Gruppe ähnlicher Datenpunkte.
Distanzmaß: Regel, nach der man die Ähnlichkeit zweier Punkte misst, etwa den euklidischen Abstand.
Hauptkomponente: eine neue Achse, die möglichst viel Streuung der Daten erfasst.
Lernen ohne Lehrer
Beim unüberwachten Lernen gibt es keine Labels – das Modell soll allein aus der Struktur der Daten Muster, Gruppen oder eine kompaktere Darstellung finden. Das ist nützlich, wenn Labels fehlen, zu teuer in der Beschaffung sind oder man die Daten zunächst überhaupt erst verstehen möchte.
Clustering: Gruppen finden
Clustering fasst ähnliche Datenpunkte zu Gruppen (Clustern) zusammen. Der bekannteste Algorithmus ist k-Means: Er wählt k Zentren, ordnet jeden Punkt dem nächsten Zentrum zu und verschiebt die Zentren anschließend wiederholt an den Mittelpunkt ihrer Gruppe, bis sich nichts mehr ändert. Die Zahl k muss vorab festgelegt werden, etwa mit Hilfe der „Ellbogen-Methode“. Andere Verfahren wie DBSCAN finden Cluster beliebiger Form und erkennen dabei auch Ausreißer (Rauschen), ohne die Clusterzahl vorher zu kennen.
Dimensionsreduktion: Komplexität verringern
Daten mit vielen Merkmalen (hochdimensionale Daten) sind schwer zu visualisieren und rechnerisch aufwendig. Dimensionsreduktion bildet sie auf weniger Dimensionen ab und behält dabei möglichst viel der relevanten Information.
PCA (Principal Component Analysis, Hauptkomponentenanalyse): findet die Richtungen im Datenraum mit der größten Streuung und projiziert die Daten darauf.
t-SNE und UMAP: moderne Verfahren, die vor allem zur zweidimensionalen Visualisierung hochdimensionaler Daten (z. B. Worteinbettungen) genutzt werden, aber nicht unbedingt globale Abstände korrekt wiedergeben.
Anwendungsbeispiele
Kundensegmentierung im Marketing, Anomalieerkennung in Netzwerkverkehr oder Banktransaktionen, Themenfindung in großen Textsammlungen und die Vorverarbeitung von Bildern oder Gensequenzen vor einer weiteren Analyse.
Anders als bei überwachtem Lernen gibt es beim unüberwachten Lernen keine „richtige“ Antwort zum Nachrechnen – die Bewertung, ob ein gefundenes Cluster sinnvoll ist, bleibt oft eine fachliche, nicht nur eine rein mathematische Frage.
Ein Beispiel: Kundensegmente
Ein Shop hat Kaufdaten, aber keine Kundentypen. Clustering gruppiert Kundschaft nach Kaufverhalten: etwa Seltenkäufer mit hohem Warenkorb, Stammkunden mit kleinen Einkäufen, Schnäppchenjäger. Die Gruppen sind Vorschläge; erst das Fachwissen entscheidet, ob sie sinnvoll und nutzbar sind.
Worauf es ankommt
Skalierung: Merkmale in unterschiedlichen Größenordnungen sollten vorher angeglichen werden, sonst dominiert das größte Merkmal das Distanzmaß.
Clusterzahl: bei k-Means muss sie vorab gewählt werden; Kennzahlen und Fachwissen helfen bei der Entscheidung.
Stabilität: Ergebnisse mit verschiedenen Startwerten wiederholen und prüfen, ob sie ähnlich bleiben.
Dimensionsreduktion praktisch
PCA wird oft vor weiteren Verfahren eingesetzt, um Rauschen zu verringern oder Daten in zwei Dimensionen darzustellen. Dabei geht Information verloren; man prüft, wie viel der Streuung die behaltenen Komponenten noch erklären.
Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.
Quellen
Christopher M. Bishop – „Pattern Recognition and Machine Learning“, Kapitel 9 (Clustering)
Trevor Hastie, Robert Tibshirani, Jerome Friedman – „The Elements of Statistical Learning“, Kapitel 14
scikit-learn-Dokumentation – „Clustering“ und „Decomposing signals (PCA)“ (allgemeine Referenz, nicht Zeile für Zeile geprüft)
Was ist maschinelles Lernen?
Begriffe vorab
Algorithmus: eine Schritt-für-Schritt-Vorschrift zur Lösung einer Aufgabe.
Modell: das Ergebnis des Lernens – eine Funktion mit angepassten Parametern.
Training: das Anpassen der Parameter anhand von Daten.
Inferenz: das Anwenden des fertigen Modells auf neue Daten.
Eine klassische Definition
Der Informatiker Tom M. Mitchell definierte 1997 maschinelles Lernen so: Ein Programm lernt aus Erfahrung E in Bezug auf eine Aufgabe T und ein Leistungsmaß P, wenn sich seine Leistung bei T, gemessen mit P, durch E verbessert. Praktisch bedeutet das: Statt Regeln von Hand zu programmieren, zeigt man dem System viele Beispiele, und es leitet die Regeln selbst aus Mustern in den Daten ab.
Die Bausteine
Daten: die Beispiele, aus denen gelernt wird, z. B. E-Mails, Bilder oder Sensormesswerte.
Features (Merkmale): die Eigenschaften, die aus den Rohdaten extrahiert oder berechnet werden, etwa die Wortanzahl einer E-Mail oder die Durchschnittshelligkeit eines Bildes.
Labels (Beschriftungen): die gewünschte Antwort zu einem Beispiel, etwa „Spam“ oder „kein Spam“. Nicht jedes Verfahren braucht Labels (siehe Lernparadigmen).
Modell: die mathematische Funktion, die aus Features eine Vorhersage berechnet, und deren Parameter während des Trainings angepasst werden.
Training und Test trennen
Ein Modell, das nur an den Daten geprüft wird, an denen es auch trainiert wurde, kann seine Trainingsdaten schlicht auswendig lernen, ohne wirklich zu verallgemeinern. Deshalb teilt man den Datensatz üblicherweise auf: Ein Trainingsdatensatz dient zum Anpassen der Modellparameter, ein davon getrennter Testdatensatz zur ehrlichen Prüfung, wie gut das Modell auf neuen, ungesehenen Daten funktioniert. Eine gängige Faustregel teilt 70–80 % der Daten zum Training und 20–30 % zum Testen ab, oft ergänzt durch einen weiteren, dritten Validierungsdatensatz zur Modellauswahl während der Entwicklung.
Warum das gerade jetzt relevant ist
Drei Faktoren treiben den aktuellen Aufschwung: verfügbare große Datenmengen, günstigere Rechenleistung (insbesondere Grafikprozessoren, GPUs) und algorithmische Fortschritte, vor allem im Deep Learning. Zusammen erlauben sie Modelle, die vor zwei Jahrzehnten unpraktikabel gewesen wären.
Merksatz: Kein Feature, kein Lernen. Ein Modell kann nur Muster erkennen, die sich irgendwie aus den Eingabedaten ablesen lassen – fehlt die relevante Information komplett in den Daten, hilft kein noch so großes Modell.
Ein durchgespieltes Beispiel: Spam-Filter
Klassisch programmiert, schriebe man Regeln wie „enthält das Wort ‚Gewinn‘ → Spam“. Diese Regeln veralten schnell. Beim maschinellen Lernen zeigt man stattdessen tausende bereits sortierte E-Mails. Das Modell findet selbst Muster – Wortkombinationen, Absender, Linkanzahl – und bewertet damit neue Mails. Wenn sich Spam verändert, trainiert man mit neuen Beispielen nach, statt Regeln umzuschreiben.
Wann maschinelles Lernen sinnvoll ist
Regeln lassen sich schwer von Hand formulieren (Bilder, Sprache).
Es gibt viele Beispieldaten.
Die Umgebung ändert sich, und das Verfahren soll mitlernen können.
Umgekehrt lohnt es sich nicht, wenn die Regeln einfach und eindeutig sind – dann ist normaler Code robuster, billiger und nachvollziehbar.
Training und Inferenz
Training ist aufwendig und passiert meist einmalig oder in Abständen; Inferenz ist das alltägliche Anwenden und meist deutlich günstiger. Beides verbraucht Rechenzeit, aber in sehr unterschiedlichem Umfang.
Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.
Quellen
Tom M. Mitchell – „Machine Learning“ (McGraw-Hill, 1997), Kapitel 1
Ian Goodfellow, Yoshua Bengio, Aaron Courville – „Deep Learning“ (MIT Press, 2016), Kapitel 1–5 (allgemeine Referenz, nicht Zeile für Zeile geprüft)
Google – „Machine Learning Crash Course“ (Grundbegriffe) (allgemeine Referenz, nicht Zeile für Zeile geprüft)