Unsupervised Learning

Akademie

Unsupervised Learning

Muster in unbeschrifteten Daten finden: Clustering und Dimensionsreduktion.

Unsupervised Learning: Clustering und Dimensionsreduktion

Begriffe vorab

  • Cluster: eine Gruppe ähnlicher Datenpunkte.
  • Distanzmaß: Regel, nach der man die Ähnlichkeit zweier Punkte misst, etwa den euklidischen Abstand.
  • Hauptkomponente: eine neue Achse, die möglichst viel Streuung der Daten erfasst.

Lernen ohne Lehrer

Beim unüberwachten Lernen gibt es keine Labels – das Modell soll allein aus der Struktur der Daten Muster, Gruppen oder eine kompaktere Darstellung finden. Das ist nützlich, wenn Labels fehlen, zu teuer in der Beschaffung sind oder man die Daten zunächst überhaupt erst verstehen möchte.

Clustering: Gruppen finden

Clustering fasst ähnliche Datenpunkte zu Gruppen (Clustern) zusammen. Der bekannteste Algorithmus ist k-Means: Er wählt k Zentren, ordnet jeden Punkt dem nächsten Zentrum zu und verschiebt die Zentren anschließend wiederholt an den Mittelpunkt ihrer Gruppe, bis sich nichts mehr ändert. Die Zahl k muss vorab festgelegt werden, etwa mit Hilfe der „Ellbogen-Methode“. Andere Verfahren wie DBSCAN finden Cluster beliebiger Form und erkennen dabei auch Ausreißer (Rauschen), ohne die Clusterzahl vorher zu kennen.

Dimensionsreduktion: Komplexität verringern

Daten mit vielen Merkmalen (hochdimensionale Daten) sind schwer zu visualisieren und rechnerisch aufwendig. Dimensionsreduktion bildet sie auf weniger Dimensionen ab und behält dabei möglichst viel der relevanten Information.

  • PCA (Principal Component Analysis, Hauptkomponentenanalyse): findet die Richtungen im Datenraum mit der größten Streuung und projiziert die Daten darauf.
  • t-SNE und UMAP: moderne Verfahren, die vor allem zur zweidimensionalen Visualisierung hochdimensionaler Daten (z. B. Worteinbettungen) genutzt werden, aber nicht unbedingt globale Abstände korrekt wiedergeben.

Anwendungsbeispiele

Kundensegmentierung im Marketing, Anomalieerkennung in Netzwerkverkehr oder Banktransaktionen, Themenfindung in großen Textsammlungen und die Vorverarbeitung von Bildern oder Gensequenzen vor einer weiteren Analyse.

Anders als bei überwachtem Lernen gibt es beim unüberwachten Lernen keine „richtige“ Antwort zum Nachrechnen – die Bewertung, ob ein gefundenes Cluster sinnvoll ist, bleibt oft eine fachliche, nicht nur eine rein mathematische Frage.

Ein Beispiel: Kundensegmente

Ein Shop hat Kaufdaten, aber keine Kundentypen. Clustering gruppiert Kundschaft nach Kaufverhalten: etwa Seltenkäufer mit hohem Warenkorb, Stammkunden mit kleinen Einkäufen, Schnäppchenjäger. Die Gruppen sind Vorschläge; erst das Fachwissen entscheidet, ob sie sinnvoll und nutzbar sind.

Worauf es ankommt

  • Skalierung: Merkmale in unterschiedlichen Größenordnungen sollten vorher angeglichen werden, sonst dominiert das größte Merkmal das Distanzmaß.
  • Clusterzahl: bei k-Means muss sie vorab gewählt werden; Kennzahlen und Fachwissen helfen bei der Entscheidung.
  • Stabilität: Ergebnisse mit verschiedenen Startwerten wiederholen und prüfen, ob sie ähnlich bleiben.

Dimensionsreduktion praktisch

PCA wird oft vor weiteren Verfahren eingesetzt, um Rauschen zu verringern oder Daten in zwei Dimensionen darzustellen. Dabei geht Information verloren; man prüft, wie viel der Streuung die behaltenen Komponenten noch erklären.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Christopher M. Bishop – „Pattern Recognition and Machine Learning“, Kapitel 9 (Clustering)
  • Trevor Hastie, Robert Tibshirani, Jerome Friedman – „The Elements of Statistical Learning“, Kapitel 14
  • scikit-learn-Dokumentation – „Clustering“ und „Decomposing signals (PCA)“ (allgemeine Referenz, nicht Zeile für Zeile geprüft)