Ethik & Verantwortung

Akademie

Ethik & Verantwortung

Bias in Trainingsdaten, Fairness, Erklärbarkeit und regulatorische Rahmenbedingungen.

Ethik und Verantwortung im maschinellen Lernen

Begriffe vorab

  • Geschütztes Merkmal: z. B. Geschlecht, Herkunft oder Alter, nach dem nicht diskriminiert werden darf.
  • Proxy-Variable: ein scheinbar harmloses Merkmal, das ein geschütztes Merkmal indirekt abbildet, etwa die Postleitzahl.
  • Human in the Loop: ein Mensch trifft oder prüft die Entscheidung.

Bias beginnt in den Daten

Ein ML-Modell lernt die Muster, die in seinen Trainingsdaten stecken – einschließlich historischer Vorurteile und Ungleichgewichte. Sind bestimmte Gruppen in den Trainingsdaten unter- oder überrepräsentiert, oder spiegeln die Daten vergangene diskriminierende Praxis wider, übernimmt das Modell diesen Bias, selbst wenn niemand ihn beabsichtigt hat. Ein bekanntes Beispiel sind Systeme zur automatisierten Vorauswahl von Bewerbungen, die historische Einstellungsmuster reproduzieren, statt sie zu korrigieren.

Fairness messen

Es gibt keine einzige, universelle Definition von „Fairness“ – verschiedene, mathematisch zum Teil unvereinbare Kriterien konkurrieren, etwa ob Fehlerraten über Gruppen hinweg gleich sein sollen (Equal Opportunity) oder ob Vorhersagen unabhängig von einem geschützten Merkmal sein sollen (Demographic Parity). Werkzeuge wie IBMs AI Fairness 360 oder Microsofts Fairlearn helfen, solche Metriken zu berechnen und Modelle entsprechend anzupassen.

Erklärbarkeit (Explainable AI, XAI)

Viele leistungsfähige Modelle, insbesondere tiefe neuronale Netze, sind für Menschen schwer nachzuvollziehen (Black-Box-Problem). Methoden wie SHAP oder LIME versuchen, für eine einzelne Vorhersage zu erklären, welche Eingabemerkmale sie wie stark beeinflusst haben – wichtig, wenn Entscheidungen (Kreditvergabe, medizinische Diagnosen) für Betroffene nachvollziehbar und anfechtbar sein müssen.

Regulatorischer Rahmen

Die EU-KI-Verordnung (AI Act) stuft KI-Systeme nach Risiko ein und verlangt für Hochrisiko-Anwendungen unter anderem Dokumentation, menschliche Aufsicht und Tests auf Diskriminierung. Das NIST AI Risk Management Framework in den USA liefert ein freiwilliges, aber breit rezipiertes Vorgehensmodell, um Risiken von KI-Systemen über ihren gesamten Lebenszyklus zu identifizieren und zu steuern.

„Die Daten sagen es einfach so“ ist keine neutrale Aussage. Datensammlung, Feature-Auswahl und die Definition des Vorhersageziels sind menschliche Entscheidungen mit Wertungen – auch wenn das fertige Modell rein mathematisch wirkt.

Ein Beispiel für indirekte Diskriminierung

Ein Modell für Kreditentscheidungen darf das Geschlecht nicht verwenden. Es nutzt aber Merkmale wie Teilzeitbeschäftigung oder Berufsgruppe, die stark mit dem Geschlecht zusammenhängen. Das Modell kann so dieselbe Verzerrung reproduzieren, obwohl das geschützte Merkmal gar nicht enthalten ist. Das Entfernen eines Merkmals genügt deshalb nicht; man muss die Ergebnisse gruppenweise prüfen.

Fragen vor dem Einsatz

  • Wer ist von Entscheidungen betroffen, und können sie widersprechen?
  • Welche Kosten haben Fehler für wen?
  • Ist das Ergebnis erklärbar genug für die Situation?
  • Wer trägt die Verantwortung?

Verantwortung bleibt menschlich

Ein Modell kann Entscheidungen vorbereiten; die Verantwortung bleibt bei Menschen und Organisationen. Bei Entscheidungen mit erheblicher Wirkung auf Personen sind Dokumentation, Überprüfbarkeit und menschliche Aufsicht zentrale Anforderungen.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Verordnung (EU) 2024/1689 (KI-Verordnung, AI Act)
  • NIST – „AI Risk Management Framework“ (AI RMF 1.0)
  • IBM – AI Fairness 360 Toolkit; Microsoft – Fairlearn-Dokumentation
  • Ribeiro, Singh, Guestrin – „Why Should I Trust You? Explaining the Predictions of Any Classifier“ (LIME, KDD 2016)