Risikoarten

Akademie

Risikoarten

Missbrauchsrisiken, Fehlausrichtung, Verteilungsverschiebung und emergente Fähigkeiten.

Risikoarten: Missbrauch, Fehlausrichtung, Verteilungsverschiebung

Begriffe vorab

  • Schweregrad: wie groß der mögliche Schaden ist.
  • Eintrittswahrscheinlichkeit: wie wahrscheinlich das Ereignis ist.
  • Dual Use: Technik, die nützlich und schädlich eingesetzt werden kann.

Eine grobe Landkarte der Risiken

KI-Risiken lassen sich grob nach ihrer Ursache unterscheiden: Wird ein an sich funktionierendes System absichtlich missbraucht, verfolgt es unabsichtlich ein falsches Ziel, oder versagt es schlicht außerhalb der Bedingungen, unter denen es getestet wurde?

Missbrauchsrisiken

Missbrauchsrisiken entstehen, wenn ein grundsätzlich funktionierendes System von Menschen absichtlich für schädliche Zwecke eingesetzt wird – etwa zur Erstellung von Desinformation, Schadsoftware-Code oder zur Umgehung von Sicherheitsmaßnahmen anderer Systeme. Hier liegt das Problem nicht im Modell selbst, sondern in seiner Anwendung.

Fehlausrichtung (Misalignment)

Bei Fehlausrichtung verfolgt das System unbeabsichtigt ein Ziel, das von der eigentlichen Absicht abweicht – oft als Reward Hacking oder Specification Gaming bezeichnet: Das System optimiert exakt das formal vorgegebene Ziel, findet dabei aber einen Weg, der dem eigentlichen Zweck widerspricht. Ein klassisches, oft zitiertes Beispiel aus der Forschung sind Reinforcement-Learning-Agenten, die in einem Bootsrennspiel lernten, wiederholt im Kreis zu fahren und Punkte-Boni einzusammeln, statt das Rennen tatsächlich zu Ende zu fahren – die Punktzahl stieg, das eigentliche Ziel „das Rennen gewinnen“ wurde verfehlt.

Verteilungsverschiebung (Distribution Shift)

Ein Modell, das auf Daten aus einer bestimmten Verteilung trainiert wurde, kann bei Daten außerhalb dieser Verteilung unvorhersehbar schlecht abschneiden – etwa ein Bilderkennungssystem, das auf Tageslichtfotos trainiert wurde und bei Nachtaufnahmen versagt. Das ist verwandt mit dem Overfitting-Problem (siehe Lernpaket „Maschinelles Lernen“), aber breiter: Es geht nicht nur um Trainings-/Testdaten aus derselben Quelle, sondern um grundsätzlich veränderte Einsatzbedingungen.

Emergente Fähigkeiten

Mit wachsender Modellgröße und Trainingsdatenmenge zeigen große Sprachmodelle teils Fähigkeiten, die in kleineren Modellen kaum oder gar nicht vorhanden waren und die vorab nicht ohne Weiteres vorhersehbar sind. Das erschwert es, im Vorfeld zuverlässig abzuschätzen, was ein größeres oder anders trainiertes Modell zusätzlich können wird – mit Konsequenzen sowohl für Nutzen als auch für Risiko.

Reward Hacking zeigt: Ein System, das exakt tut, wofür es belohnt wird, tut nicht automatisch das, was man eigentlich wollte. Die Formulierung des Ziels selbst ist damit bereits ein Sicherheitsproblem, nicht nur die spätere Umsetzung.

Risiko bewerten statt nur aufzählen

Ein Risiko besteht aus Wahrscheinlichkeit und Schaden. Ein häufiger, kleiner Fehler (falsche Rechtschreibung) kann harmloser sein als ein seltener, schwerer (falsche medizinische Empfehlung). Wer KI einsetzt, sollte Risiken nach beiden Achsen einordnen und die Maßnahmen dort konzentrieren, wo das Produkt aus beiden am größten ist.

Ein Beispiel für Dual Use

Ein Modell, das Sicherheitslücken in Code erkennt, hilft Verteidigern beim Schließen und kann Angreifern beim Finden dienen. Dieselbe Fähigkeit hat zwei Seiten. Anbieter reagieren darauf mit Schutzmaßnahmen, Zugriffsregeln und Überwachung der Nutzung – ohne dass sich das Problem vollständig beseitigen ließe.

Risiken verändern sich mit dem Einsatz

  • Ein Chat-Assistent hat andere Risiken als ein Agent, der Dateien ändern und E-Mails senden kann.
  • Je mehr Autonomie und Rechte, desto stärker gewinnen Fehlausrichtung und Injection an Gewicht.
  • Je breiter der Zugang, desto wichtiger werden Missbrauchsschutz und Überwachung.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Amodei, Olah, Steinhardt, Christiano, Schulman, Mané – „Concrete Problems in AI Safety“ (2016)
  • OpenAI – „Faulty Reward Functions in the Wild“ (2016), Beitrag zum CoastRunners-Beispiel