Grundbegriffe: Alignment, Robustheit, Safety vs. Ethics

LektionGrundbegriffeca. 3 Min. Lesezeit

Begriffe vorab

  • Zielfunktion: die Größe, die ein System beim Training zu verbessern versucht.
  • Absicht: das, was Menschen mit dem System eigentlich erreichen wollen.
  • Fähigkeit vs. Ausrichtung: Ein System kann sehr leistungsfähig sein, ohne gut ausgerichtet zu sein.

Was bedeutet Alignment?

Alignment (Ausrichtung) bezeichnet das Bemühen, dass ein KI-System tatsächlich das tut, was die Menschen, die es entwickeln oder nutzen, damit beabsichtigen – und nicht nur, was es formal trainiert wurde zu optimieren. Diese beiden Dinge fallen nicht automatisch zusammen: Ein System kann sein Trainingsziel perfekt erfüllen und trotzdem in einer Weise handeln, die niemand wollte.

Outer und Inner Alignment

In der Forschungsdiskussion wird oft zwischen zwei Teilproblemen unterschieden: Outer Alignment fragt, ob das vorgegebene Trainingsziel (etwa eine Belohnungsfunktion) überhaupt korrekt das widerspiegelt, was man eigentlich erreichen will. Inner Alignment fragt, ob das trainierte System tatsächlich dieses Ziel intern „verfolgt“, statt zufällig ein anderes Ziel zu entwickeln, das auf den Trainingsdaten ebenfalls gut funktioniert, sich aber außerhalb davon anders verhält.

Robustheit

Robustheit beschreibt, wie verlässlich ein System auch unter Bedingungen funktioniert, die von den Trainingsdaten abweichen – etwa bei leicht verändertem Input, unerwarteten Situationen oder gezielten Angriffen (siehe Adversarial Examples: gezielt minimal veränderte Eingaben, die ein Modell in die Irre führen, obwohl sie für Menschen kaum verändert wirken).

Safety versus Ethics

Die beiden Begriffe überlappen sich, sind aber nicht identisch. AI Safety befasst sich primär mit der Vermeidung unbeabsichtigter, potenziell schädlicher Systemfehler und -verhalten. AI Ethics befasst sich breiter mit Fragen wie Fairness, Diskriminierung, Zustimmung und gesellschaftlichen Auswirkungen – Themen, die teils unabhängig davon relevant sind, ob ein System technisch „sicher“ im engeren Sinne funktioniert.

Ein hilfreiches Bild: Ein Auto kann technisch einwandfrei funktionieren (sicher im engen Sinne) und trotzdem ethisch fragwürdig eingesetzt werden, z. B. zur Überwachung ohne Zustimmung. Beide Fragen – funktioniert es wie gewollt, und ist das, was gewollt ist, vertretbar – sind eigenständig zu stellen.

Ein Alltagsbeispiel für eine Lücke zwischen Ziel und Absicht

Ein Empfehlungssystem soll die Verweildauer maximieren, weil sie als Maß für Zufriedenheit gilt. Es lernt, besonders aufregende oder polarisierende Inhalte zu zeigen, die Menschen länger fesseln – ohne dass sie das wünschen. Das System erfüllt sein Ziel, verfehlt aber die Absicht. Es zeigt, warum die Wahl des Ziels selbst eine Sicherheitsfrage ist.

Wichtige Unterscheidungen

  • Fähigkeit und Ausrichtung sind unabhängig: Je leistungsfähiger ein schlecht ausgerichtetes System, desto größer der mögliche Schaden.
  • Verhalten und Ziel: Man sieht nur das Verhalten; was intern „angestrebt“ wird, lässt sich schwer prüfen.
  • Test und Einsatz: Gutes Verhalten im Test garantiert es nicht in neuen Situationen.

Warum das Feld wächst

Mit steigender Leistung werden Systeme in wichtigeren Bereichen eingesetzt. Dadurch gewinnen Fragen an Gewicht, die bei einfachen Systemen kaum auffielen: Wie stellt man sicher, dass ein Modell auch dort vernünftig handelt, wo niemand es getestet hat?

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Amodei, Olah, Steinhardt, Christiano, Schulman, Mané – „Concrete Problems in AI Safety“ (2016)
  • NIST – „AI Risk Management Framework“ (AI RMF 1.0)

Alles zu „Grundbegriffe“