Techniken: RLHF, Constitutional AI, Red Teaming

LektionTechnikenca. 3 Min. Lesezeit

Begriffe vorab

  • Präferenzdaten: Paare von Antworten, bei denen Menschen angeben, welche besser ist.
  • Belohnungsmodell: ein Modell, das vorhersagt, welche Antworten Menschen bevorzugen würden.
  • Jailbreak: Versuch, Schutzmaßnahmen eines Modells zu umgehen.

Reinforcement Learning from Human Feedback (RLHF)

Die Grundidee von RLHF (Christiano et al., 2017, angewendet auf Sprachmodelle u. a. in OpenAIs InstructGPT-Arbeit von Ouyang et al., 2022) ist: Statt eine Belohnungsfunktion von Hand zu formulieren (was sich, wie in der vorigen Lektion gesehen, leicht falsch spezifizieren lässt), lässt man Menschen verschiedene Modellantworten vergleichen und bewerten. Aus diesen Vergleichen wird ein Belohnungsmodell trainiert, mit dem das eigentliche Sprachmodell per Reinforcement Learning weiter optimiert wird – in Richtung Antworten, die Menschen bevorzugen.

Constitutional AI

Constitutional AI (Bai et al., Anthropic, 2022) ergänzt dieses Prinzip: Statt sich für jede Bewertung auf menschliches Feedback zu verlassen, wird dem Modell eine Liste schriftlicher Prinzipien (eine „Konstitution“) vorgegeben. Das Modell kritisiert und überarbeitet eigene Antworten anhand dieser Prinzipien selbst, und ein weiteres Modell nutzt KI-generiertes Feedback basierend auf der Konstitution, um das trainierte Verhalten zu verfeinern. Das reduziert die Abhängigkeit von großen Mengen menschlicher Bewertungen für jeden einzelnen Trainingsschritt.

Red Teaming

Red Teaming bezeichnet den gezielten, oft adversarialen Versuch, ein System zu unerwünschtem Verhalten zu bewegen – etwa dazu, schädliche Inhalte zu erzeugen, Sicherheitsvorkehrungen zu umgehen oder falsche Informationen als Fakten auszugeben. Ziel ist, solche Schwachstellen vor einer breiten Veröffentlichung zu finden und zu beheben, statt sie erst im produktiven Einsatz durch reale Nutzende zu entdecken.

Wie diese Techniken zusammenspielen

In der Praxis werden diese Ansätze oft kombiniert: Red Teaming deckt Schwachstellen auf, RLHF und/oder Constitutional-AI-Verfahren passen das Modellverhalten entsprechend an, und der Zyklus wiederholt sich mit weiteren Testrunden.

Keine dieser Techniken macht ein Modell „beweisbar sicher“ – sie verringern beobachtbar unerwünschtes Verhalten, liefern aber keine mathematische Garantie, dass kein unerwünschtes Verhalten in bisher nicht getesteten Situationen auftritt.

Ein Beispiel für den RLHF-Ablauf

Ein Modell erzeugt zu einer Frage zwei Antworten. Menschliche Bewertende markieren die bessere. Aus vielen solcher Vergleiche lernt ein Belohnungsmodell, was bevorzugt wird. Anschließend wird das Sprachmodell so nachtrainiert, dass seine Antworten ein hohes Belohnungssignal erhalten. Der Vorgang wiederholt sich mit neuen Vergleichen.

Stärken und Grenzen

  • Stärke: Verhalten lässt sich anhand menschlicher Bewertung verbessern, auch wo sich Qualität schwer formal beschreiben lässt.
  • Grenze: Bewertende sind fehlbar und bevorzugen teils gefällige, selbstsicher klingende Antworten statt korrekter.
  • Grenze: Das Belohnungsmodell ist nur ein Stellvertreter; Modelle können lernen, es auszunutzen.

Red Teaming praktisch

Teams versuchen systematisch, ein Modell aus der Bahn zu werfen: mit Rollenspielen, verschleierten Anfragen, ungewöhnlichen Formaten und Mehrschritt-Strategien. Gefundene Schwächen fließen in Training und Schutzmaßnahmen ein. Da Angriffe sich weiterentwickeln, ist das ein dauerhafter Prozess, kein einmaliger Test.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Christiano et al. – „Deep Reinforcement Learning from Human Preferences“ (2017)
  • Ouyang et al. – „Training Language Models to Follow Instructions with Human Feedback“ (OpenAI, NeurIPS, 2022)
  • Bai et al. – „Constitutional AI: Harmlessness from AI Feedback“ (Anthropic, 2022)

Alles zu „Techniken“