Techniken

Akademie

Techniken

RLHF, Constitutional AI und Red Teaming als Verfahren, Modelle sicherer zu machen.

Interpretierbarkeit: ein Blick ins Innere neuronaler Netze

Begriffe vorab

  • Aktivierung: der Wert, den ein Neuron bei einer bestimmten Eingabe annimmt.
  • Feature: ein Muster oder Konzept, das sich im Inneren des Netzes wiederfinden lässt.
  • Ablation: eine Komponente testweise abschalten, um ihren Einfluss zu prüfen.

Das Black-Box-Problem

Große neuronale Netze bestehen aus Milliarden einzelner, für sich genommen bedeutungsloser Zahlenwerte (Gewichte). Warum ein Modell in einem konkreten Fall eine bestimmte Ausgabe erzeugt, lässt sich daraus nicht unmittelbar ablesen – ein grundlegendes Hindernis, um Vertrauen in ein System aufzubauen oder Fehlverhalten systematisch zu verstehen, statt es nur äußerlich zu beobachten.

Mechanistic Interpretability

Der Begriff Mechanistic Interpretability wurde von Chris Olah geprägt, der später Anthropic mitbegründete. Das Ziel dieses Forschungszweigs geht über die bloße Erklärung einzelner Vorhersagen (wie bei den Verfahren SHAP oder LIME, siehe Lernpaket „Maschinelles Lernen“) hinaus: Er versucht, die internen Berechnungen eines neuronalen Netzes in nachvollziehbare, menschenlesbare Algorithmen zu „übersetzen“ – quasi ein trainiertes Modell nachträglich in verständlichen Code zurückzuübersetzen.

Circuits und Features

Dabei wird untersucht, welche einzelnen Komponenten (etwa bestimmte Neuronen oder Aufmerksamkeitsköpfe in einem Transformer) für bestimmte, klar abgrenzbare Konzepte oder Verhaltensweisen verantwortlich sind, und wie mehrere solcher Komponenten zusammen einen nachvollziehbaren „Schaltkreis“ (Circuit) bilden. Ein bekanntes Beispiel aus Anthropics Forschung sind sogenannte Induction Heads – spezifische Aufmerksamkeitsköpfe, die zum Wiedererkennen und Fortsetzen bereits gesehener Muster im Text beitragen, ein Baustein des In-Context-Lernens.

Warum das für Sicherheit relevant ist

Könnte man zuverlässig erkennen, welche internen Strukturen für ein bestimmtes, potenziell gefährliches Verhalten verantwortlich sind, ließe sich dieses Verhalten gezielter erkennen, erklären oder sogar gezielt unterdrücken – statt allein auf beobachtetes Ein-/Ausgabeverhalten (Black-Box-Tests wie Red Teaming) angewiesen zu sein.

Mechanistic Interpretability ist ein noch junges und aufwendiges Forschungsfeld. Bislang lassen sich damit nur Teile kleinerer Modelle oder ausgewählte, klar abgrenzbare Mechanismen größerer Modelle nachvollziehen – eine vollständige, verständliche „Übersetzung“ eines großen, modernen Modells ist derzeit nicht erreicht.

Ein Beispiel für eine Untersuchung

Man gibt einem Modell viele Sätze, in denen eine bestimmte Stadt vorkommt, und beobachtet, welche inneren Bereiche dabei besonders aktiv werden. Schaltet man diese Bereiche ab oder verstärkt sie, ändert sich möglicherweise, wie das Modell über diese Stadt spricht. Solche Eingriffe geben Hinweise darauf, ob der Bereich tatsächlich ursächlich beteiligt ist oder nur zufällig mitläuft.

Warum das schwierig ist

  • Einzelne Neuronen sind oft nicht eindeutig einem Konzept zugeordnet; viele Konzepte teilen sich dieselben Neuronen.
  • Große Modelle sind schlicht sehr groß und komplex.
  • Erklärungen, die plausibel klingen, sind nicht automatisch richtig – sie müssen durch Eingriffe überprüft werden.

Was man sich erhofft

Mit besserem Verständnis ließe sich prüfen, ob ein Modell intern auf problematische Weise arbeitet, und Verhalten gezielter steuern, statt nur von außen zu testen. Bisher ist dies ein Forschungsziel, kein ausgereiftes Werkzeug für den Alltag.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Olah, Nanda, Olsson, Elhage et al. – „Transformer Circuits“-Forschungsreihe (Anthropic) (allgemeine Referenz, nicht Zeile für Zeile geprüft)
  • Wikipedia – „Mechanistic interpretability“ (Überblicksdarstellung mit Verweisen auf Primärquellen) (allgemeine Referenz, nicht Zeile für Zeile geprüft)

Techniken: RLHF, Constitutional AI, Red Teaming

Begriffe vorab

  • Präferenzdaten: Paare von Antworten, bei denen Menschen angeben, welche besser ist.
  • Belohnungsmodell: ein Modell, das vorhersagt, welche Antworten Menschen bevorzugen würden.
  • Jailbreak: Versuch, Schutzmaßnahmen eines Modells zu umgehen.

Reinforcement Learning from Human Feedback (RLHF)

Die Grundidee von RLHF (Christiano et al., 2017, angewendet auf Sprachmodelle u. a. in OpenAIs InstructGPT-Arbeit von Ouyang et al., 2022) ist: Statt eine Belohnungsfunktion von Hand zu formulieren (was sich, wie in der vorigen Lektion gesehen, leicht falsch spezifizieren lässt), lässt man Menschen verschiedene Modellantworten vergleichen und bewerten. Aus diesen Vergleichen wird ein Belohnungsmodell trainiert, mit dem das eigentliche Sprachmodell per Reinforcement Learning weiter optimiert wird – in Richtung Antworten, die Menschen bevorzugen.

Constitutional AI

Constitutional AI (Bai et al., Anthropic, 2022) ergänzt dieses Prinzip: Statt sich für jede Bewertung auf menschliches Feedback zu verlassen, wird dem Modell eine Liste schriftlicher Prinzipien (eine „Konstitution“) vorgegeben. Das Modell kritisiert und überarbeitet eigene Antworten anhand dieser Prinzipien selbst, und ein weiteres Modell nutzt KI-generiertes Feedback basierend auf der Konstitution, um das trainierte Verhalten zu verfeinern. Das reduziert die Abhängigkeit von großen Mengen menschlicher Bewertungen für jeden einzelnen Trainingsschritt.

Red Teaming

Red Teaming bezeichnet den gezielten, oft adversarialen Versuch, ein System zu unerwünschtem Verhalten zu bewegen – etwa dazu, schädliche Inhalte zu erzeugen, Sicherheitsvorkehrungen zu umgehen oder falsche Informationen als Fakten auszugeben. Ziel ist, solche Schwachstellen vor einer breiten Veröffentlichung zu finden und zu beheben, statt sie erst im produktiven Einsatz durch reale Nutzende zu entdecken.

Wie diese Techniken zusammenspielen

In der Praxis werden diese Ansätze oft kombiniert: Red Teaming deckt Schwachstellen auf, RLHF und/oder Constitutional-AI-Verfahren passen das Modellverhalten entsprechend an, und der Zyklus wiederholt sich mit weiteren Testrunden.

Keine dieser Techniken macht ein Modell „beweisbar sicher“ – sie verringern beobachtbar unerwünschtes Verhalten, liefern aber keine mathematische Garantie, dass kein unerwünschtes Verhalten in bisher nicht getesteten Situationen auftritt.

Ein Beispiel für den RLHF-Ablauf

Ein Modell erzeugt zu einer Frage zwei Antworten. Menschliche Bewertende markieren die bessere. Aus vielen solcher Vergleiche lernt ein Belohnungsmodell, was bevorzugt wird. Anschließend wird das Sprachmodell so nachtrainiert, dass seine Antworten ein hohes Belohnungssignal erhalten. Der Vorgang wiederholt sich mit neuen Vergleichen.

Stärken und Grenzen

  • Stärke: Verhalten lässt sich anhand menschlicher Bewertung verbessern, auch wo sich Qualität schwer formal beschreiben lässt.
  • Grenze: Bewertende sind fehlbar und bevorzugen teils gefällige, selbstsicher klingende Antworten statt korrekter.
  • Grenze: Das Belohnungsmodell ist nur ein Stellvertreter; Modelle können lernen, es auszunutzen.

Red Teaming praktisch

Teams versuchen systematisch, ein Modell aus der Bahn zu werfen: mit Rollenspielen, verschleierten Anfragen, ungewöhnlichen Formaten und Mehrschritt-Strategien. Gefundene Schwächen fließen in Training und Schutzmaßnahmen ein. Da Angriffe sich weiterentwickeln, ist das ein dauerhafter Prozess, kein einmaliger Test.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Christiano et al. – „Deep Reinforcement Learning from Human Preferences“ (2017)
  • Ouyang et al. – „Training Language Models to Follow Instructions with Human Feedback“ (OpenAI, NeurIPS, 2022)
  • Bai et al. – „Constitutional AI: Harmlessness from AI Feedback“ (Anthropic, 2022)