Interpretierbarkeit: ein Blick ins Innere neuronaler Netze

LektionInterpretierbarkeitca. 3 Min. Lesezeit

Begriffe vorab

  • Aktivierung: der Wert, den ein Neuron bei einer bestimmten Eingabe annimmt.
  • Feature: ein Muster oder Konzept, das sich im Inneren des Netzes wiederfinden lässt.
  • Ablation: eine Komponente testweise abschalten, um ihren Einfluss zu prüfen.

Das Black-Box-Problem

Große neuronale Netze bestehen aus Milliarden einzelner, für sich genommen bedeutungsloser Zahlenwerte (Gewichte). Warum ein Modell in einem konkreten Fall eine bestimmte Ausgabe erzeugt, lässt sich daraus nicht unmittelbar ablesen – ein grundlegendes Hindernis, um Vertrauen in ein System aufzubauen oder Fehlverhalten systematisch zu verstehen, statt es nur äußerlich zu beobachten.

Mechanistic Interpretability

Der Begriff Mechanistic Interpretability wurde von Chris Olah geprägt, der später Anthropic mitbegründete. Das Ziel dieses Forschungszweigs geht über die bloße Erklärung einzelner Vorhersagen (wie bei den Verfahren SHAP oder LIME, siehe Lernpaket „Maschinelles Lernen“) hinaus: Er versucht, die internen Berechnungen eines neuronalen Netzes in nachvollziehbare, menschenlesbare Algorithmen zu „übersetzen“ – quasi ein trainiertes Modell nachträglich in verständlichen Code zurückzuübersetzen.

Circuits und Features

Dabei wird untersucht, welche einzelnen Komponenten (etwa bestimmte Neuronen oder Aufmerksamkeitsköpfe in einem Transformer) für bestimmte, klar abgrenzbare Konzepte oder Verhaltensweisen verantwortlich sind, und wie mehrere solcher Komponenten zusammen einen nachvollziehbaren „Schaltkreis“ (Circuit) bilden. Ein bekanntes Beispiel aus Anthropics Forschung sind sogenannte Induction Heads – spezifische Aufmerksamkeitsköpfe, die zum Wiedererkennen und Fortsetzen bereits gesehener Muster im Text beitragen, ein Baustein des In-Context-Lernens.

Warum das für Sicherheit relevant ist

Könnte man zuverlässig erkennen, welche internen Strukturen für ein bestimmtes, potenziell gefährliches Verhalten verantwortlich sind, ließe sich dieses Verhalten gezielter erkennen, erklären oder sogar gezielt unterdrücken – statt allein auf beobachtetes Ein-/Ausgabeverhalten (Black-Box-Tests wie Red Teaming) angewiesen zu sein.

Mechanistic Interpretability ist ein noch junges und aufwendiges Forschungsfeld. Bislang lassen sich damit nur Teile kleinerer Modelle oder ausgewählte, klar abgrenzbare Mechanismen größerer Modelle nachvollziehen – eine vollständige, verständliche „Übersetzung“ eines großen, modernen Modells ist derzeit nicht erreicht.

Ein Beispiel für eine Untersuchung

Man gibt einem Modell viele Sätze, in denen eine bestimmte Stadt vorkommt, und beobachtet, welche inneren Bereiche dabei besonders aktiv werden. Schaltet man diese Bereiche ab oder verstärkt sie, ändert sich möglicherweise, wie das Modell über diese Stadt spricht. Solche Eingriffe geben Hinweise darauf, ob der Bereich tatsächlich ursächlich beteiligt ist oder nur zufällig mitläuft.

Warum das schwierig ist

  • Einzelne Neuronen sind oft nicht eindeutig einem Konzept zugeordnet; viele Konzepte teilen sich dieselben Neuronen.
  • Große Modelle sind schlicht sehr groß und komplex.
  • Erklärungen, die plausibel klingen, sind nicht automatisch richtig – sie müssen durch Eingriffe überprüft werden.

Was man sich erhofft

Mit besserem Verständnis ließe sich prüfen, ob ein Modell intern auf problematische Weise arbeitet, und Verhalten gezielter steuern, statt nur von außen zu testen. Bisher ist dies ein Forschungsziel, kein ausgereiftes Werkzeug für den Alltag.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.

Quellen

  • Olah, Nanda, Olsson, Elhage et al. – „Transformer Circuits“-Forschungsreihe (Anthropic) (allgemeine Referenz, nicht Zeile für Zeile geprüft)
  • Wikipedia – „Mechanistic interpretability“ (Überblicksdarstellung mit Verweisen auf Primärquellen) (allgemeine Referenz, nicht Zeile für Zeile geprüft)

Alles zu „Interpretierbarkeit“