Begriffe vorab
- Risiko: Wahrscheinlichkeit mal Schaden eines unerwünschten Ereignisses.
- Angriffsfläche: alle Stellen, über die ein System beeinflusst werden kann.
- Least Privilege: nur die Rechte vergeben, die für die Aufgabe zwingend nötig sind.
Risiko-Landkarte
- Halluzinationen: falsche, aber überzeugende Aussagen. Folge: Fehlentscheidungen.
- Prompt Injection: Fremde Texte (Webseiten, Mails, Dokumente) enthalten versteckte Anweisungen, die das Modell befolgt.
- Datenabfluss: Vertrauliche Daten gelangen in Prompts, Logs oder zu Dritten.
- Zu weitreichende Rechte: Ein Agent mit Zugriff auf Dateien, Mails oder Konten kann Schaden anrichten.
- Unsicherer Code: Generierter Code kann Schwachstellen oder erfundene Pakete enthalten.
- Jailbreaks: Versuche, Schutzmechanismen zu umgehen.
- Social Engineering: Täuschend echte Texte für Betrug oder Phishing.
- Übermäßiges Vertrauen: Menschen prüfen Ergebnisse nicht mehr.
Grundprinzipien
- Geringste Rechte vergeben.
- Fremde Inhalte als nicht vertrauenswürdig behandeln.
- Mensch bei kritischen Aktionen bestätigen lassen.
- Ergebnisse prüfen, bevor sie verwendet werden.
- Sensible Daten minimieren.
Risiken nach Ursache sortiert
Hilfreich ist die Frage, woher ein Problem kommt. Modellfehler (Halluzination, falsche Rechnung) entstehen im Modell. Eingabeseitige Angriffe (Prompt Injection, Jailbreaks) kommen über Texte, die das Modell verarbeitet. Systemfehler entstehen durch zu weitreichende Rechte, fehlende Prüfung oder unsichere Speicherung von Schlüsseln. Menschliche Faktoren wie blindes Vertrauen sind häufig das größte Risiko.
Ein Beispiel für das Zusammenspiel
Ein Assistent darf E-Mails lesen und Antworten senden. Eine eingehende Nachricht enthält versteckt die Anweisung, vertrauliche Inhalte an eine fremde Adresse zu schicken. Jedes Einzelteil ist harmlos – die Kombination aus Zugriff auf private Daten, Kontakt mit fremden Inhalten und Sendefähigkeit macht den Angriff möglich (von Simon Willison „lethal trifecta“ genannt). Schutz heißt deshalb meist, mindestens eine dieser Zutaten zu entfernen oder eine menschliche Freigabe einzubauen.
Schutzschichten statt Einzelmaßnahme
- Begrenzen: wenige, klar umrissene Rechte und Werkzeuge.
- Trennen: fremde Inhalte als nicht vertrauenswürdig kennzeichnen.
- Bestätigen: kritische Aktionen nur nach menschlicher Freigabe.
- Prüfen und protokollieren: Ein- und Ausgaben kontrollieren und nachvollziehbar machen.
Zum Selbermachen: eine Risikoeinschätzung
- Wähle einen Einsatz, den du planst (zum Beispiel einen Assistenten für Kundenmails).
- Liste auf, welche Daten er sieht und welche Aktionen er ausführen darf.
- Bewerte je Risiko (Halluzination, Injection, Datenabfluss) Wahrscheinlichkeit und Schaden.
- Lege für die drei größten Risiken je eine Maßnahme fest.
Sicherheit beginnt vor dem Einsatz
Die wirksamste Zeit für Sicherheitsentscheidungen ist die Planung: Welche Daten sind nötig? Welche Rechte braucht das System wirklich? Was passiert, wenn es falsch liegt? Wer diese Fragen erst nach dem Start stellt, muss mit hohem Aufwand nachbessern. Je früher, desto günstiger.
Verantwortung bleibt beim Menschen
Auch mit allen Schutzmaßnahmen bleibt die Verantwortung für Ergebnisse bei den Menschen und Organisationen, die ein System einsetzen. Deshalb gehören klare Zuständigkeiten, dokumentierte Entscheidungen und ein Weg, Fehler zu melden, zu jedem ernsthaften Einsatz.
Prüfstatus: Belegt (Stand 1. Oktober 2026): Jahreszahlen, Zahlen, Namen und Quellenangaben dieser Lektion, soweit die Quellenliste sie nennt, wurden gegen Primärquellen geprüft. Nicht einzeln belegt: erklärende Darstellung nach Lehrbuchstand und Quellen, die in der Liste als „allgemeine Referenz“ markiert sind.
Quellen
- Anthropic – „Responsible Scaling Policy“ (anthropic.com)
- Model Context Protocol – offizielle Spezifikation (modelcontextprotocol.io) (allgemeine Referenz, nicht Zeile für Zeile geprüft)