Agenten: Sicherheit

Akademie

Agenten: Sicherheit

Prompt Injection, Lethal Trifecta, Rule of Two und die OWASP-Listen.

Sicherheit: Lethal Trifecta, Rule of Two und OWASP

Begriffe vorab

  • Prompt Injection: in Daten versteckte Anweisungen, die ein Modell zu unerwünschtem Verhalten bringen.
  • Exfiltration: unbefugtes Herausschleusen von Daten.
  • Human in the Loop: ein Mensch bestätigt kritische Aktionen.
  • Blast Radius (Schadensradius): der mögliche Schaden, wenn ein Angriff gelingt.
  • Agentenidentität: die Rechte und Zugangsdaten, mit denen ein Agent handelt.

Warum Agenten das Risiko verschärfen

Ein Chat-Modell kann falsche Aussagen machen. Ein Agent kann zusätzlich handeln: Dateien ändern, E-Mails senden, Zahlungen anstoßen. Liest er dabei fremde Inhalte, kann dort versteckter Text sein Verhalten lenken. Das Problem der Prompt Injection ist bislang nicht vollständig gelöst.

Die „Lethal Trifecta“

Simon Willison prägte im Juni 2025 den Begriff „lethal trifecta“ für die Kombination aus drei Fähigkeiten eines Agenten: Zugriff auf private Daten, Kontakt mit nicht vertrauenswürdigen Inhalten und die Möglichkeit, nach außen zu kommunizieren. Liegen alle drei vor, kann ein Angreifer den Agenten dazu bringen, private Daten zu verschicken.

Die Rule of Two

Metas KI-Sicherheitsteam veröffentlichte am 31. Oktober 2025 die „Agents Rule of Two“: Eine einzelne Agenten-Sitzung soll höchstens zwei von drei Eigenschaften haben – (A) nicht vertrauenswürdige Eingaben verarbeiten, (B) auf sensible Systeme oder private Daten zugreifen, (C) Zustand ändern oder nach außen kommunizieren. Braucht ein Ablauf alle drei, soll der Agent nicht autonom arbeiten, sondern mindestens durch menschliche Freigabe oder eine andere verlässliche Prüfung überwacht werden.

Warum einfache Filter nicht reichen

In der Arbeit „The Attacker Moves Second“ (14 Autorinnen und Autoren von OpenAI, Anthropic und Google DeepMind, 10. Oktober 2025) wurden zwölf veröffentlichte Verteidigungen gegen Prompt Injection mit anpassungsfähigen Angriffen getestet; nach Berichten fielen alle. Schutz entsteht deshalb vor allem durch den Aufbau des Systems, nicht durch einen einzelnen Filter.

Die OWASP-Listen

OWASP veröffentlichte im Februar 2025 den Leitfaden „Agentic AI – Threats and Mitigations“ und am 9. Dezember 2025 die „Top 10 for Agentic Applications 2026“. Zu den zehn Risikokategorien gehören unter anderem das Kapern von Agentenzielen, Missbrauch von Werkzeugen, Missbrauch von Identitäten und Rechten, Schwachstellen in der Lieferkette, unerwartete Code-Ausführung, Vergiftung von Gedächtnis und Kontext, unsichere Kommunikation zwischen Agenten, Kaskadenfehler, Ausnutzen menschlichen Vertrauens und „Rogue Agents“.

Ein Beispiel

Ein Mail-Agent darf Postfach lesen (B), verarbeitet eingehende fremde Mails (A) und kann Antworten senden (C). Eine Mail mit versteckter Anweisung könnte ihn dazu bringen, Inhalte an Dritte zu senden. Maßnahme nach der Rule of Two: Senden nur nach Freigabe durch einen Menschen, oder den Versand auf feste Empfänger beschränken.

Praktische Schutzschichten

  • Minimale Rechte je Aufgabe, getrennte Zugangsdaten für den Agenten.
  • Freigabe für Aktionen mit Außenwirkung.
  • Obergrenzen für Schritte, Kosten und Dauer.
  • Protokollierung aller Werkzeugaufrufe.
  • Isolierte Umgebung (Sandbox) für Code-Ausführung.

Kein Schutz ist absolut. Plane den Fall ein, dass ein Angriff gelingt, und begrenze dann den Schaden.

Zum Selbermachen

  1. Bewerte einen geplanten Agenten nach den drei Eigenschaften A, B, C.
  2. Streiche oder schütze mindestens eine Eigenschaft und lege die Freigabestelle fest.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Titel, Autoren, Jahre, Konferenzen, Zahlen und Aussagen der genannten Quellen wurden gegen Primär- bzw. Verzeichnisquellen geprüft. Nicht einzeln belegt: erklärende Darstellung, die Beispiele (konstruiert) und die Einordnung in eigenen Worten. Zu „The Attacker Moves Second“ liegt die Aussage zu den zwölf Verteidigungen aus Sekundärberichten vor, nicht aus eigener Durchsicht der Arbeit.

Quellen

  • Simon Willison – „The lethal trifecta for AI agents“ (Juni 2025)
  • Meta – „Agents Rule of Two: A Practical Approach to AI Agent Security“ (31. Oktober 2025)
  • „The Attacker Moves Second“ (Autorenteam von OpenAI, Anthropic und Google DeepMind, 10. Oktober 2025); Einordnung bei Simon Willison, „New prompt injection papers: Agents Rule of Two and The Attacker Moves Second“ (2. November 2025)
  • OWASP GenAI Security Project – „Agentic AI – Threats and Mitigations“ (Februar 2025)
  • OWASP GenAI Security Project – „OWASP Top 10 for Agentic Applications 2026“ (9. Dezember 2025)