Agenten: Bausteine

Akademie

Agenten: Bausteine

Planen, Gedächtnis und Werkzeugnutzung: die Bausteine LLM-basierter Agenten.

Bausteine: Planen, Gedächtnis und Werkzeuge

Begriffe vorab

  • Planung: das Zerlegen einer Aufgabe in Teilschritte.
  • Gedächtnis: Information, die dem Agenten über einen einzelnen Aufruf hinaus zur Verfügung steht.
  • Kurzzeitgedächtnis: alles im aktuellen Kontext des Modells.
  • Langzeitgedächtnis: ausgelagerte Information, oft in einem Vektorspeicher, die bei Bedarf abgerufen wird.
  • Chain of Thought: eine Folge ausformulierter Zwischenschritte, die zum Ergebnis führt.
  • Reflexion: Rückblick auf eigene Versuche, um daraus zu lernen.

Drei Bausteine nach Lilian Weng

Lilian Weng gliedert in ihrem viel zitierten Überblick „LLM Powered Autonomous Agents“ (Juni 2023) das System um ein Sprachmodell als „Gehirn“ in drei Bausteine: Planung (Aufgaben in Teilziele zerlegen, eigene Handlungen kritisch prüfen und daraus lernen), Gedächtnis (Kurzzeit im Kontext, Langzeit durch externe Speicher mit schnellem Abruf) und Werkzeugnutzung (externe Schnittstellen für aktuelle Informationen, Code-Ausführung oder Zugriff auf proprietäre Quellen, die nicht in den Modellgewichten stecken).

Denken und Handeln verzahnen: ReAct

Das Verfahren ReAct (Yao et al., ICLR 2023) lässt das Modell abwechselnd Gedanken formulieren und Aktionen ausführen. In den Versuchen zu Frage-Antwort-Aufgaben (HotpotQA) und Faktenprüfung (FEVER) nutzte es eine einfache Wikipedia-Schnittstelle; das verringerte Halluzinationen und Fehlerfortpflanzung gegenüber reinen Gedankenketten (Chain of Thought, Wei et al., NeurIPS 2022) und machte den Lösungsweg nachvollziehbar.

Aus Fehlern lernen: Reflexion

Reflexion (Shinn et al., NeurIPS 2023) lässt einen Agenten nach einem gescheiterten Versuch in Worten festhalten, was schiefging, speichert diese Selbstreflexion als Erinnerung und versucht es mit diesem Wissen erneut. Beim Programmier-Benchmark HumanEval erreichte das Verfahren in der Studie 91 % (pass@1) gegenüber 80 % für GPT-4 ohne dieses Verfahren.

Werkzeuge nutzen lernen: Toolformer

Toolformer (Schick et al., NeurIPS 2023) zeigte, dass ein Sprachmodell selbstüberwacht lernen kann, wann es welche Schnittstelle mit welchen Argumenten aufruft und wie es das Ergebnis weiterverwendet – im Versuch mit Taschenrechner, Frage-Antwort-System, Suchmaschine, Übersetzer und Kalender.

Ein Beispiel für das Zusammenspiel

Ein Recherche-Agent soll „den Marktanteil von X in drei Ländern“ ermitteln. Planung: drei Teilaufgaben. Werkzeug: je eine Suche. Gedächtnis: Zwischenergebnisse werden notiert. Reflexion: Widerspricht eine Quelle der anderen, wird gezielt nachrecherchiert. Am Ende fasst er zusammen und nennt die Quellen.

Gedächtnis ist keine Magie: Was nicht im Kontext steht oder gezielt abgerufen wird, kennt der Agent nicht. Lange Läufe brauchen deshalb Strategien zum Zusammenfassen und Abrufen.

Zum Selbermachen

  1. Baue einen Mini-Agenten mit zwei Werkzeugen (Suche, Rechner) und beobachte den Verlauf Schritt für Schritt.
  2. Gib ihm absichtlich eine Aufgabe mit widersprüchlichen Quellen und sieh, ob er es bemerkt.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Titel, Autoren, Jahre, Konferenzen, Zahlen und Aussagen der genannten Quellen wurden gegen Primär- bzw. Verzeichnisquellen geprüft. Nicht einzeln belegt: erklärende Darstellung, die Beispiele (konstruiert) und die Einordnung in eigenen Worten. Die Prozentzahlen zu Reflexion stammen aus der Studie selbst; Messergebnisse hängen von Modell und Aufgabe ab und sind nicht auf andere Fälle übertragbar.

Quellen

  • Lilian Weng – „LLM Powered Autonomous Agents“ (lilianweng.github.io, 23. Juni 2023)
  • Yao et al. – „ReAct: Synergizing Reasoning and Acting in Language Models“ (ICLR 2023, arXiv 2210.03629)
  • Wei et al. – „Chain-of-Thought Prompting Elicits Reasoning in Large Language Models“ (NeurIPS 2022)
  • Shinn et al. – „Reflexion: Language Agents with Verbal Reinforcement Learning“ (NeurIPS 2023)
  • Schick et al. – „Toolformer: Language Models Can Teach Themselves to Use Tools“ (NeurIPS 2023)