Multi-Agenten-Systeme: Rollen, Orchestrierung, Generative Agents
Begriffe vorab
- Multi-Agenten-System: mehrere Agenten, die zusammenarbeiten oder miteinander kommunizieren.
- Rolle: eine Aufgabe oder Perspektive, die einem Agenten zugewiesen wird.
- Gedächtnisstrom (Memory Stream): eine fortlaufende, in Sprache gespeicherte Aufzeichnung der Erlebnisse eines Agenten.
- Delegation: die Übergabe einer Teilaufgabe an einen anderen Agenten.
Wozu mehrere Agenten?
Mehrere Agenten lohnen sich, wenn Teilaufgaben unterschiedliche Anweisungen, Werkzeuge oder Perspektiven brauchen. Ein Agent mit einer langen, überladenen Anweisung und vielen Werkzeugen wählt häufiger falsch; mehrere Spezialisten mit kurzen Anweisungen sind leichter zu steuern und zu testen. Dem steht Mehraufwand gegenüber: Übergaben kosten Zeit und Geld, und Missverständnisse zwischen Agenten sind zusätzliche Fehlerquellen.
Orchestrator-Worker als Grundform
Die am häufigsten beschriebene Struktur ist das Orchestrator-Worker-Muster: Ein Orchestrator zerlegt die Aufgabe dynamisch, verteilt sie an Worker und führt die Ergebnisse zusammen (siehe die vorige Lektion). Der Orchestrator braucht dafür Überblick und klare Regeln, wann eine Aufgabe fertig ist.
Ein berühmtes Experiment: Generative Agents
Park et al. (UIST 2023) erweiterten ein Sprachmodell um einen Gedächtnisstrom, in dem alle Erlebnisse in natürlicher Sprache gespeichert werden, um verdichtete Reflexionen und um Planung. In einer Simulation im Stil des Spiels „Die Sims“ lebten 25 solcher Agenten in einer kleinen Stadt und konnten von Nutzenden in natürlicher Sprache angesprochen werden. Die Arbeit zeigt, wie sich aus Gedächtnis, Reflexion und Planung glaubwürdig wirkendes Verhalten ergeben kann; sie ist eine Forschungsdemonstration, kein Produktionssystem.
Ein Beispiel aus der Praxis
Ein Programmier-Team nutzt drei Rollen: einen Planer, der die Änderung beschreibt, einen Umsetzer, der den Code schreibt, und einen Prüfer, der Tests ausführt und Befunde zurückmeldet. Ein menschlicher Entwickler gibt die Änderung am Ende frei.
Mehr Agenten bedeuten nicht automatisch bessere Ergebnisse. Jede Übergabe ist eine Stelle, an der Information verloren gehen oder ein Fehler sich verstärken kann. Miss, ob die Aufteilung gegenüber einem einzelnen, gut ausgestatteten Agenten tatsächlich etwas bringt.
Zum Selbermachen
- Skizziere ein Drei-Rollen-System für eine Aufgabe aus deinem Alltag.
- Lege fest, welche Information jede Rolle übergeben muss und wer am Ende entscheidet.
Prüfstatus: Belegt (Stand 1. Oktober 2026): Titel, Autoren, Jahre, Konferenzen, Zahlen und Aussagen der genannten Quellen wurden gegen Primär- bzw. Verzeichnisquellen geprüft. Nicht einzeln belegt: erklärende Darstellung, die Beispiele (konstruiert) und die Einordnung in eigenen Worten. Die Aussagen zum Nutzen und zu den Nachteilen mehrerer Agenten sind Einordnung, keine Messung aus den genannten Quellen.
Quellen
- Park et al. – „Generative Agents: Interactive Simulacra of Human Behavior“ (UIST ’23, ACM, Oktober 2023)
- Anthropic – „Building effective agents“ (Dezember 2024): Orchestrator-Workers
- Lilian Weng – „LLM Powered Autonomous Agents“ (Juni 2023)
Muster: von der Verkettung zum Orchestrator
Begriffe vorab
- Muster (Pattern): eine bewährte Bauform für ein wiederkehrendes Problem.
- Orchestrator: ein zentrales Modell, das Aufgaben verteilt.
- Gate: eine programmatische Prüfung zwischen zwei Schritten.
- Voting: dieselbe Aufgabe mehrfach lösen und die Ergebnisse vergleichen.
Fünf Workflow-Muster
Anthropic beschreibt in „Building effective agents“ fünf Muster, die vom einfachen Workflow zum Agenten führen:
- Prompt Chaining (Verkettung): Eine Aufgabe wird in eine Folge von Schritten zerlegt, jeder Modellaufruf verarbeitet die Ausgabe des vorigen. Zwischen den Schritten können Prüfungen (Gates) stehen.
- Routing: Eingaben werden klassifiziert und an spezialisierte Folgeschritte geleitet, sodass jeder Prompt fokussiert bleibt.
- Parallelisierung: Modelle arbeiten gleichzeitig, die Ergebnisse werden programmatisch zusammengeführt – entweder als Sectioning (unabhängige Teilaufgaben) oder als Voting (dieselbe Aufgabe mehrfach für vielfältigere Ergebnisse).
- Orchestrator-Worker: Ein zentrales Modell zerlegt die Aufgabe dynamisch, verteilt sie an Worker-Modelle und fasst die Ergebnisse zusammen. Anders als bei der Parallelisierung sind die Teilaufgaben nicht vorab festgelegt.
- Evaluator-Optimizer: Ein Modell erzeugt, ein anderes bewertet; in einer Schleife verbessert sich das Ergebnis.
Ein durchgespieltes Beispiel: Übersetzung einer Produktseite
Prompt Chaining: Rohübersetzung → Fachbegriffe prüfen → Tonfall angleichen. Routing: Rechtstexte gehen an einen Prompt mit Rechtsvokabular, Marketingtexte an einen mit Markenstil. Parallelisierung (Voting): Drei Übersetzungen werden verglichen, Abweichungen markiert. Evaluator-Optimizer: Eine Prüfinstanz bewertet nach Kriterienliste, der Übersetzer verbessert, bis alle erfüllt sind. Orchestrator-Worker: sinnvoll, wenn nicht klar ist, wie viele Dateien betroffen sind.
Wie man die Muster wählt
- Mit der einfachsten Lösung beginnen und nur bei messbarem Nutzen erweitern.
- Jede Stufe misst Kosten, Zeit und Qualität – komplexere Muster erhöhen alle drei.
- Gates und Obergrenzen verhindern, dass Fehler sich fortpflanzen oder Schleifen endlos laufen.
In der Praxis werden die Muster kombiniert. Ein Orchestrator kann etwa Worker parallel starten und das Ergebnis über einen Evaluator laufen lassen.
Wann welches Muster?
Prompt Chaining passt, wenn sich eine Aufgabe sauber in feste Teilschritte zerlegen lässt und man Genauigkeit gegen Wartezeit tauscht. Routing lohnt sich bei klar unterscheidbaren Eingabearten, die verschiedene Behandlung brauchen. Parallelisierung hilft, wenn Teilaufgaben unabhängig sind oder mehrere Sichtweisen die Zuverlässigkeit erhöhen sollen. Orchestrator-Worker ist für Aufgaben gedacht, bei denen vorab unklar ist, welche Teilaufgaben entstehen, etwa Änderungen an mehreren Dateien. Evaluator-Optimizer setzt voraus, dass es klare Bewertungskriterien gibt und Nachbessern messbar hilft.
Typische Fehler beim Einsatz
- Ein Muster wird gewählt, weil es modern wirkt, nicht weil die Aufgabe es verlangt.
- Zwischenergebnisse werden nicht geprüft, sodass sich Fehler durch die Kette ziehen.
- Die Bewertungskriterien des Evaluators sind zu vage, und die Schleife dreht sich ohne Fortschritt.
- Es fehlt eine Obergrenze für Durchläufe und Kosten.
Zum Selbermachen
- Zerlege eine Aufgabe (zum Beispiel eine Zusammenfassung mit Quellenprüfung) in eine Verkettung mit mindestens einem Gate.
- Prüfe, ob ein zweiter Modellaufruf als Evaluator die Qualität messbar hebt – und was er kostet.
Prüfstatus: Belegt (Stand 1. Oktober 2026): Titel, Autoren, Jahre, Konferenzen, Zahlen und Aussagen der genannten Quellen wurden gegen Primär- bzw. Verzeichnisquellen geprüft. Nicht einzeln belegt: erklärende Darstellung, die Beispiele (konstruiert) und die Einordnung in eigenen Worten.
Quellen
- Anthropic – „Building effective agents“ (Dezember 2024): Prompt Chaining, Routing, Parallelization (Sectioning, Voting), Orchestrator-Workers, Evaluator-Optimizer