Agenten: Benchmarks

Akademie

Agenten: Benchmarks

SWE-bench, WebArena, GAIA und τ-bench – wie Agenten gemessen werden.

Benchmarks: wie man Agenten misst

Begriffe vorab

  • Benchmark: eine festgelegte Aufgabensammlung mit Bewertungsregel, an der man Systeme vergleicht.
  • Erfolgsrate: Anteil der Aufgaben, die vollständig gelöst werden.
  • Trajektorie: die Folge von Schritten, die ein Agent bis zum Ergebnis geht.
  • Überanpassung an den Benchmark: Systeme werden auf bekannte Testaufgaben optimiert und schneiden im Alltag schlechter ab.

Warum Agenten schwerer zu messen sind

Bei einem Modell prüft man eine Antwort. Bei einem Agenten zählt, ob die Aufgabe erledigt wurde – oft über viele Schritte, mit Werkzeugen und manchmal im Dialog mit einer Person. Gute Benchmarks simulieren deshalb eine Umgebung und prüfen das Endergebnis.

Vier viel genutzte Benchmarks

  • SWE-bench (Jimenez et al., ICLR 2024): 2.294 Softwareprobleme aus echten GitHub-Issues in 12 beliebten Python-Projekten. Das Modell soll den Code so ändern, dass das Problem behoben ist.
  • WebArena (Zhou et al., ICLR 2024): eine realistische, reproduzierbare Webumgebung mit funktionierenden Websites aus vier Bereichen – Onlinehandel, Diskussionsforum, gemeinsame Softwareentwicklung und Inhaltsverwaltung.
  • GAIA (Mialon et al., ICLR 2024): Fragen aus der Praxis, die Schlussfolgern, Multimodalität, Web-Recherche und Werkzeugnutzung verlangen. In der Veröffentlichung erreichten Menschen 92 %, GPT-4 mit Plug-ins 15 %.
  • τ-bench (Yao et al., 2024): bewertet Agenten im Zusammenspiel mit einer simulierten Nutzerin und Werkzeugen in Kundenservice-Bereichen, wobei domänenspezifische Regeln eingehalten werden müssen.

Ein Beispiel für die Lesart von Zahlen

Die 15 % bei GAIA stammen aus dem Jahr der Veröffentlichung und beschreiben ein damaliges Modell. Aktuelle Systeme schneiden deutlich anders ab; wer eine Zahl nennt, muss Modell, Version und Messzeitpunkt dazusagen.

Worauf man bei Ergebnissen achten sollte

  • Wurde auf einem Teil der Aufgaben trainiert oder abgestimmt, den andere nicht kennen?
  • Ist die Erfolgsrate über mehrere Läufe stabil? Agenten verhalten sich nicht deterministisch.
  • Wie viel kostet ein Lauf an Zeit und Geld?
  • Entspricht der Benchmark meinem Einsatzfall?

Der verlässlichste Test ist ein eigener: 20 bis 50 echte Aufgaben aus dem Einsatzgebiet, vorab festgelegte Erfolgskriterien, mehrere Läufe.

Zum Selbermachen

  1. Sammle 20 reale Aufgaben und lege fest, woran man „erledigt“ erkennt.
  2. Lass einen Agenten jede dreimal bearbeiten und vergleiche die Erfolgsrate und die Kosten.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Titel, Autoren, Jahre, Konferenzen, Zahlen und Aussagen der genannten Quellen wurden gegen Primär- bzw. Verzeichnisquellen geprüft. Nicht einzeln belegt: erklärende Darstellung, die Beispiele (konstruiert) und die Einordnung in eigenen Worten. Die genannten Prozentwerte sind Angaben der jeweiligen Veröffentlichung zum damaligen Stand.

Quellen

  • Jimenez et al. – „SWE-bench: Can Language Models Resolve Real-World GitHub Issues?“ (ICLR 2024)
  • Zhou et al. – „WebArena: A Realistic Web Environment for Building Autonomous Agents“ (ICLR 2024)
  • Mialon et al. – „GAIA: A Benchmark for General AI Assistants“ (ICLR 2024)
  • Yao, Shinn, Razavi, Narasimhan – „τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains“ (2024, arXiv 2406.12045)