Benchmarks
Ein Benchmark ist ein Satz von Evaluierungsszenarien, die automatisch gegen eine Pipeline abgespielt werden. Es ist das Werkzeug, um die Agent-Qualität objektiv zu messen und Regressionen abzufangen, bevor sie die Produktion erreichen.
Warum
Ein Agent, der „zu funktionieren schien", kann still regressieren nach:
- einer Missionsänderung;
- einer Änderung des LLM-Modells;
- dem Hinzufügen eines neuen Werkzeugs.
Ohne Benchmark entdecken Sie dies in der Produktion. Mit einem Benchmark warnt Sie der Editor, bevor Sie veröffentlichen.
Anatomie eines Szenarios
Ein Szenario enthält:
- Einen Stimulus — die Eingabe, die die Pipeline erhält (Nachricht, Nutzlast, simulierter Telefonanruf).
- Eine erwartete Sequenz — die Konversationsschritte, aufgerufenen Werkzeuge, produzierten Ausgaben.
- Prüfungen — explizite Zusicherungen: „der Agent muss
crm.search_customeraufrufen", „die Antwort muss das Wort ‚Erstattung' enthalten", „die Pipeline muss in weniger als 3 Schritten abschließen".
Prüfungskatalog
| Prüfung | Verifiziert |
|---|---|
tool_called | Ein bestimmtes Werkzeug wurde aufgerufen (optional mit bestimmten Argumenten) |
tool_not_called | Ein Werkzeug wurde nicht aufgerufen (Anti-False-Positive) |
output_contains | Die Agent-Ausgabe enthält einen gegebenen Text / ein gegebenes Muster |
output_matches_json | Die JSON-Ausgabe validiert ein gegebenes Schema |
turn_count_max | Die Pipeline schloss in ≤ N Schritten ab |
cost_max | Die Gesamtkosten sind ≤ N Credits |
latency_max | Die Dauer ist ≤ N Sekunden |
branch_taken | Eine Bedingung leitete zum korrekten Zweig |
Prüfungen sind erweiterbar: Im Enterprise-Tarif können Sie über einen Operator benutzerdefinierte Prüfungen hinzufügen.
Einen Benchmark erstellen
- Designer → Benchmarks → Neuer Benchmark.
- Wählen Sie die Ziel-Pipeline.
- Fügen Sie Szenarien hinzu. Sie können:
- Manuell erstellen (die präziseste Option).
- Aus dem Verlauf erfassen — eine reale Ausführung in ein Szenario umwandeln (mit Anonymisierung).
Ein guter Benchmark enthält eine Mischung: Normalfall, Randfälle, adversariale Fälle (Manipulationsversuche, Mehrdeutigkeit, fehlende Daten).
Einen Benchmark ausführen
Über die Admin-Oberfläche:
- Einzellauf — sofortige Ergebnisse, Drawer mit Detail pro Szenario.
- Geplanter Lauf — jede Nacht, bei jeder Veröffentlichung einer neuen Version usw.
Der Bericht zeigt:
- Bestehensrate pro Prüfung
- Regression gegenüber der vorherigen Version
- Liste der fehlgeschlagenen Szenarien, mit einem Diff gegen das erwartete Ergebnis
Bewährte Praktiken
- Klein anfangen — 5 gut gezielte Szenarien sind mehr wert als 50 ungefähre.
- Vor jeder Veröffentlichung benchmarken. Der Editor kann die Veröffentlichung blockieren, wenn der Benchmark regressiert.
- Versionieren Sie Ihre Missionen. Nicht nur Pipelines: Auch Missionen entwickeln sich weiter.
- Halten Sie Prüfungen lesbar. Eine Prüfung, die 20 Zeilen Erklärung zum Verständnis benötigt, ist eine Prüfung, die aufgeteilt werden muss.