Dokumentation

Benchmarks

Die Pipeline-Qualität mit reproduzierbaren Szenarien messen. Regressionen vor der Produktion erkennen.

Benchmarks

Ein Benchmark ist ein Satz von Evaluierungsszenarien, die automatisch gegen eine Pipeline abgespielt werden. Es ist das Werkzeug, um die Agent-Qualität objektiv zu messen und Regressionen abzufangen, bevor sie die Produktion erreichen.

Warum

Ein Agent, der „zu funktionieren schien", kann still regressieren nach:

  • einer Missionsänderung;
  • einer Änderung des LLM-Modells;
  • dem Hinzufügen eines neuen Werkzeugs.

Ohne Benchmark entdecken Sie dies in der Produktion. Mit einem Benchmark warnt Sie der Editor, bevor Sie veröffentlichen.

Anatomie eines Szenarios

Ein Szenario enthält:

  • Einen Stimulus — die Eingabe, die die Pipeline erhält (Nachricht, Nutzlast, simulierter Telefonanruf).
  • Eine erwartete Sequenz — die Konversationsschritte, aufgerufenen Werkzeuge, produzierten Ausgaben.
  • Prüfungen — explizite Zusicherungen: „der Agent muss crm.search_customer aufrufen", „die Antwort muss das Wort ‚Erstattung' enthalten", „die Pipeline muss in weniger als 3 Schritten abschließen".

Prüfungskatalog

PrüfungVerifiziert
tool_calledEin bestimmtes Werkzeug wurde aufgerufen (optional mit bestimmten Argumenten)
tool_not_calledEin Werkzeug wurde nicht aufgerufen (Anti-False-Positive)
output_containsDie Agent-Ausgabe enthält einen gegebenen Text / ein gegebenes Muster
output_matches_jsonDie JSON-Ausgabe validiert ein gegebenes Schema
turn_count_maxDie Pipeline schloss in ≤ N Schritten ab
cost_maxDie Gesamtkosten sind ≤ N Credits
latency_maxDie Dauer ist ≤ N Sekunden
branch_takenEine Bedingung leitete zum korrekten Zweig

Prüfungen sind erweiterbar: Im Enterprise-Tarif können Sie über einen Operator benutzerdefinierte Prüfungen hinzufügen.

Einen Benchmark erstellen

  1. Designer → Benchmarks → Neuer Benchmark.
  2. Wählen Sie die Ziel-Pipeline.
  3. Fügen Sie Szenarien hinzu. Sie können:
    • Manuell erstellen (die präziseste Option).
    • Aus dem Verlauf erfassen — eine reale Ausführung in ein Szenario umwandeln (mit Anonymisierung).

Ein guter Benchmark enthält eine Mischung: Normalfall, Randfälle, adversariale Fälle (Manipulationsversuche, Mehrdeutigkeit, fehlende Daten).

Einen Benchmark ausführen

Über die Admin-Oberfläche:

  • Einzellauf — sofortige Ergebnisse, Drawer mit Detail pro Szenario.
  • Geplanter Lauf — jede Nacht, bei jeder Veröffentlichung einer neuen Version usw.

Der Bericht zeigt:

  • Bestehensrate pro Prüfung
  • Regression gegenüber der vorherigen Version
  • Liste der fehlgeschlagenen Szenarien, mit einem Diff gegen das erwartete Ergebnis

Bewährte Praktiken

  • Klein anfangen — 5 gut gezielte Szenarien sind mehr wert als 50 ungefähre.
  • Vor jeder Veröffentlichung benchmarken. Der Editor kann die Veröffentlichung blockieren, wenn der Benchmark regressiert.
  • Versionieren Sie Ihre Missionen. Nicht nur Pipelines: Auch Missionen entwickeln sich weiter.
  • Halten Sie Prüfungen lesbar. Eine Prüfung, die 20 Zeilen Erklärung zum Verständnis benötigt, ist eine Prüfung, die aufgeteilt werden muss.