Benchmarks
Un benchmark es un conjunto de escenarios de evaluación reproducidos automáticamente contra un pipeline. Es la herramienta para medir objetivamente la calidad de un agente y detectar regresiones antes de que lleguen a producción.
Por qué
Un agente que «parecía funcionar» puede regresar silenciosamente tras:
- un cambio de misión;
- un cambio de modelo LLM;
- la adición de una nueva herramienta.
Sin un benchmark, lo descubres en producción. Con un benchmark, el editor te avisa antes de publicar.
Anatomía de un escenario
Un escenario contiene:
- Un estímulo — la entrada que recibe el pipeline (mensaje, carga útil, llamada telefónica simulada).
- Una secuencia esperada — los turnos de conversación, las herramientas llamadas, las salidas producidas.
- Comprobaciones — aserciones explícitas: «el agente debe llamar a
crm.search_customer», «la respuesta debe contener la palabra "reembolso"», «el pipeline debe completarse en menos de 3 turnos».
Catálogo de comprobaciones
| Comprobación | Verifica |
|---|---|
tool_called | Se llamó a una herramienta específica (opcionalmente con argumentos concretos) |
tool_not_called | No se llamó a una herramienta (anti-falso-positivo) |
output_contains | La salida del agente contiene un texto / patrón dado |
output_matches_json | La salida JSON valida un esquema dado |
turn_count_max | El pipeline se completó en ≤ N turnos |
cost_max | El coste total es ≤ N créditos |
latency_max | La duración es ≤ N segundos |
branch_taken | Una condición enrutó a la rama correcta |
Las comprobaciones son extensibles: en el plan Enterprise, puedes añadir comprobaciones personalizadas mediante un operador.
Crear un benchmark
- Diseñador → Benchmarks → Nuevo benchmark.
- Elige el pipeline de destino.
- Añade escenarios. Puedes:
- Elaborar manualmente (la opción más precisa).
- Capturar desde el historial — convertir una ejecución real en un escenario (con anonimización).
Un buen benchmark incluye una mezcla: caso nominal, casos límite, casos adversariales (intentos de manipulación, ambigüedad, datos ausentes).
Ejecutar un benchmark
Desde la interfaz de administración:
- Ejecución única — resultados inmediatos, drawer con detalle por escenario.
- Ejecución programada — cada noche, en cada publicación de nueva versión, etc.
El informe muestra:
- Tasa de aprobación por comprobación
- Regresión respecto a la versión anterior
- Lista de escenarios fallidos, con un diff respecto al resultado esperado
Buenas prácticas
- Empieza pequeño — 5 escenarios bien orientados valen más que 50 aproximados.
- Haz benchmark antes de cada publicación. El editor puede bloquear la publicación si el benchmark regresa.
- Versiona tus misiones. No solo los pipelines: las misiones también evolucionan.
- Mantén las comprobaciones legibles. Una comprobación que requiere 20 líneas de explicación para entenderse es una comprobación que hay que descomponer.