Documentación

Benchmarks

Mide la calidad de un pipeline con escenarios reproducibles. Detecta regresiones antes de producción.

Benchmarks

Un benchmark es un conjunto de escenarios de evaluación reproducidos automáticamente contra un pipeline. Es la herramienta para medir objetivamente la calidad de un agente y detectar regresiones antes de que lleguen a producción.

Por qué

Un agente que «parecía funcionar» puede regresar silenciosamente tras:

  • un cambio de misión;
  • un cambio de modelo LLM;
  • la adición de una nueva herramienta.

Sin un benchmark, lo descubres en producción. Con un benchmark, el editor te avisa antes de publicar.

Anatomía de un escenario

Un escenario contiene:

  • Un estímulo — la entrada que recibe el pipeline (mensaje, carga útil, llamada telefónica simulada).
  • Una secuencia esperada — los turnos de conversación, las herramientas llamadas, las salidas producidas.
  • Comprobaciones — aserciones explícitas: «el agente debe llamar a crm.search_customer», «la respuesta debe contener la palabra "reembolso"», «el pipeline debe completarse en menos de 3 turnos».

Catálogo de comprobaciones

ComprobaciónVerifica
tool_calledSe llamó a una herramienta específica (opcionalmente con argumentos concretos)
tool_not_calledNo se llamó a una herramienta (anti-falso-positivo)
output_containsLa salida del agente contiene un texto / patrón dado
output_matches_jsonLa salida JSON valida un esquema dado
turn_count_maxEl pipeline se completó en ≤ N turnos
cost_maxEl coste total es ≤ N créditos
latency_maxLa duración es ≤ N segundos
branch_takenUna condición enrutó a la rama correcta

Las comprobaciones son extensibles: en el plan Enterprise, puedes añadir comprobaciones personalizadas mediante un operador.

Crear un benchmark

  1. Diseñador → Benchmarks → Nuevo benchmark.
  2. Elige el pipeline de destino.
  3. Añade escenarios. Puedes:
    • Elaborar manualmente (la opción más precisa).
    • Capturar desde el historial — convertir una ejecución real en un escenario (con anonimización).

Un buen benchmark incluye una mezcla: caso nominal, casos límite, casos adversariales (intentos de manipulación, ambigüedad, datos ausentes).

Ejecutar un benchmark

Desde la interfaz de administración:

  • Ejecución única — resultados inmediatos, drawer con detalle por escenario.
  • Ejecución programada — cada noche, en cada publicación de nueva versión, etc.

El informe muestra:

  • Tasa de aprobación por comprobación
  • Regresión respecto a la versión anterior
  • Lista de escenarios fallidos, con un diff respecto al resultado esperado

Buenas prácticas

  • Empieza pequeño — 5 escenarios bien orientados valen más que 50 aproximados.
  • Haz benchmark antes de cada publicación. El editor puede bloquear la publicación si el benchmark regresa.
  • Versiona tus misiones. No solo los pipelines: las misiones también evolucionan.
  • Mantén las comprobaciones legibles. Una comprobación que requiere 20 líneas de explicación para entenderse es una comprobación que hay que descomponer.