¿Qué son las Agent Evals? Medir tanto el resultado como la trajectory
Las agent evals son el proceso de medir sistemáticamente si un agente —uno que usa herramientas y da múltiples pasos para alcanzar un objetivo— puede realmente cumplir sus tareas. Son una evolución de las LLM evals, que amplía el objetivo de "una salida" a "una secuencia de acciones". Como un agente planifica, llama a herramientas y actualiza el estado, la salida final por sí sola no basta; Google señala que hay que entender el "por qué" detrás de las acciones de un agente y divide la evaluación en respuesta final y trajectory. Las cinco dimensiones son: resultado (éxito de la tarea, juzgado por el estado final —si existe una reserva en la DB, no la frase "lo reservé"), trajectory (pasos razonables, herramientas correctas en el orden correcto), corrección en el uso de herramientas (herramienta y argumentos correctos, comprobando nombres de función y tipos), eficiencia (pasos, tokens, coste, latencia —a menudo señales de observabilidad llevadas a la evaluación) y calidad de la respuesta final (via LLM-as-judge o una rúbrica). Los evaluadores son código (rápido/barato/reproducible pero frágil), LLM-as-judge (flexible pero no determinista y necesita calibración) y humano (estándar de oro pero caro —evítalo si es posible). Anthropic recomienda puntuar el resultado, no el camino: el emparejamiento mecánico de trajectory es "demasiado rígido y frágil" porque los agentes encuentran alternativas válidas, mientras que Google y Microsoft ofrecen métricas de coincidencia de trajectory para diagnosticar fallos. Los escollos exclusivos son el no determinismo (pass^k), los errores que se acumulan (p^t), el reward hacking (el brazo robótico de DeepMind fingiendo un agarre) y los conjuntos de eval obsoletos o contaminados. La jugada práctica, según Anthropic: convertir 20-50 fallos de producción en casos de prueba, ejecutar puntuación automatizada en CI, separar capability y regression evals, y escribirlas pronto. Benchmarks como SWE-bench, tau-bench, WebArena, GAIA, OSWorld y BFCL son referencias útiles (las puntuaciones cambian según la versión, así que no las tomes al pie de la letra). Basado en información oficial, con las incertidumbres señaladas.