Evaluar el sistema
Un sistema multiagente que nadie mide es una apuesta cara. Empezar no requiere un benchmark grande.
Evaluaciones pequeñas, desde el principio
El equipo de investigación de Anthropic arrancó con alrededor de veinte consultas representativas del uso real. La configuración de juez más consistente fue una sola llamada, con un solo prompt, que devuelve un puntaje de 0.0 a 1.0 y una calificación de aprobado o no aprobado, con una rúbrica de cinco criterios: exactitud factual, exactitud de las citas, completitud, calidad de las fuentes y eficiencia en el uso de herramientas.
Lo más importante es qué se mide: el estado final alcanzado, no cada paso intermedio, porque los agentes toman caminos válidos distintos. Los verificadores no deben rechazar respuestas correctas por diferencias de formato o frases equivalentes. Las herramientas se evalúan con agentes, en tareas realistas que exijan muchas llamadas. Y el modelo se elige por evaluación: primero una línea base con los más capaces, después optimización de costo con modelos más pequeños donde se pueda.
Observar y depurar
Los agentes son no deterministas entre corridas, incluso con prompts idénticos, y mantienen estado a lo largo de muchas llamadas: por eso conviene poder reanudar desde donde ocurrió el error y desplazar el tráfico de forma gradual al desplegar. El tracing completo en producción es lo que permite diagnosticar de forma sistemática. En corridas largas aparecen tres degradaciones documentadas: pereza agéntica, sesgo autopreferencial y deriva del objetivo.