Engineering Core
Al principio el problema era el contexto.

Después la memoria.
Luego las tools, los skills, los tests y los gates.
Durante bastante tiempo seguí añadiendo cosas al sistema para intentar que los agentes trabajaran mejor, hasta que apareció una pregunta bastante más incómoda:
¿las estaban usando realmente?
Engineering Core intenta responderla.
Registra ejecuciones y reúne evidencia sobre qué modelo hizo el trabajo, cuántas iteraciones necesitó, qué herramientas utilizó, cuánto contexto consumió y cómo terminó la ejecución.
También permite observar algo que me interesa especialmente: si el agente consulta la memoria que tiene disponible y si devuelve al sistema algo de lo aprendido cuando termina.
No tengo resuelto todavía cómo medir todo lo que significa «hacer un buen trabajo». Pero al menos he dejado de depender únicamente de que el agente diga que lo ha hecho bien.