Microsoft y Hugging Face presentan ThinkingBox: agentes evaluados por lo que dejan en la base de datos
Un banco de 507 tareas empresariales con estado mide a los agentes por el estado final del sistema, no por sus respuestas; el 67% de los fallos terminaban «limpios» y sin errores.
Microsoft y Hugging Face publican ThinkingBox, un banco que evalúa agentes sobre 507 flujos de negocio con estado ejecutando cada tarea 20 veces y comprobando la base de datos. De 79.853 intentos fallidos en 12 modelos, el 67% terminó sin avisar de ningún error.
Qué ha ocurrido
El 3 de octubre Microsoft y Hugging Face publicaron una entrada conjunta de blog presentando ThinkingBox, un banco de pruebas de agentes disponible a través de OpenEnv en Hugging Face. A diferencia de los marcadores que puntúan respuestas o llamadas a herramientas válidas, ThinkingBox califica al agente por el estado terminal del backend y sus efectos secundarios: 507 flujos de negocio con estado (retail, seguros de automóviles, viajes, neobanco, consultoría), cada uno ejecutado 20 veces desde un backend limpio. El artículo acompaña la publicación de un paper.
Por qué importa
El trabajo documenta a escala la brecha entre «el agente dijo que hizo algo» y «la base de datos refleja que lo hizo»: de los 79.853 intentos que fallaron los chequeos ejecutables en la ablación de conjunto común (121.680 trials válidos, 12 modelos), el 67,24% terminó limpiamente, invocó una herramienta que cambia estado y no reportó errores finales; entre esos fallos silenciosos, el 77,61% dejaba valores de campo erróneos, el 43,30% efectos extra no deseados y el 25,36% faltaban efectos requeridos. Las métricas publicadas —pass@1, pass@20 y «observed 20/20» (tareas aprobadas en los 20 intentos)— separan por primera vez capacidad de fiabilidad repetible, la pregunta que frena a muchos despliegues empresariales de agentes.
Qué cambió
Qué sabemos · qué no
Confirmado
- Entrada de blog conjunta Microsoft–Hugging Face del 3 de octubre de 2026, con datos y tabla por dominio: mejor pass@1 global publicado, Claude Opus 5.5 con 67,16%; ningún modelo domina las tres métricas.
- El ejemplo de detalle (un ticket de devolución cerrado como «resuelto» cuando el estado requerido era «en espera») procede de la tarea test_case_ST003_006 del propio benchmark, con traza completa en el apéndice D.4 del paper.
- El benchmark es ejecutable por terceros a través de OpenEnv: la documentación de la entrada incluye instalación, servidores MCP y de entorno.
- El blog y el paper proceden de Microsoft y Hugging Face; la entrada se publicó el 3 de octubre de 2026.
- 507 tareas, 20 ejecuciones cada una desde backend limpio; la ablación de conjunto común cubre 121.680 trials válidos y 12 modelos.
- El 67,24% de los intentos fallidos terminó sin errores reportados; los estados incorrectos incluyen campos erróneos (77,61%), efectos extra (43,30%) y efectos faltantes (25,36%).
Todavía no
- Los resultados no han sido replicados por evaluadores independientes; Microsoft es coautor y Hugging Face aloja la infraestructura.
- El rendimiento de modelos que no participaron en la ablación de 12 modelos, incluido el desgaste con el paso del tiempo de los prompts reales de producción.
- Si los resultados del benchmark se correlacionan con incidentes en despliegues comerciales reales.
- Réplica independiente de los resultados, que por ahora solo sostienen los propios autores.
- Cómo se comportan los agentes en despliegues comerciales reales frente al sandbox del benchmark.
- Si el benchmark cubre ataques adversarios o solo flujos de negocio benignos.
Para ir al grano técnico
- → blog
Qué vigilamos ahora
Réplicas independientes del benchmark y una posible «fiebre 20/20»: si los laboratorios empiezan a publicar observed 20/20 junto a pass@1, cambiará la forma de comparar agentes para compra empresarial.
Primeras réplicas independientes y si los principales laboratorios publican observed 20/20 de sus modelos.
Fuentes
Naturaleza de la afirmación principal: Anuncio de la empresa. Fuente primaria consultada y verificable.
- Hugging Face Blog (entrada conjunta con Microsoft) · nivel 1 · primaria · consultada 4 oct 2026
Más sobre
Se relaciona con
- El protocolo MCP acumula el mismo fallo de seguridad entre gigantes sin relación · 6 oct 2026
- Nous Research confirma 90 millones para llevar su agente abierto Hermes a las empresas · 8 oct 2026
- Microsoft estrena el Surface Laptop Ultra con chip Nvidia RTX Spark para correr agentes en local · 8 oct 2026
- Meta libera el código para construir gadgets propios con su agente Muse · 3 oct 2026