Tenemos un problema: los agentes de IA pierden hasta un 50% de fiabilidad en tareas largas
Microsoft Research ha publicado los resultados del benchmark DELEGATE-52, un estudio que mide cómo se comportan los agentes de inteligencia artificial al sostener cadenas de trabajo largas. La prueba detecta una pérdida media de fidelidad documental del 25% tras solo 20 iteraciones delegadas, y una degradación que lleg...
Microsoft Research ha publicado los resultados del benchmark DELEGATE-52, un estudio que mide cómo se comportan los agentes de inteligencia artificial al sostener cadenas de trabajo largas. La prueba detecta una pérdida media de fidelidad documental del 25% tras solo 20 iteraciones delegadas, y una degradación que llega al 50% al considerar el conjunto completo de modelos y dominios evaluados.
La prueba difiere de los benchmarks habituales, centrados en tareas cortas y aisladas. DELEGATE-52 reproduce flujos de trabajo reales: un agente recibe instrucciones sucesivas, modifica archivos y debe conservar los elementos relevantes del material original a lo largo de 52 dominios profesionales, desde la redacción jurídica hasta la generación de código. Para entender el alcance del problema conviene tener presente que un error temprano se propaga hacia las siguientes etapas, así que la calidad final no depende del acierto en una instrucción aislada, sino de la capacidad del sistema para no acumular alteraciones, algo que nos interesa vigilar antes de delegar tareas complejas a estos agentes.
Gemini 3.1 Pro, Claude 4.6 Opus y GPT 5.4, a prueba
Los modelos evaluados en DELEGATE-52 incluyen Gemini 3.1 Pro, Claude 4.6 Opus y GPT 5.4, algunos de los sistemas más capaces disponibles en este momento. Si nos fijamos en los resultados, ninguno de los tres evitó la pérdida de fidelidad al alargar la cadena de trabajo: Gemini 3.1 Pro solo se consideró apto para 11 de las 52 áreas profesionales cubiertas por la prueba.
El informe define como corrupción catastrófica los casos en los que el puntaje de fidelidad cae hasta el 80% o menos, un umbral presente en más del 80% de las combinaciones entre modelo y dominio analizadas. Lo que observamos aquí es que el problema no depende de un proveedor concreto ni de un tipo de documento, sino de la propia arquitectura con la que estos modelos gestionan las tareas prolongadas, un patrón que se repite en los tres modelos evaluados y que conviene tener presente si delegamos tareas largas a un agente.
Dar más herramientas a los agentes no mejora su fiabilidad
Uno de los hallazgos más llamativos del estudio es que ampliar las capacidades de los agentes no reduce los errores, sino que los agrava. El acceso a herramientas de lectura y escritura de archivos, junto con la ejecución de código, incrementó en promedio un 6% la degradación de la fidelidad documental durante los flujos extendidos, algo que contradice la intuición de que más autonomía debería traducirse en mejores resultados.
Los métodos de verificación y orquestación que suelen emplearse para mantener a los agentes encaminados tampoco resolvieron el problema de fondo. El único resultado positivo llegó del dominio de Python, con menos de un 1% de degradación, un dato que no se repite en los otros 51 dominios evaluados. Ante este panorama, la industria ya trabaja en marcos como AgentRx y herramientas de monitoreo como SentinelBench, pensados para vigilar el comportamiento de los agentes en operaciones prolongadas y detectar el error antes de que se propague.
Se prevé la cancelación de un 40% de los proyectos agénticos
El hallazgo de Microsoft no aparece aislado. Datos de Gartner, McKinsey y Digital Applied recogidos el 3 de julio de 2026 señalan que solo el 11% de las empresas que han adoptado IA agéntica la ejecutan en producción, y que más del 40% de esos proyectos serán cancelados antes de que termine 2027.
Publicamos un resumen propio con fines informativos. Los derechos del contenido original pertenecen a su medio.

