Cómo los mejores equipos académicos desarrollaron agentes de IA que lograron generalizarse a un nuevo corpus de documentos empresariales en condiciones de competencia en vivo.
Este año, Databricks organizó la edición inaugural de la Grounded Reasoning Cup, una competencia de AI en vivo pionera en su tipo para evaluar la capacidad de los agentes de AI para razonar sobre colecciones de documentos complejas de estilo empresarial. Al evaluar a los agentes en un corpus recientemente publicado bajo condiciones de competencia en vivo, la Grounded Reasoning Cup se diseñó para ayudar a responder una de las preguntas más difíciles en la evaluación de AI: ¿qué tan bien se generalizan las mejoras de rendimiento en un benchmark a tareas similares del mundo real?
La competencia reunió a 11 de los mejores equipos académicos de U.S. y Canadá, quienes contaron con recursos y mentoría de laboratorios de vanguardia como OpenAI, Anthropic y Google DeepMind. A lo largo de dos meses, los equipos desarrollaron y optimizaron sus agentes en OfficeQA, nuestro benchmark insignia de razonamiento fundamentado diseñado para reflejar flujos de trabajo empresariales de gran valor económico. El día de la competencia, se enfrentaron al desafío de aplicar esos sistemas en tiempo real a un benchmark de razonamiento fundamentado recientemente publicado, OfficeQA Pro V2, diseñado para probar si sus mejoras se generalizaban.
Stanford ganó con un sistema que alcanzó un 63.3% de precisión, superando al equipo promedio por aproximadamente +22 puntos, y a la línea base (baseline) offline del agente de vanguardia promedio por aproximadamente +35 puntos. Los mejores equipos demostraron mejoras sustanciales mediante el preprocesamiento de documentos, la recuperación dirigida (targeted retrieval), agentes paralelos, el uso de herramientas estructuradas y la verificación. Al mismo tiempo, el 18.8% de las preguntas quedaron sin resolver por parte de todos los equipos, lo que subraya cuánto margen de mejora queda en el razonamiento fundamentado empresarial.
En esta publicación de blog, resumimos la competencia y analizamos las estrategias de optimización de agentes y las perspectivas de los equipos ganadores de la Grounded Reasoning Cup: Stanford, la Universidad de Massachusetts Amherst y Yale.
En general, encontramos lo siguiente:
El objetivo de la Grounded Reasoning Cup era reunir a los mejores equipos académicos para desarrollar enfoques generalizables para el razonamiento fundamentado, una tarea común en entornos empresariales que implica responder preguntas complejas utilizando evidencia de colecciones de documentos grandes y, a menudo, patentadas.
Equipos de 2 a 4 personas en representación de su institución académica se asociaron con un socio de la industria de OpenAI, Anthropic o Google DeepMind, quien les brindó acceso a sus modelos y mentoría durante todo el período de desarrollo. Los equipos tuvieron aproximadamente dos meses para construir un agente utilizando los enfoques que consideraran adecuados, con la única restricción de que debían usar exclusivamente la familia de modelos de su laboratorio asociado para potenciar su agente. Durante este período, utilizaron el benchmark OfficeQA para evaluar nuevas técnicas que creían que se generalizarían a tareas de razonamiento fundamentado similares.
El día de la competencia, los equipos tuvieron la tarea de aplicar sus agentes en tiempo real en un benchmark nuevo y recién publicado. La competencia se rigió por las siguientes reglas:
La competencia dejó clara una cosa: el razonamiento fundamentado sobre corpus de documentos de estilo empresarial ha mejorado desde que lanzamos el benchmark OfficeQA hace 7 meses, pero aún está lejos de resolverse. La puntuación promedio de los equipos fue de ~41%, mientras que los tres mejores equipos superaron el 50% de precisión, y el equipo de Stanford ganó la competencia con un 63.3% de precisión. Estos resultados apuntan a un trabajo impresionante por parte de los mejores equipos, así como a un gran margen de mejora por explorar.
Aunque cada uno adoptó un enfoque único, surgieron varios patrones entre los agentes creados por los tres mejores equipos. Los sistemas sólidos tendieron a combinar un preprocesamiento cuidadoso de los documentos, una recuperación dirigida (targeted retrieval), el uso de herramientas estructuradas y pasos de verificación de respuestas. En muchos casos, el rendimiento dependió menos de una sola llamada al modelo y más del sistema circundante: cómo se analizaron sintácticamente (parsed) los documentos, cómo se recuperó la evidencia, cómo se realizaron los cálculos intermedios y cómo se verificaron las respuestas antes del envío. Si bien estas eran cualidades que los sistemas más eficientes generalmente tenían en común, cada uno de ellos también empleó estrategias distintas y creativas, como se describe a continuación.

El enfoque ganador del equipo de Stanford consistió en convertir los modos de falla comunes del razonamiento fundamentado en procedimientos operativos reutilizables para que su agente Claude Code con Claude Opus 4.8 aprendiera de ellos y los aplicara en las preguntas de la competencia. Durante su desarrollo en el benchmark público OfficeQA, que incluyó experimentos de ablación con Opus 4.8 e incluso Fable 5 (mientras estuvo disponible), el equipo rastreó repetidamente las respuestas incorrectas hasta el paso en falso exacto del agente, y luego convirtió esos patrones en habilidades para la localización de tablas, el formato de respuestas, aclaraciones sobre redacciones financieras comunes, etc. El equipo también integró habilidades que decidirían cuándo buscar en el texto del corpus analizado sintácticamente (parsed) y en las representaciones de documentos de estilo markdown, y cuándo recurrir a los PDF de origen si el texto analizado carecía de un contexto completo. Para el día de la competencia, Stanford había preparado a su agente con un manual de estrategias (playbook) de más de 100 habilidades. Lideraron a todos los equipos en precisión, con 57 respuestas correctas de las 88 que intentaron.
A pesar de esta preparación exhaustiva, Stanford tuvo que adaptar su estrategia durante la competencia. En las tres primeras rondas, el equipo utilizó otro agente de Claude Code como verificador para volver a extraer valores intermedios, comprobar modos de fallo comunes (como el seguimiento de valores revisados a través del linaje de datos y el escalado de unidades) y corregir cálculos al identificar discrepancias. Sin embargo, tras obtener solo dos bonificaciones por velocidad en esas rondas, Stanford eliminó el paso de verificación adicional para las tres últimas. Este cambio redujo significativamente la latencia, lo que ayudó al equipo a ganar bonificaciones por velocidad en 14 preguntas e impulsó su remontada. No obstante, el verificador resultó decisivo en la ronda final, cuando Stanford lo volvió a activar para corregir una respuesta mediante un envío final, lo que en última instancia les aseguró la victoria.

El equipo de UMass apostó por la velocidad. Utilizaron Claude Opus 4.8 Fast como su modelo principal y preprocesaron el corpus para crear un catálogo de metadatos que permitiera realizar búsquedas y filtrados rápidos en los documentos analizados. Para mejorar la calidad de las respuestas manteniendo una latencia baja, ejecutaron tres agentes en paralelo para cada pregunta, seguidos de una llamada de verificación final de Opus para seleccionar la mejor respuesta.
Esta estrategia le dio a UMass el tiempo promedio de envío más rápido para respuestas correctas: cuatro minutos, menos de la mitad del promedio general de los equipos, que fue de ocho minutos y 30 segundos. Como resultado, obtuvieron 36 bonificaciones por velocidad (de 0.25 puntos cada una) por ser el primer equipo en responder correctamente, más del doble del total de 16 de Stanford en el segundo lugar. Estas bonificaciones les ayudaron a lograr una ventaja de 10.25 puntos sobre Stanford a mitad del tiempo y a mantener una diferencia de 3.75 puntos al entrar en la ronda final. UMass conservó esa ventaja hasta los últimos 56 segundos de la competencia, cuando el agente de Stanford, más lento pero más preciso, resultó decisivo en las preguntas más difíciles y se adelantó para ganar por 1.75 puntos.
El enfoque de UMass demuestra cómo los modelos más rápidos, el preprocesamiento de documentos y el escalado en tiempo de prueba (test-time scaling) pueden funcionar en conjunto para lograr una latencia muy baja sin sacrificar demasiada precisión.

El equipo de Yale desarrolló un entorno de verificación de múltiples brazos (multi-arm) diseñado para mantener la robustez en caso de que fallara algún agente individual. El sistema ejecutaba cuatro brazos independientes en paralelo, que abarcaban dos estrategias de agentes. Dos brazos utilizaban agentes autónomos ReAct: uno impulsado por Gemini 3.1 Pro y el otro por Gemini 3.5 Flash. Los brazos restantes utilizaban un flujo de trabajo (pipeline) de planificador-verificador más estructurado, con Gemini 3.1 Pro gestionando todas las llamadas de LLM. En este pipeline, el planificador inspeccionaba y contextualizaba los documentos de origen, creando un bloc de notas (scratchpad) con las pruebas necesarias para responder a la pregunta. Luego, el verificador comprobaba las fuentes citadas y realizaba los cálculos finales.
Un metaverificador Gemini 3.1 Pro revisaba las respuestas y el razonamiento producidos por los cuatro brazos y seleccionaba la respuesta final. Para reducir el riesgo de introducir una nueva respuesta sin sustento, el metaverificador solo podía seleccionar una respuesta propuesta por uno de los brazos existentes. Cuando no podía hacerlo, el sistema recurría a una votación por mayoría. Al combinar distintas arquitecturas de agentes con modos de fallo independientes y parcialmente descorrelacionados, Yale priorizó una verificación sólida y fundamentada. Este enfoque le valió al equipo el tercer puesto, con 49 de 90 preguntas respondidas correctamente y una clasificación de precisión entre los tres primeros en cuatro de las seis rondas de la competencia.
Una de las principales conclusiones de estos enfoques ganadores es que aplicar con éxito un agente a tareas de razonamiento fundamentado (grounded reasoning) de extremo a extremo requiere un pensamiento sistémico holístico, en lugar de centrarse únicamente en la elección del modelo. En todos los enfoques ganadores, destacaron algunos factores clave de diseño como especialmente importantes:
ai_parse contribuye significativamente a la mejora del rendimiento de Genie de 24.0 puntos con respecto a los agentes de frontera de referencia (baseline).Estos factores determinaron si el modelo podía encontrar de manera confiable las pruebas adecuadas, realizar el cálculo correcto y enviar la respuesta acertada bajo la presión del tiempo límite.
En resumen, los resultados de la Grounded Reasoning Cup demuestran una serie de lecciones más amplias:
ai_parse para preanalizar documentos, además de otras estrategias de optimización del entorno (harness).Agradecemos a todos los equipos y patrocinadores de la industria, incluidos OpenAI, Google DeepMind y Anthropic, que participaron en la edición inaugural de la Grounded Reasoning Cup de Databricks y ayudaron a impulsar este campo. También agradecemos a USAFacts por su continua colaboración, desde ayudarnos a identificar un nuevo corpus y crear preguntas relevantes para OfficeQA Pro V2, hasta asociarse con nosotros en la competencia misma. Por último, agradecemos al Tesoro de los EE. UU. por ayudar a identificar las Cuentas de Ingresos y Gastos de los EE. UU. (U.S. Accounts of Receipts and Expenditures) como base para el punto de referencia de la competencia, y por publicar el conjunto de datos como una colección cohesiva por primera vez.
Autores: Krista Opsahl-Ong, Arnav Singhvi, Josh Joseph, Jasmine Collins, Ivan Zhou, Brooke Wenig, Denny Lee, Michael Bendersky, Erich Elsen, Xing Chen, Matei Zaharia
(Esta entrada del blog ha sido traducida utilizando herramientas basadas en inteligencia artificial) Publicación original
Suscríbete a nuestro blog y recibe las últimas publicaciones directamente en tu bandeja de entrada.