Ir al contenido principal
Producto

Presentamos OfficeQA Pro V2: un nuevo benchmark para el razonamiento fundamentado empresarial

Una nueva y desafiante evaluación del razonamiento fundamentado sobre datos de estilo empresarial

por Databricks AI Research Team

  • OfficeQA Pro V2 es un nuevo benchmark para el razonamiento fundamentado empresarial, creado con nuestro pipeline de datos sintéticos interno a partir de aproximadamente 1,400 PDF del Tesoro de U.S. que abarcan 233 años y cerca de 120,000 páginas.
  • Aprovechamos la generación de datos sintéticos para crear OfficeQA Pro V2, lo que nos permite escalar preguntas y respuestas diversas y verificadas. Combinar estas técnicas de datos sintéticos con nuestra comprensión de los flujos de trabajo empresariales nos permite crear rápidamente nuevos benchmarks para avanzar en las tareas que importan a nuestros clientes, como el razonamiento fundamentado.
  • Un harness de agentes optimizado puede mejorar drásticamente el rendimiento. Los agentes listos para usar alcanzaron un promedio de solo el 26.0% de precisión en OfficeQA Pro V2, mientras que Genie de Databricks ofreció una mejora relativa del 92% en promedio en todos los modelos comparados y logró hasta un 60% de precisión utilizando los mismos modelos. A pesar de estos avances, aún queda un margen de mejora significativo en el razonamiento fundamentado.

Hoy lanzamos OfficeQA Pro V2, un nuevo benchmark diseñado para evaluar si los agentes de AI pueden generalizar a tareas de razonamiento fundamentado poco familiares y de estilo empresarial.

Hace siete meses, presentamos el benchmark OfficeQA para medir qué tan bien responden los sistemas de AI a preguntas analíticas utilizando evidencia de grandes colecciones de documentos, una tarea empresarial extremadamente común e importante con la que descubrimos que los agentes tenían dificultades. Desde su introducción, OfficeQA y su subconjunto de frontera, OfficeQA Pro, se han convertido en una medida importante para las capacidades de los agentes y modelos de frontera, impulsando el progreso en la recuperación de documentos, el procesamiento de documentos y el razonamiento analítico. Pero este progreso plantea una pregunta fundamental: ¿reflejan estas mejoras avances más amplios en el razonamiento fundamentado, o un progreso específico de un solo corpus y distribución de tareas? Esta distinción es importante en entornos empresariales, donde los agentes rara vez operan en una única colección de documentos estable.

Nuestro nuevo benchmark, OfficeQA Pro V2, está diseñado para probar esa generalización directamente. Inicialmente desarrollamos OfficeQA Pro V2 como el benchmark para la edición inaugural de la Databricks Grounded Reasoning Cup, una competencia en vivo en la que 11 equipos académicos, con el apoyo de OpenAI, Anthropic y Google DeepMind, crearon agentes que fueron evaluados en un corpus y un conjunto de tareas de razonamiento fundamentado previamente no vistos. El benchmark contiene 90 preguntas fundamentadas en aproximadamente 120,000 páginas de las Cuentas de Ingresos y Gastos del Tesoro de los EE. UU., que el Tesoro de los EE. UU. publicó como un conjunto de datos cohesivo por primera vez en conjunto con el 250.º aniversario de los Estados Unidos. Ahora, nos entusiasma lanzar el benchmark para la comunidad de profesionales de AI en general para que lo utilicen en su propio desarrollo.

Rendimiento de los agentes en OfficeQA Pro V2
Precisión en OfficeQA Pro V2 utilizando entornos de proveedores de modelos (Claude Code para modelos de Anthropic y Codex para modelos de OpenAI) frente a Databricks Genie. En los cuatro modelos equivalentes, Genie mejoró la precisión media en 15.3 puntos porcentuales, del 37.5% al 52.8%.

OfficeQA Pro V2 sigue siendo un desafío para los sistemas de AI actuales. Los agentes de frontera listos para usar que utilizan Claude Code con Claude Opus 4.8 y Claude Fable 5, o Codex con GPT-5.5 y GPT-5.6 Sol, alcanzaron una precisión promedio del 37.5%. Los agentes desarrollados específicamente para la Grounded Reasoning Cup tuvieron un mejor desempeño, con un promedio del 41.1%, y el equipo ganador alcanzó el 63.3%. También evaluamos Databricks Genie, el agente de AI de Databricks diseñado para responder preguntas complejas sobre datos empresariales, utilizando los mismos modelos subyacentes. Genie, que también utiliza ai_parse de Databricks para preprocesar el corpus de documentos, mejoró la precisión en un promedio de 24.0 puntos porcentuales en comparación con los entornos de evaluación predeterminados, y la configuración más sólida alcanzó el 60%. En conjunto, estos resultados muestran que el razonamiento fundamentado está lejos de estar resuelto, pero que el entorno de agente adecuado puede desbloquear mejoras significativas en los modelos de frontera existentes.

A continuación, describimos con más detalle cómo se desempeñan los agentes en OfficeQA Pro V2, cómo se construyó y en qué se diferencia del benchmark OfficeQA original.

Rendimiento de los agentes en OfficeQA Pro V2

Frontera de Pareto de costo-calidad en OfficeQA Pro V2
Costo frente a corrección para combinaciones de modelo + entorno en OfficeQA Pro V2. Los modelos que utilizan Databricks Genie dominan la frontera de Pareto, logrando una mayor calidad a un menor costo. Los costos por ejecución no incluyen el costo único inicial de analizar el corpus con ai_parse.

Primero evaluamos los modelos de frontera utilizando el entorno asociado de cada proveedor de modelos, con Codex para los modelos GPT y Claude Code para los modelos Claude, utilizando la misma métrica determinista de coincidencia exacta con una métrica de tolerancia del 0.0% que se utilizó para OfficeQA. En los cinco modelos evaluados bajo ambos entornos, estas configuraciones de línea base alcanzaron una precisión promedio del 26.0%. El rendimiento varió sustancialmente según el modelo, y un mayor costo no siempre se tradujo en una mayor precisión. Por ejemplo, Sonnet 5 en Claude Code obtuvo un 15.6% a un costo de $5.01 por ejecución, mientras que GPT-5.6 Sol en Codex alcanzó el 33.3% a un costo comparable de $4.70.

El uso de estos modelos dentro de Genie produjo mejoras sustanciales. En las comparaciones de modelos equivalentes, Genie mejoró la precisión en un promedio de 24.0 puntos porcentuales (una mejora relativa del 92%). Las configuraciones de Genie que utilizan GPT-5.6 Luna, GPT-5.6 Terra y Claude Fable 5 también dominan la frontera de Pareto de costo-calidad, lo que demuestra que estas mejoras no requieren sacrificar eficiencia por precisión. En el caso de Claude Fable 5, cambiar a Genie mejora el rendimiento en 14.4 puntos porcentuales (+32% relativo) al tiempo que reduce el costo aproximadamente 9 veces. Al inspeccionar las trazas, descubrimos que Fable 5 es propenso a realizar intentos repetitivos para analizar muchos documentos, lo que genera ejecuciones largas con un costo promedio de $37.36. Genie procesa los documentos utilizando ai_parse document, lo que permite al modelo identificar de manera eficiente la información correcta de cada página, ahorrando así costos y mejorando el rendimiento.

Aunque estas mejoras en los entornos conducen a ganancias sustanciales, aún queda un margen de mejora significativo en OfficeQA Pro V2. Los sistemas siguen mostrando modos de falla similares a los que observamos en el OfficeQA original: fidelidad del análisis, reconciliación temporal incorrecta a medida que cambian las convenciones contables con el tiempo, y una interpretación errónea del alcance de la entidad o la granularidad de la categoría.

Construcción de un nuevo benchmark de razonamiento fundamentado

Para probar verdaderamente la generalización, necesitábamos un nuevo corpus que reflejara las mismas habilidades relevantes para la empresa que OfficeQA fue diseñado para medir: analizar documentos complejos, recuperar la evidencia correcta y realizar un razonamiento analítico fundamentado en esa información.

Trabajamos con el Tesoro de los EE. UU. para construir el benchmark en torno a un nuevo corpus: las Cuentas Federales de Ingresos y Gastos de los EE. UU., que el Tesoro se estaba preparando para publicar como un conjunto de datos unificado por primera vez en conjunto con el 250.º aniversario de los Estados Unidos. El corpus consta de aproximadamente 1,400 PDFs y 120,000 páginas que contienen registros contables detallados de los EE. UU., que abarcan desde 1793 hasta 2024.

Al igual que los Boletines del Tesoro de los EE. UU. utilizados en el benchmark OfficeQA original, este nuevo corpus refleja muchos de los desafíos comunes en las colecciones de documentos empresariales: tablas y gráficos densos, valores revisados a lo largo del tiempo, convenciones de presentación de informes en evolución y un profundo conocimiento institucional. Estas complejidades también se traducen en una evaluación desafiante: al igual que con el benchmark OfficeQA original, descubrimos que los agentes de frontera de línea base tienen dificultades para lograr una precisión consistentemente alta en OfficeQA Pro V2.

Escalar OfficeQA Pro V2 con datos sintéticos

Pipeline de datos sintéticos utilizado para construir OfficeQA Pro V2.
Pipeline de datos sintéticos utilizado para construir OfficeQA Pro V2.

Cuando creamos el benchmark OfficeQA original a finales de 2025, el proceso era sumamente manual. Los anotadores humanos construían preguntas y respuestas a mano mientras examinaban un corpus que comprendía 89,000 páginas de Boletines del Tesoro de los EE. UU., lo que a menudo requería numerosas rondas de revisión humana para garantizar la calidad de las preguntas. Aunque este enfoque finalmente produjo un benchmark de alta calidad, requería mucho tiempo, era costoso y difícil de escalar. Desde entonces, hemos desarrollado técnicas para automatizar la creación de benchmarks rigurosos de manera mucho más eficiente y confiable.

Para construir OfficeQA Pro V2, aprovechamos asynth, nuestra biblioteca interna para construir pipelines de generación de datos sintéticos. Esto nos permitió crear de manera rápida y escalable un benchmark diverso y verificable que reflejara con precisión los desafíos del razonamiento fundamentado mediante un proceso sistemático para generar y revisar preguntas:

  1. Entradas (Inputs). Para promover la diversidad de las muestras, el sintetizador se inició con un período de tiempo seleccionado al azar, un método analítico, un número objetivo de documentos de origen y un tema destacado extraído de una lista desarrollada con nuestro socio, USAFacts, para reflejar las preguntas que los analistas podrían hacer de forma natural sobre el corpus.
  2. Síntesis. Para cada pregunta candidata, un agente de síntesis buscó en el corpus evidencia que coincidiera con estos criterios y generó una muestra respaldada por una cadena rastreable de razonamiento fundamentado.
  3. Verificación. A continuación, las muestras pasaron por varios filtros de calidad para auditar la fidelidad de la fuente, la relevancia analítica, la diversidad y la capacidad de respuesta. Agentes de resolución independientes intentaron responder a la pregunta desde cero, generando trayectorias de solución alternativas que fueron revisadas por un agente de verificación. Solo los candidatos con respuestas verificablemente correctas avanzaron a la siguiente etapa.
  4. Revisión final. Como paso final de control de calidad, las muestras se revisaron manualmente junto con las soluciones producidas por modelos de frontera adicionales. Los revisores examinaron conjuntamente la pregunta, la respuesta, el razonamiento y las pruebas citadas, conservando únicamente las muestras cuya interpretación y verdad fundamental (ground truth) fueran inequívocamente correctas.

Las preguntas resultantes requieren las mismas capacidades principales de razonamiento fundamentado que mide el benchmark original OfficeQA: recuperación en múltiples documentos fuente, razonamiento analítico y capacidades especializadas como la búsqueda web complementaria y la interpretación multimodal de figuras. A continuación se muestran ejemplos de preguntas del benchmark, así como detalles sobre su composición.

Preguntas de ejemplo

1. Dificultad baja: Calcular los ingresos del presidente del Tribunal Supremo: “¿Cuál es el valor nominal total en dólares de los ingresos de John Jay como presidente del Tribunal Supremo, según la Cuenta de Recibos y Gastos de los Estados Unidos durante la segunda mitad del CY 1793, y qué números de orden de pago correspondieron a los pagos? Devuelva su respuesta como valores separados por comas entre corchetes en el orden del valor de sus ingresos y los números de orden de pago en orden de año calendario”.

image4.jpg

Esta pregunta requiere localizar una sola página de la Cuenta de Recibos y Gastos de 1793 y leer los cuatro pagos de órdenes de pago registrados para el presidente del Tribunal Supremo John Jay (resaltados en rojo), interpretando correctamente que "do." es la abreviatura de "ditto" (mismo), lo que indica la misma categoría de datos que la fila anterior. Luego, la pregunta requiere comprender que la “segunda mitad del CY 1793” limita la respuesta únicamente a los pagos de julio y noviembre. Por último, se requiere la recuperación de los números de orden de pago correspondientes y una suma simple para calcular la respuesta final.

2. Dificultad media: Pronosticar el aumento de los gastos de Medicare: “Entre el FY1990 y el FY1994 inclusive, los gastos de Medicare crecieron rápidamente a medida que el programa se expandía. Al ajustar una regresión lineal OLS a las cifras anuales de gastos de Medicare reportadas para esos años fiscales, ¿cuál es el aumento anual promedio estimado en dólares en los gastos de Medicare reportados en millones de dólares, redondeado a dos decimales?”.

image13.png

Esta pregunta requiere recuperar la cifra de gastos de Medicare de la tabla "Gastos por función" en cinco Declaraciones Combinadas anuales independientes (FY1990–FY1994, resaltadas en rojo). Es importante destacar que el agente debe leer el valor de cada año de la columna del año anterior revisada más recientemente, en lugar de la primera cifra reportada. Por último, el agente debe ajustar la serie con un modelo de regresión lineal para estimar el aumento anual promedio.

3. Dificultad alta: Pronosticar el aumento de los gastos entre agencias: “Para los gastos netos combinados de los Departamentos de Comercio, Interior y Estado, la Agencia de Protección Ambiental (EPA) y la Administración Nacional de Aeronáutica y el Espacio (NASA) consolidados a partir de sus familias constituyentes de Treasury Account Symbol (TAS) según lo informado por el Tesoro de los EE. UU., ajuste el método Theta no estacional estándar en los gastos reportados: estime el componente θ=0 como una tendencia lineal OLS, construya la serie transformada θ=2, pronostique ese componente con un suavizado exponencial simple inicializado en su primer valor y elija α sobre [0, 1], permitiendo α = 1.0. Utilizando este pronóstico y promediando los pronósticos de un paso adelante de θ=0 y θ=2, ¿cuál es el pronóstico para el FY1989 en millones de dólares redondeado a la centésima más cercana?”.

estado de operaciones

Esta pregunta requiere ensamblar una serie de ocho años (FY1981–FY1988) de gastos netos para cinco agencias diferentes (Comercio, Interior, Estado, EPA y NASA) a partir de ocho Declaraciones Combinadas independientes. Nuevamente, el agente debe usar solo las últimas cifras reportadas para cada año. La serie resultante debe usarse luego para pronosticar los gastos netos para el FY1989, utilizando un método de pronóstico específico.

Detalles del benchmark

Capacidades evaluadas en la suite OfficeQA
Porcentaje de preguntas en cada benchmark de OfficeQA que requieren análisis de datos avanzado, conocimiento externo, recuperación de más de tres documentos fuente o interpretación de gráficos que no son tablas. OfficeQA Pro se refiere a la división de frontera de las preguntas de OfficeQA, OfficeQA Full es un conjunto combinado que incluye preguntas más sencillas y OfficeQA Pro V2 es nuestro benchmark recientemente lanzado.

OfficeQA Pro V2 consta de 90 preguntas, todas las cuales requieren evidencia del corpus del benchmark. Como parte de nuestro pipeline de verificación de datos sintéticos, filtramos las preguntas que podían responderse utilizando únicamente conocimiento paramétrico o búsqueda web.

Aunque está construido sobre un nuevo corpus, OfficeQA Pro V2 conserva las capacidades principales de razonamiento fundamentado empresarial que mide el benchmark original OfficeQA, tanto en el conjunto completo de preguntas, OfficeQA Full, como en su subconjunto de dificultad de frontera, OfficeQA Pro. El 7% de las preguntas requiere comprensión visual de cuadros, gráficos o figuras, en comparación con aproximadamente el 3% en OfficeQA Pro. Otro 10% requiere información complementaria obtenida a través de búsquedas web (como índices de inflación, series de GDP o cifras de población), en comparación con el 21.8% en OfficeQA Pro y el 15.9% en OfficeQA Full. En conjunto, aproximadamente una de cada seis preguntas de OfficeQA Pro V2 requiere al menos una de estas capacidades especializadas más allá de la recuperación y el análisis de textos.

En comparación con OfficeQA Pro, OfficeQA Pro V2 requiere evidencia de sustancialmente más documentos fuente por pregunta. Las preguntas de OfficeQA Pro se basan en aproximadamente 2 documentos del Treasury Bulletin en promedio, mientras que las preguntas de OfficeQA Pro V2 requieren evidencia de 6.7 documentos fuente en promedio, con una mediana de 5.5 y un máximo de 24. En total, el 74.4% de las preguntas de OfficeQA Pro V2 requieren cuatro o más fuentes, en comparación con el 62.4% en OfficeQA Pro y el 56.1% en OfficeQA Full.

En conjunto, estas características hacen de OfficeQA Pro V2 una prueba más exigente de razonamiento fundamentado de extremo a extremo (end-to-end) que el benchmark original, al tiempo que conserva la misma combinación realista de requisitos analíticos, multimodales y de conocimiento externo que se encuentran en los flujos de trabajo empresariales. Para comprender por qué el benchmark sigue siendo un desafío, es útil examinar cuán drásticamente han evolucionado a lo largo del tiempo los documentos subyacentes y las convenciones de presentación de informes.

Un corpus que abarca más de dos siglos

Al abarcar 232 años de informes financieros federales de los EE. UU., el corpus también captura la evolución de las estructuras de los documentos, las convenciones contables, la terminología y las instituciones a lo largo de más de dos siglos. Por ejemplo, los registros de finales de la década de 1700 y principios de la de 1800 a menudo registran pagos a individuos. Estos documentos suelen incluir desplegables horizontales anchos, tipografía arcaica como el uso de la "s" larga en palabras como “Treaſury” o “Preſident”, y convenciones de escritura histórica como el registro de “do./ditto”, lo que plantea nuevos desafíos para las soluciones de análisis sintáctico (parsing) modernas.

image11.jpg
(Izquierda) Escaneo de imagen de una parte de un Resumen de Ingresos de 1793. Palabras como ‘Treasury’, ‘Merchandise’ y ‘supervisors’ contienen la "s" larga arcaica, resaltada arriba. Las tablas en estos documentos históricos a menudo se organizan como filas de texto detalladas. (Derecha) Una parte de una tabla desplegable horizontal ancha de 1797, que contiene cifras densamente agrupadas y marcadores de columnas y filas alineados de manera irregular.

A mediados del siglo XIX, los datos se presentaban en formatos de cuenta T de dos páginas y tablas densas y rayadas, mientras que el período de informe cambió de años calendario a años fiscales. A principios de la década de 1900 se introdujeron nuevos términos financieros como saldos de apertura y cierre, asignaciones plurianuales y convenciones de superávit y déficit.

image7.jpg
Tablas de recibos & gastos de 1854 (izquierda) y 1945 (derecha). A pesar de informar sobre recibos y gastos, ambas tablas están organizadas y formateadas de manera diferente, lo que destaca cómo cambiaron las convenciones de presentación de informes a lo largo del tiempo dentro del corpus.

Para la década de 1980, el Combined Statement había evolucionado hasta convertirse en un informe anual con un apéndice detallado. Los informes pasaron a ser nativos digitales a principios de la década de 2000 y comenzaron a incorporar gráficos visuales junto con una tabla de contenido estandarizada.

image10.jpg
(Izquierda) Ejemplo de los tipos de gráficos introducidos en los documentos modernos del Tesoro, en este caso de 2020. (Derecha) Tabla de un resumen de los saldos de las cuentas informados en 2024.

OfficeQA Pro V2 se basa en las complejidades de las Accounts of Receipts and Expenditures, creando una prueba de esfuerzo especialmente exigente para el razonamiento fundamentado. En todo el corpus, un mismo concepto financiero puede cambiar de nombre, ubicación, esquema de tabla, unidad, base temporal y nivel de agregación. Además de analizar documentos y recuperar valores, esto significa que los agentes deben conciliar la información a través de convenciones de presentación de informes cambiantes, una complejidad que es típica en entornos empresariales.

Conclusión y agradecimientos

El benchmark y el corpus analizado ya están disponibles públicamente en Hugging Face, con el código de evaluación disponible en GitHub. Animamos a los investigadores y profesionales a evaluar sus propios sistemas de agentes en OfficeQA Pro V2, y recomendamos su uso como conjunto de prueba para OfficeQA Pro. Para los desarrolladores de empresas, OfficeQA Pro V2 puede servir como un banco de pruebas para crear agentes que deben responder preguntas complejas en grandes colecciones de documentos heterogéneos. Los equipos pueden usarlo para comparar modelos y arquitecturas de agentes, identificar si las fallas se originan en el análisis, la recuperación, el razonamiento o la verificación, y medir cómo los cambios en sus sistemas afectan la precisión, la latencia y el costo antes de aplicar esos enfoques a sus propios datos empresariales. Finalmente, dejamos a los lectores con tres conclusiones clave:

  1. Las evaluaciones representativas son esenciales, y los datos sintéticos pueden ayudar a escalarlas. Los agentes de frontera todavía tienen dificultades con los flujos de trabajo empresariales listos para usar, por lo que es fundamental evaluar los sistemas en tareas que reflejen la complejidad del mundo real y probar si las mejoras se generalizan a entornos desconocidos. En Databricks, combinamos técnicas de datos sintéticos con nuestra comprensión de los flujos de trabajo de los clientes para crear evaluaciones representativas como OfficeQA Pro V2 de manera más eficiente y a mayor escala.
  2. Un arnés de agentes optimizado es fundamental para lograr el mejor rendimiento. Pasar de los arneses de referencia de los proveedores de modelos a Databricks Genie mejoró el rendimiento en 24.0 puntos porcentuales en promedio (+92% relativo) en todos los modelos evaluados. Estos resultados demuestran que el procesamiento de documentos, la recuperación, el uso de herramientas y las opciones de orquestación pueden afectar sustancialmente tanto la precisión como la eficiencia de los sistemas de razonamiento fundamentado.
  3. El razonamiento fundamentado todavía tiene un margen de mejora significativo. Aunque las optimizaciones del arnés produjeron mejoras sustanciales con respecto a las líneas de base listas para usar, incluso los sistemas más sólidos continuaron teniendo dificultades con desafíos como el análisis fiel de documentos, la conciliación de valores a lo largo del tiempo y la recuperación de las últimas cifras revisadas. El progreso continuo requerirá innovaciones en toda la pila de agentes, desde el análisis y la recuperación hasta el análisis y la verificación.

Agradecemos a USAFacts por su continua colaboración en el conjunto de pruebas OfficeQA, lo que incluye ayudarnos a identificar el nuevo corpus, desarrollar temas y preguntas analíticas representativas y organizar la Grounded Reasoning Cup. También agradecemos al Tesoro de los EE. UU. por ayudar a identificar las U.S. Accounts of Receipts and Expenditures como base para el benchmark de la competencia, y por publicar el conjunto de datos como una colección cohesiva por primera vez.

Autores: Krista Opsahl-Ong, Arnav Singhvi, Josh Joseph, Jasmine Collins, Ivan Zhou, Shubham Toshniwal, Michael Bendersky, Erich Elsen, Xing Chen, Matei Zaharia

Si desea obtener más información y comenzar a utilizar OfficeQA Pro V2, consulte el benchmark en Hugging Face.

(Esta entrada del blog ha sido traducida utilizando herramientas basadas en inteligencia artificial) Publicación original

Recibe las últimas publicaciones en tu bandeja de entrada

Suscríbete a nuestro blog y recibe las últimas publicaciones directamente en tu bandeja de entrada.