Ir al contenido principal
Investigación de IA

Mejora de la recuperación de agentes mediante la extracción estructurada de gráficos

La extracción estructurada de gráficos en ai_parse_document, combinada con una recuperación de texto ligera, mejora la recuperación de gráficos y la precisión de las respuestas del agente, superando a los modelos de embeddings multimodales grandes.

por El equipo de investigación en IA de Databricks

La motivación

Cada vez más empresas piden a sus agentes que trabajen con sus propios documentos y respondan preguntas sobre su contenido. Sin embargo, gran parte de la información importante se encuentra en figuras y gráficos. Muchos clientes han descubierto que a los agentes les cuesta responder preguntas que requieren leer y contar valores en los gráficos. Para que los agentes funcionen de manera confiable en diversos entornos empresariales, necesitamos que los gráficos sean más interpretables.

¿Cómo podemos hacer que un gráfico sea más fácil de entender para los agentes? Realizamos una prueba rápida y sencilla: preguntamos a diferentes agentes, “¿Cuántos máximos locales hay en este gráfico?”

A continuación se muestra una comparación entre un agente de vanguardia y Databricks Genie al responder a esta pregunta. Al agente de vanguardia solo se le pasó la imagen, pasó 50 segundos razonando, pero aun así obtuvo una respuesta incorrecta de 17. Mientras tanto, Databricks Genie utilizó una extracción estructurada del gráfico a través de ai_parse_document y obtuvo la respuesta correcta de 18.

image12.png

Respuesta de un agente de vanguardia solo con la imagen (incorrecta):Respuesta del agente Genie con una extracción estructurada del gráfico (correcta):
image4.pngimage10.png

Notamos estas deficiencias en nuestra evaluación comparativa OfficeQA Pro, donde los modelos tuvieron un peor rendimiento en preguntas basadas en gráficos y multimodales que en preguntas que no requerían la comprensión de gráficos. Vemos las mismas brechas en los sistemas de recuperación de información de los clientes, especialmente en los servicios financieros. Un sistema de recuperación basado en texto solo puede buscar en el espacio de texto. Una solución común es generar una descripción para explicar de qué trata un gráfico; sin embargo, eso puede omitir los datos necesarios para preguntas detalladas sobre los números dentro del gráfico. Como resultado, el sistema puede recuperar la página incorrecta o recuperar la página correcta sin tener suficiente información para responder a la pregunta.

En esta publicación, mostramos que la extracción estructurada de gráficos mejora tanto la recuperación como la calidad de las respuestas en preguntas basadas en gráficos. Evaluamos nuestro enfoque en dos conjuntos de datos: un subconjunto con muchos gráficos de ViDoRe V3, una evaluación comparativa para la recuperación y respuesta a preguntas sobre documentos visualmente ricos, y un conjunto de datos sintético centrado en gráficos que llamamos Chart-RAG. Nuestro enfoque tiene un rendimiento competitivo en comparación con los modelos de embeddings multimodales grandes de vector único y multivectoriales.

image9.png
Figura 1: Precisión de las respuestas para el análisis de solo descripción, ai_parse_document enriquecido con las tres imágenes principales recuperadas y la línea base de embeddings multimodales más sólida cuando se utilizan las cinco páginas principales recuperadas para responder. Los resultados son el promedio de tres ejecuciones.

Creamos un pipeline de recuperación adaptado a gráficos de extremo a extremo con las funciones de IA de Databricks, un conjunto de funciones combinables que están optimizadas con técnicas de investigación de última generación (ver Figura 2). Usamos ai_parse_document para extraer el contenido del documento, incluidos los gráficos representados como JSON estructurado, y ai_prep_search para transformar el contenido en fragmentos listos para la recuperación, indexados con un modelo ligero de embeddings de texto de 300 millones de parámetros. Creamos un índice a partir de los fragmentos usando ai_search y conectamos el índice a Genie para la recuperación y respuesta.

image5.png
Figura 2: Pipeline de extracción y recuperación de gráficos implementado mediante las funciones de IA de Databricks.

Metodología de evaluación

Comparamos dos índices, creados con un modelo de embeddings de texto BGE de 300 millones de parámetros, construidos a partir de los mismos PDF de origen, que diferían únicamente en la representación de las figuras de los gráficos:

  • Solo descripción (línea base): figuras representadas únicamente por descripciones
  • Enriquecido con JSON: figuras de gráficos representadas por descripciones y JSON de gráficos estructurado, incrustado en línea en el fragmento de la figura.

Un ejemplo de extracción de gráfico:

image3.png
Gráfico de barras agrupadas que compara cinco escenarios de previsión económica para el crecimiento del GDP y la inflación general en 2026 y 2027.

Evaluamos 310 preguntas con gran cantidad de gráficos e infografías de la evaluación comparativa ViDoRe V3. La evaluación comparativa evalúa la recuperación y la respuesta en siete dominios: empleo, energía, farmacéutico, física, finanzas, informática y documentos industriales. Para cada experimento, analizamos y fragmentamos todo el corpus en inglés de 16 000 páginas y generamos respuestas para cada consulta, buscando en todo el índice.

Aunque se seleccionaron preguntas centradas en gráficos, muchas de ellas aún se podían responder utilizando el texto circundante. Para aislar el impacto del contenido de los gráficos, creamos una segunda evaluación comparativa que se centró únicamente en preguntas basadas en gráficos creadas a partir de tres informes complejos y con gran cantidad de gráficos (BIS Quarterly Review, IMF World Economic Outlook, J.P. Morgan Long-Term Capital Market Assumptions). Escribimos 114 preguntas basadas en elementos visuales a partir de estos 3 documentos que suman 378 páginas para construir el conjunto de datos sintético Chart-RAG.

Calificación: Calificamos cada respuesta como Correcta / Parcialmente correcta / Incorrecta utilizando un juez LLM (gemini-3-flash) en comparación con su respuesta de referencia.

Recuperación: Informamos Hit Rate@10 y nDCG@10. Hit Rate@10 verifica si al menos una página de referencia aparece en los 10 primeros resultados recuperados. Las preguntas de la evaluación comparativa ViDoRe pueden tener varias páginas de referencia, cada una con una puntuación de relevancia de 1 o 2. Para Hit Rate@10, convertimos la relevancia graduada en relevancia binaria al permitir que las páginas con cualquiera de las dos puntuaciones cuenten como un acierto. Para nDCG@10, mantenemos la relevancia graduada original. En el conjunto de datos Chart-RAG, cada consulta tiene una página de referencia.

Para lograr una medición estable, ejecutamos cada configuración tres veces e informamos los resultados con intervalos de confianza.

Los datos estructurados de gráficos mejoran la recuperación y la respuesta

image6.png
Figura 3: Corrección de respuestas, Hit@10 y nDCG@10 para la recuperación de solo descripción y enriquecida con JSON de gráficos en el subconjunto de ViDoRe V3 y los conjuntos de datos sintéticos de Chart-RAG. Los resultados son el promedio de tres ejecuciones.

El JSON estructurado de gráficos mejora tanto la calidad de las respuestas como la recuperación en ambos conjuntos de datos. El análisis a nivel de pregunta a continuación muestra cuándo las respuestas corregidas coinciden con una mejor recuperación.

image7.png
Figura 4: La adición de JSON de gráficos corrigió respuestas que antes eran incorrectas. Entre esas respuestas corregidas, la figura muestra con qué frecuencia el JSON también mejoró la recuperación (Hit@10) o la clasificación (nDCG@10). Los resultados son el promedio de las tres ejecuciones.

El siguiente ejemplo del conjunto de datos Chart-RAG demuestra cómo las representaciones JSON mejoran la recuperación y la calidad de las respuestas:

PreguntaRespuesta antesRespuesta con ai_parse_document enriquecido con JSON de gráficos

¿A qué nivel máximo aproximado (% de puntos) llegó el Oil VIX hacia el primer trimestre de 2026?

Se refiere al siguiente gráfico:

image2.png

"No puedo encontrar información específica sobre el nivel máximo exacto del Oil VIX en el Q1 de 2026 en los resultados de búsqueda proporcionados...""Según los datos presentados, el Oil VIX alcanzó aproximadamente 80 puntos porcentuales en el Q1 de 2026."

Esta ganancia en la recuperación de información puede no limitarse a preguntas sobre un gráfico. Los valores y etiquetas extraídos del gráfico pueden hacer que la propia página sea más fácil de recuperar, incluso cuando la respuesta no aparece directamente en el gráfico.

Las imágenes mejoran aún más la calidad de las respuestas

Algunas preguntas dependen de cómo se ve una figura en lugar de solo sus valores. Para medir el beneficio de restaurar el contexto visual, le proporcionamos al agente las imágenes correspondientes a los tres fragmentos de texto recuperados principales junto con el JSON en el momento de la respuesta.

image8.png
Figura 5: Tasas de respuestas correctas con el JSON del gráfico solo y con las tres imágenes principales recuperadas añadidas en el momento de la respuesta. Los resultados son el promedio de tres ejecuciones.

Aquí, la recuperación no cambia. Las imágenes añaden 4 puntos porcentuales en el conjunto de datos Chart-RAG y 2.6 puntos porcentuales en el subconjunto ViDoRe V3.

Las representaciones JSON son competitivas con los embeddings multimodales

Una pregunta es cómo se compara nuestro enfoque, que utiliza un modelo de embedding de texto ligero de 300 millones de parámetros, con los modelos de embeddings multimodales. Realizamos pruebas comparativas frente a cuatro alternativas: ColQwen2.5-3B, un modelo de embedding multimodal multivectorial grande que utiliza puntuación de interacción tardía (late-interaction), Qwen3-VL-Embedding-2B, un modelo de embedding multimodal de vector único grande, y los modelos de vector único más ligeros Jina CLIP v2 (0.9 mil millones de parámetros) y CLIP ViT-L/14 (428 millones de parámetros). Cada modelo multimodal generó los embeddings de cada página. Al momento de la consulta, clasificamos las páginas utilizando MaxSim para ColQwen2.5-3B y la similitud de coseno para los modelos de vector único, buscamos en todo el corpus y enviamos las cinco páginas con mayor puntuación al VLM de respuesta. Informamos la exactitud de las respuestas utilizando de cinco páginas recuperadas por dos razones. Primero, proporciona un punto medio equilibrado entre las profundidades de mejor rendimiento para el subconjunto ViDoRe y los conjuntos de datos Chart-RAG. Segundo, cinco páginas se aproximan al contexto de entrada promedio utilizado en nuestro enfoque, lo que permite una comparación justa. Aún así, informamos nDCG@10 como la métrica de recuperación estándar.

ViDoRe V3:

image11.png

Chart-RAG:

image13.png

Para los modelos más sólidos, la recuperación en el conjunto de datos Chart-RAG está cerca de saturarse debido al pequeño tamaño del corpus de 378 páginas. Por lo tanto, la comparación más interesante aquí es la calidad de la respuesta.

En ViDoRe V3, el JSON del gráfico con las tres imágenes principales alcanza un 75.9 % de exactitud. En Chart-RAG, la misma configuración alcanza el 75.1 %. Ambos casos superan las cuatro líneas de base de embeddings multimodales al tiempo que pasan solo tres imágenes al modelo. Este rendimiento proviene de una alternativa aproximadamente 10 veces más pequeña y sencilla que la arquitectura multivectorial de interacción tardía de ColQwen2.5-3B. Por lo tanto, el preprocesamiento estructurado de gráficos puede proporcionar una calidad de respuesta competitiva con un menor presupuesto de imágenes y una menor sobrecarga de indexación y recuperación.

Conclusión

Los gráficos son una forma predominante de información en los documentos empresariales. Hacer que la información de los gráficos sea fácil de encontrar y claramente interpretable es fundamental para la precisión de los agentes de recuperación. El JSON estructurado de gráficos cierra la brecha en el sistema RAG clásico al agregar valores precisos al índice de recuperación y para que los agentes razonen con ellos. Mostramos que el JSON estructurado de gráficos mejora tanto la calidad de la recuperación como la precisión de las respuestas del agente. El trabajo futuro podría explorar más a fondo cómo los diferentes formatos de representación de extracción estructurada afectan la recuperación y la precisión de las respuestas.

El enriquecimiento de JSON de gráficos para ai_parse_document estará disponible pronto, por lo que cualquier documento analizado incluirá automáticamente sus valores de gráficos como texto estructurado, sin ningún cambio en la interfaz de la función. Para la recuperación, recomendamos combinarlo con ai_prep_search. Esta capacidad también impulsará a Genie One para mejorar las respuestas a preguntas relacionadas con gráficos en archivos PDF para los clientes de Databricks.

Autores: Amrutha Srivatsav, Ivan Zhou, Jasmine Collins, Michael Bendersky, Adyasha Maharana, Erich Elsen, Xing Chen, Matei Zaharia

Pruébelo pronto en ai_parse_document con ai_prep_search para crear canalizaciones de recuperación y respuesta con reconocimiento de gráficos

(Esta entrada del blog ha sido traducida utilizando herramientas basadas en inteligencia artificial) Publicación original

Recibe las últimas publicaciones en tu bandeja de entrada

Suscríbete a nuestro blog y recibe las últimas publicaciones directamente en tu bandeja de entrada.