Ir para o conteúdo principal
Pesquisa em AI

Aprimorando a Recuperação de Agentes com Extração Estruturada de Gráficos

A extração estruturada de gráficos no ai_parse_document, combinada com a recuperação de texto leve, melhora a recuperação de gráficos e a precisão das respostas do agente, superando grandes modelos de embeddings multimodais.

por A Equipe de Pesquisa em IA da Databricks

A motivação

Cada vez mais empresas estão pedindo que agentes trabalhem com seus documentos proprietários e respondam a perguntas sobre seus conteúdos. No entanto, grande parte das informações importantes está em figuras e gráficos. Muitos clientes têm percebido que os agentes têm dificuldade para responder a perguntas que exigem a leitura e a contagem de valores em gráficos. Para que os agentes funcionem de maneira confiável em diversos cenários corporativos, precisamos tornar os gráficos mais interpretáveis.

Como podemos tornar um gráfico mais fácil de ser compreendido pelos agentes? Realizamos um teste simples e rápido: perguntamos a diferentes agentes: “Quantos máximos locais existem neste gráfico?”

Abaixo está uma comparação entre um agente de ponta e o Databricks Genie ao responder a essa pergunta. O agente de ponta recebeu apenas a imagem, passou 50 segundos raciocinando, mas ainda assim obteve uma resposta incorreta de 17. Enquanto isso, o Databricks Genie usou uma extração estruturada do gráfico por meio do ai_parse_document e obteve a resposta correta de 18.

image12.png

Resposta de um agente de ponta apenas com a imagem (incorreta):Resposta do Genie Agent com uma extração estruturada do gráfico (correta):
image4.pngimage10.png

Percebemos essas limitações em nosso benchmark OfficeQA Pro, no qual os modelos tiveram um desempenho pior em perguntas baseadas em gráficos e multimodais do que em perguntas que não exigiam a compreensão de gráficos. Vemos as mesmas lacunas nos sistemas de recuperação de informações dos clientes, especialmente em serviços financeiros. Um sistema de recuperação baseado em texto só pode pesquisar no espaço de texto. Uma solução comum é gerar uma legenda para descrever o assunto do gráfico; no entanto, isso pode omitir os dados necessários para perguntas detalhadas sobre os números dentro do gráfico. Como resultado, o sistema pode recuperar a página errada ou recuperar a página correta, mas sem informações suficientes para responder à pergunta.

Neste post, mostramos que a extração estruturada de gráficos melhora tanto a recuperação quanto a qualidade das respostas em perguntas baseadas em gráficos. Avaliamos nossa abordagem em dois conjuntos de dados: um subconjunto repleto de gráficos do ViDoRe V3, um benchmark para recuperação e resposta a perguntas em documentos visualmente ricos, e um conjunto de dados sintético focado em gráficos que chamamos de Chart-RAG. Nossa abordagem tem um desempenho competitivo com grandes modelos de embedding multimodal de vetor único e multi-vetor.

image9.png
Figura 1: Precisão das respostas para análise apenas de descrição, ai_parse_document enriquecido com as três principais imagens recuperadas e a linha de base de embedding multimodal mais forte quando as cinco principais páginas recuperadas são usadas para responder. Os resultados são a média de três execuções.

Construímos um pipeline de recuperação com reconhecimento de gráficos de ponta a ponta com as AI functions da Databricks, um conjunto de funções combináveis que são otimizadas com técnicas de pesquisa de última geração (ver Figura 2). Usamos o ai_parse_document para extrair o conteúdo do documento, incluindo gráficos representados como JSON estruturado, e o ai_prep_search para transformar o conteúdo em chunks prontos para recuperação, indexados com um modelo leve de embedding de texto de 300 milhões de parâmetros. Criamos um índice a partir dos chunks usando o ai_search e conectamos o índice ao Genie para recuperação e resposta.

image5.png
Figura 2: Pipeline de extração e recuperação de gráficos implementado usando as AI functions da Databricks.

Metodologia de avaliação

Comparamos dois índices, criados usando um modelo de embedding de texto BGE de 300 milhões de parâmetros, construídos a partir dos mesmos PDFs de origem, diferindo apenas na representação das figuras dos gráficos:

  • Apenas descrição (linha de base): figuras representadas apenas por legendas
  • Enriquecido com JSON: figuras de gráficos representadas por legendas e JSON de gráfico estruturado, incorporados inline no chunk da figura.

Um exemplo de extração de gráfico:

image3.png
Gráfico de barras agrupadas comparando cinco cenários de previsão econômica para o crescimento do GDP e a inflação cheia em 2026 e 2027.

Avaliamos 310 perguntas repletas de gráficos e infográficos do benchmark ViDoRe V3. O benchmark avalia a recuperação e a resposta em sete domínios: emprego, energia, farmacêutico, física, finanças, ciência da computação e documentos industriais. Para cada experimento, analisamos (parsed) e dividimos em chunks todo o corpus em inglês de 16 mil páginas e geramos respostas para cada consulta, pesquisando em todo o índice.

Embora perguntas focadas em gráficos tenham sido selecionadas, muitas ainda podiam ser respondidas usando o texto ao redor. Para isolar o impacto do conteúdo do gráfico, criamos um segundo benchmark focado apenas em perguntas baseadas em gráficos criadas a partir de três relatórios complexos e repletos de gráficos (BIS Quarterly Review, IMF World Economic Outlook, J.P. Morgan Long-Term Capital Market Assumptions). Escrevemos 114 perguntas fundamentadas visualmente a partir desses 3 documentos, totalizando 378 páginas, para construir o conjunto de dados Chart-RAG sintético.

Avaliação: Classificamos cada resposta como Correta / Parcialmente correta / Incorreta usando um juiz LLM (gemini-3-flash) em comparação com a resposta de referência.

Recuperação: Relatamos o Hit Rate@10 e o nDCG@10. O Hit Rate@10 verifica se pelo menos uma página de referência aparece nos 10 principais resultados recuperados. As perguntas do benchmark ViDoRe podem ter várias páginas de referência, cada uma com uma pontuação de relevância de 1 ou 2. Para o Hit Rate@10, convertemos a relevância graduada em relevância binária, permitindo que páginas com qualquer uma das pontuações contem como um acerto (hit). Para o nDCG@10, mantemos a relevância graduada original. No conjunto de dados Chart-RAG, cada consulta tem uma página de referência.

Para obter uma medição estável, executamos cada configuração três vezes e relatamos os resultados com intervalos de confiança.

Dados estruturados de gráficos melhoram a recuperação e a resposta

image6.png
Figura 3: Correção de resposta, Hit@10 e nDCG@10 para recuperação apenas de descrição e enriquecida com Chart-JSON no subconjunto ViDoRe V3 e conjuntos de dados Chart-RAG sintéticos. Os resultados são a média de três execuções.

O JSON de gráfico estruturado melhora tanto a qualidade da resposta quanto a recuperação em ambos os conjuntos de dados. A análise no nível da pergunta abaixo mostra quando as respostas corrigidas coincidem com uma melhor recuperação.

image7.png
Figura 4: A adição de JSON de gráfico corrigiu respostas que antes estavam incorretas. Entre essas respostas corrigidas, a figura mostra com que frequência o JSON também melhorou a recuperação (Hit@10) ou a classificação (nDCG@10). Os resultados são a média das três execuções.

O exemplo a seguir do conjunto de dados Chart-RAG demonstra como as representações em JSON melhoram a recuperação e a qualidade das respostas:

PerguntaResposta anteriorResposta com ai_parse_document enriquecido com JSON de gráfico

Aproximadamente qual nível de pico (% pts) o Oil VIX atingiu em direção ao primeiro trimestre de 2026?

Refere-se ao seguinte gráfico:

image2.png

"Não consigo encontrar informações específicas sobre o nível de pico exato do Oil VIX no Q1 de 2026 nos resultados de busca fornecidos....""De acordo com os dados apresentados, o Oil VIX atingiu aproximadamente 80 pontos percentuais no Q1 de 2026."

Este ganho de recuperação pode não se limitar a perguntas sobre um gráfico. Os valores e rótulos extraídos do gráfico podem tornar a própria página mais fácil de recuperar, mesmo quando a resposta não aparece diretamente no gráfico.

Imagens melhoram ainda mais a qualidade das respostas

Algumas perguntas dependem da aparência de uma figura, e não apenas de seus valores. Para medir o benefício de restaurar o contexto visual, fornecemos ao agente as imagens correspondentes aos três principais trechos de texto recuperados junto com o JSON no momento da resposta.

image8.png
Figura 5: Taxas de resposta correta apenas com o chart JSON e com as três principais imagens recuperadas adicionadas no momento da resposta. Os resultados são a média de três execuções.

Aqui, a recuperação permanece inalterada. As imagens adicionam 4 pontos percentuais no conjunto de dados Chart-RAG e 2,6 pontos percentuais no subconjunto ViDoRe V3.

Representações JSON são competitivas com embeddings multimodais

Uma questão é como nossa abordagem, que usa um modelo leve de embedding de texto de 300 milhões de parâmetros, se compara aos modelos de embedding multimodais. Realizamos testes comparativos com quatro alternativas: ColQwen2.5-3B, um modelo robusto de embedding multimodal de múltiplos vetores que utiliza pontuação de interação tardia (late-interaction); Qwen3-VL-Embedding-2B, um modelo robusto de embedding multimodal de vetor único; e os modelos de vetor único mais leves Jina CLIP v2 (0,9B parâmetros) e CLIP ViT-L/14 (428M parâmetros). Cada modelo multimodal gerou embeddings para todas as páginas. No momento da consulta, classificamos as páginas usando MaxSim para o ColQwen2.5-3B e similaridade de cosseno para os modelos de vetor único, realizamos a busca em todo o corpus e enviamos as cinco páginas com maior pontuação para o VLM de resposta. Relatamos a exatidão das respostas usando cinco páginas recuperadas por dois motivos. Primeiro, isso fornece um ponto médio equilibrado entre as profundidades de melhor desempenho para o subconjunto ViDoRe e os conjuntos de dados Chart-RAG. Segundo, os cinco documentos se aproximam do contexto de entrada médio usado em nossa abordagem, permitindo uma comparação justa. Ainda relatamos o nDCG@10 como a métrica padrão de recuperação.

ViDoRe V3:

image11.png

Chart-RAG:

image13.png

Para os modelos mais fortes, a recuperação no conjunto de dados Chart-RAG está próxima da saturação devido ao tamanho reduzido do corpus, de apenas 378 páginas. Portanto, a comparação mais interessante aqui é a qualidade da resposta.

No ViDoRe V3, o chart-JSON com as três principais imagens atinge 75,9% de exatidão. No Chart-RAG, a mesma configuração atinge 75,1%. Ambos os casos superam as quatro linhas de base de embedding multimodal, enviando apenas três imagens para o modelo. Esse desempenho vem de uma alternativa cerca de 10 vezes menor e mais simples que a arquitetura de múltiplos vetores e interação tardia do ColQwen2.5-3B. Portanto, o pré-processamento estruturado de gráficos pode fornecer uma qualidade de resposta competitiva com um orçamento de imagem menor e menor sobrecarga de indexação e recuperação.

Conclusão

Os gráficos são uma forma dominante de informação em documentos corporativos. Tornar as informações dos gráficos fáceis de encontrar e claramente interpretáveis é fundamental para a precisão dos agentes de recuperação. O JSON estruturado de gráficos preenche a lacuna no sistema RAG clássico, adicionando valores precisos ao índice de recuperação e para o raciocínio dos agentes. Mostramos que o JSON estruturado de gráficos melhora tanto a qualidade da recuperação quanto a precisão das respostas dos agentes. Trabalhos futuros podem explorar ainda mais como diferentes formatos de representação de extração estruturada afetam a recuperação e a precisão das respostas.

O enriquecimento de chart-JSON para ai_parse_document estará disponível em breve, de modo que qualquer documento analisado incluirá automaticamente seus valores de gráfico como texto estruturado, sem alterações na interface da função. Para recuperação, recomendamos combiná-lo com ai_prep_search. Essa capacidade também alimentará o Genie One para melhorar as respostas a perguntas relacionadas a gráficos em PDFs para clientes da Databricks.

Autores: Amrutha Srivatsav, Ivan Zhou, Jasmine Collins, Michael Bendersky, Adyasha Maharana, Erich Elsen, Xing Chen, Matei Zaharia

Experimente em breve no ai_parse_document com ai_prep_search para criar pipelines de recuperação e resposta cientes de gráficos

(Esta publicação no blog foi traduzida utilizando ferramentas baseadas em inteligência artificial) Publicação original

Receba os posts mais recentes na sua caixa de entrada

Assine nosso blog e receba os posts mais recentes diretamente na sua caixa de entrada.