Ir para o conteúdo principal
Data Science e ML

Databricks Document Intelligence: expandindo as fronteiras da extração de documentos complexos

Apresentando o Precision Mode no AI Extract: alcance precisão de fronteira em documentos longos e esquemas complexos onde as abordagens existentes falham.

por Jane Zhang, Arnav Singhvi, Ivan Zhou, Archika Dogra, Matthew Ding e Nihit Desai

  • A extração de campos em documentos complexos geralmente falha em três casos de uso: documentos longos que exigem reconciliação entre páginas, saídas longas (como milhares de itens de linha de fatura) e esquemas complexos cujos campos exigem raciocínio e computação.
  • O Precision Mode combina modelos de extração personalizados com ajuste fino a uma estrutura agêntica que raciocina em etapas, inicializa subagentes para extrair em paralelo e mescla os resultados em uma única saída, mantendo-se robusto à medida que os documentos e esquemas crescem.
  • Em seis benchmarks de documentos complexos, o Precision Mode supera o próximo melhor modelo de fronteira em sete pontos de precisão.

Toda empresa tem dados valiosos presos em documentos desorganizados e não estruturados. Hoje, o Databricks Document Intelligence ajuda milhares de clientes a colocar seus dados em prática, transformando bilhões de páginas em dados estruturados que alimentam pipelines, agentes e aplicações de produção. Clientes como a Panasonic, a EY-Parthenon e a Intercontinental Exchange (NYSE) usam o Document Intelligence em seus fluxos de trabalho mais exigentes, processando milhões de documentos semanalmente.

Ao trabalhar com clientes, percebemos vários problemas difíceis de extração nos quais as soluções existentes de extração de documentos baseadas em regras ou em grandes modelos de linguagem (LLM) deixam a desejar:

  • Documentos longos. Um contrato de aluguel cujos termos de renovação da página 1 dependem de uma cláusula na página 80, ou um acordo cujo parágrafo na página 150 redefine um termo da página 3. As soluções existentes não conseguem resolver essas referências cruzadas.
  • Saídas grandes e aninhadas. Um conhecimento de embarque de várias páginas com centenas de SKUs, ou uma fatura com milhares de itens de linha. As soluções existentes descartam ou truncam campos à medida que as saídas crescem.
  • Esquemas e raciocínio complexos. Uma classificação de risco que sintetiza três demonstrações financeiras, ou um valor de contrato que aplica descontos listados em cada preço registrado. As soluções existentes falham em aplicar consistentemente a lógica correta em todos os documentos.

Hoje, temos o prazer de apresentar o Precision Mode em nossa API de extração de documentos, ai_extract, definindo um novo padrão de precisão para as tarefas e documentos corporativos mais complexos.

image3.png

O Precision Mode combina nossos modelos treinados de forma personalizada para extração de documentos com uma estrutura de agentes para fornecer uma extração confiável e precisa em documentos longos, saídas grandes e esquemas complexos que exigem raciocínio. Em benchmarks que abrangem cerca de 9.000 documentos complexos, o Precision Mode alcança qualidade de estado da arte, superando os modelos de fronteira mais recentes em precisão de extração por uma grande margem.

"Na Intercontinental Exchange, processamos milhões de documentos financeiros complexos e altamente variáveis todos os meses. O Document Intelligence nos ajuda a transformar essa complexidade em inteligência de mercado estruturada, permitindo-nos agir mais rápido, entregar maior valor aos nossos clientes e desbloquear fluxos de trabalho de agentes que aceleram a análise e a tomada de decisões em escala."—Anand Pradhan, CTO e Head de AI, Mortgage Data na Intercontinental Exchange (NYSE)

Uma nova abordagem para extração de documentos complexos

Para elevar a precisão nas tarefas de extração mais difíceis, nossas equipes de pesquisa e engenharia abordaram a qualidade da extração de documentos sob duas perspectivas: a personalização do próprio modelo e a construção de uma estrutura de agentes eficaz em torno do modelo.

  • Treinamos modelos personalizados e eficientes para extração de documentos. Trabalhando a partir de benchmarks criados com base em cargas de trabalho complexas de clientes, nossa equipe de pesquisa treinou modelos personalizados para localizar, raciocinar e extrair informações estruturadas de documentos complexos. Em vez de depender de modelos de uso geral cada vez maiores, otimizamos para a tarefa que queremos resolver: extração estruturada precisa.
  • Criamos uma estrutura de extração projetada para superar os modos de falha do modelo. Mesmo um modelo forte pode ter dificuldades quando precisa raciocinar ao longo de centenas de páginas ou gerar milhares de campos de uma só vez. Nossa equipe criou uma estrutura de agentes, inspirada no Databricks MemEx, que decompõe semanticamente grandes trabalhos de extração, executa tarefas menores em paralelo, preserva resultados intermediários e os reconcilia em uma única saída estruturada final.
image7.png
Usando uma estrutura de agentes para gerenciar a extração de documentos longos

Metodologia de avaliação

Design do benchmark e composição do conjunto de dados

Para validar o Precision Mode, projetamos nossos benchmarks de avaliação com base em cargas de trabalho que levam as abordagens existentes ao limite.

Concretamente, avaliamos o Precision Mode em cerca de 9.000 documentos que abrangem os três desafios de extração que ele foi projetado para resolver. A avaliação inclui documentos de até 2.000 páginas, faturas com milhares de itens de linha, tabelas e gráficos densos de várias páginas, esquemas com mais de 300 campos profundamente aninhados e tarefas complexas de raciocínio que exigem o cruzamento de informações em todo o documento.

Os documentos vêm de dois conjuntos de benchmarks:

  • 10 conjuntos de dados internos inspirados nas cargas de trabalho de clientes mais difíceis que já vimos, abrangendo setores importantes, incluindo serviços financeiros, manufatura e saúde.
  • 5 benchmarks públicos: VAREX, RealDocBench, LongExtractBench e LEDGER, além de um teste de estresse de documentos longos usando o conjunto de dados do Caselaw Access Project.

Juntos, esses conjuntos de dados cobrem documentos que incluem relatórios 10-K, conhecimentos de embarque, manuais técnicos, documentos financeiros, notas clínicas, pedidos de patentes e financiamento governamental, entre outros.

image9.gif
Exemplos de documentos complexos incluídos em nosso benchmark interno

Design de baseline e comparações de modelos

Um ponto de partida natural para a extração de documentos é uma única chamada de modelo de fronteira: passar o documento e o esquema e solicitar que o modelo retorne a saída estruturada. No entanto, nas cargas de trabalho densas e complexas que avaliamos, essa abordagem falha rapidamente. Documentos longos podem exceder os limites de contexto do modelo, resultando em saídas imprecisas e incompletas.

Por isso, realizamos o benchmark em relação a uma baseline mais forte e realista: dividir e mesclar (chunk-and-merge). Dividimos cada documento em partes menores (chunks), extraímos as informações de cada uma de forma independente e mesclamos os resultados em uma saída final — o mesmo padrão que vemos os engenheiros usarem quando uma única chamada de modelo não é suficiente.

Testamos a abordagem de dividir e mesclar usando os principais modelos GPT, Claude e Gemini com suas configurações padrão de API. Em seguida, comparamos cada um deles com o Precision Mode em relação à precisão da extração. ¹

Resultados do benchmark

image3.png

Em todos os nossos benchmarks, o Precision Mode atinge 94,7% de precisão, superando a baseline de dividir e mesclar do modelo de fronteira mais forte, o GPT-5.6 Sol, em sete pontos.

Particularmente, em cargas de trabalho difíceis com documentos longos, observamos que os modelos de fronteira enfrentam vários modos de falha operacional, incluindo limites de tempo de chunks (timeouts), saídas truncadas e mesclagens finais incompletas que não estavam em conformidade com o esquema solicitado. Por outro lado, a abordagem baseada em agentes do Precision Mode é robusta contra esses modos de falha, e nossos modelos de extração treinados de forma personalizada mantêm as extrações eficientes e precisas.

Como começar

Para suas tarefas mais complexas de extração de documentos, o Precision Mode do AI Extract já está disponível. Defina o modo como precision ao chamar a função ai_extract, ou ative o botão do modo de precisão na UI de Extração de Informações na página de Agentes:

image10.gif

Experimente o Precision Mode do AI Extract

Notas de rodapé:

¹ Definimos acurácia como a fração de objetos extraídos que correspondem ao objeto de ground-truth. A pontuação depende do tipo. Primitivos (booleanos, floats, inteiros, enums) usam correspondência direta. Strings tentam correspondência direta primeiro, depois correspondência aproximada (fuzzy match) e, por fim, um avaliador LLM. Arrays são pontuados encontrando o emparelhamento mais próximo entre os itens previstos e esperados e, em seguida, calculando a média entre os pares. Objetos são pontuados por campo de acordo com o tipo e, depois, é feita a média de todos os campos.

(Esta publicação no blog foi traduzida utilizando ferramentas baseadas em inteligência artificial) Publicação original

Receba os posts mais recentes na sua caixa de entrada

Assine nosso blog e receba os posts mais recentes diretamente na sua caixa de entrada.