Ir al contenido principal
Ciencia de Datos y ML

Databricks Document Intelligence: redefiniendo las fronteras de la extracción de documentos complejos

Presentamos Precision Mode en AI Extract: logre una precisión de frontera en documentos largos y esquemas complejos donde los enfoques existentes se quedan cortos.

por Jane Zhang, Arnav Singhvi, Ivan Zhou, Archika Dogra, Matthew Ding y Nihit Desai

  • La extracción de campos en documentos complejos suele fallar en tres casos de uso: documentos largos que requieren conciliación entre páginas, resultados extensos como miles de partidas de facturas, y esquemas complejos cuyos campos requieren razonamiento y computación.
  • Precision Mode combina modelos de extracción personalizados y ajustados con un sistema agéntico que razona por etapas, genera subagentes para extraer en paralelo y fusiona los resultados en una sola salida, manteniendo la robustez a medida que crecen los documentos y los esquemas.
  • En seis pruebas de rendimiento de documentos complejos, Precision Mode supera al siguiente mejor modelo de frontera por siete puntos de precisión.

Todas las empresas tienen datos valiosos atrapados en documentos desordenados y no estructurados. Hoy en día, Databricks Document Intelligence ayuda a miles de clientes a poner sus datos a trabajar, transformando miles de millones de páginas en datos estructurados que impulsan pipelines de producción, agentes y aplicaciones. Clientes como Panasonic, EY-Parthenon e Intercontinental Exchange (NYSE) utilizan Document Intelligence en sus flujos de trabajo más exigentes, procesando millones de documentos a la semana.

Al trabajar con los clientes, notamos varios problemas de extracción difíciles en los que las soluciones existentes de extracción de documentos basadas en reglas o en modelos de lenguaje grande (LLM) se quedan cortas:

  • Documentos largos. Un contrato de arrendamiento cuyas condiciones de renovación de la página 1 dependen de una cláusula de la página 80, o un acuerdo cuyo párrafo de la página 150 redefine un término de la página 3. Las soluciones existentes no logran resolver estas referencias cruzadas.
  • Resultados grandes y anidados. Un conocimiento de embarque de varias páginas con cientos de SKUs, o una factura con miles de partidas. Las soluciones existentes descartan o truncan campos a medida que crecen los resultados.
  • Esquemas y razonamiento complejos. Una clasificación de riesgo que sintetiza tres estados financieros, o un valor de contrato que aplica descuentos listados a cada precio registrado. Las soluciones existentes no logran aplicar la lógica correcta de manera consistente en todos los documentos.

Hoy, nos complace presentar Precision Mode en nuestra API de extracción de documentos, ai_extract, lo que establece un nuevo estándar de precisión para las tareas y los documentos empresariales más complejos.

image3.png

Precision Mode combina nuestros modelos entrenados a medida para la extracción de documentos con un sistema de agentes para ofrecer una extracción confiable y precisa en documentos largos, resultados grandes y esquemas que requieren un razonamiento complejo. En evaluaciones comparativas que abarcan aproximadamente 9,000 documentos complejos, Precision Mode alcanza una calidad de vanguardia, superando por un amplio margen a los modelos de frontera más recientes en precisión de extracción.

"En Intercontinental Exchange, procesamos millones de documentos financieros complejos y muy variables cada mes. Document Intelligence nos ayuda a convertir esa complejidad en inteligencia de mercado estructurada, lo que nos permite avanzar más rápido, ofrecer un mayor valor a nuestros clientes y habilitar flujos de trabajo basados en agentes que aceleran el análisis y la toma de decisiones a escala."—Anand Pradhan, CTO y Head of AI, Mortgage Data en Intercontinental Exchange (NYSE)

Un nuevo enfoque para la extracción de documentos complejos

Para mejorar la precisión en las tareas de extracción más difíciles, nuestros equipos de investigación e ingeniería abordaron la calidad de la extracción de documentos desde dos niveles: la personalización del propio modelo y la creación de un sistema de agentes eficaz en torno al modelo.

  • Entrenamos modelos personalizados y eficientes para la extracción de documentos. A partir de evaluaciones comparativas basadas en flujos de trabajo complejos de los clientes, nuestro equipo de investigación entrenó modelos personalizados para buscar información estructurada en documentos complejos, razonar sobre ella y extraerla. En lugar de depender de modelos de propósito general cada vez más grandes, optimizamos para la tarea que queremos resolver: una extracción estructurada precisa.
  • Creamos un sistema de extracción diseñado para superar los modos de fallo del modelo. Incluso un modelo potente puede tener dificultades cuando debe razonar a lo largo de cientos de páginas o generar miles de campos a la vez. Nuestro equipo creó un sistema de agentes, inspirado en Databricks MemEx, que descompone semánticamente grandes tareas de extracción, ejecuta tareas más pequeñas en paralelo, conserva los resultados intermedios y los concilia en un único resultado estructurado final.
image7.png
Uso de un sistema de agentes para gestionar la extracción de documentos largos

Metodología de evaluación

Diseño de evaluaciones comparativas y composición del conjunto de datos

Para validar Precision Mode, diseñamos nuestras evaluaciones comparativas en torno a flujos de trabajo que llevan los enfoques existentes al límite.

En concreto, evaluamos Precision Mode en aproximadamente 9,000 documentos que abarcan los tres desafíos de extracción para los que fue diseñado. La evaluación incluye documentos de hasta 2,000 páginas, facturas con miles de partidas, tablas y gráficos densos de varias páginas, esquemas con más de 300 campos profundamente anidados y tareas con un alto nivel de razonamiento que requieren cruzar información a lo largo de un documento.

Los documentos provienen de dos conjuntos de evaluaciones comparativas:

  • 10 conjuntos de datos internos inspirados en los flujos de trabajo de clientes más difíciles que hemos visto, que abarcan sectores clave como los servicios financieros, la manufactura y la atención médica.
  • 5 evaluaciones comparativas públicas: VAREX, RealDocBench, LongExtractBench y LEDGER, además de una prueba de resistencia para documentos largos utilizando el conjunto de datos de Caselaw Access Project.

Juntos, estos conjuntos de datos cubren documentos que incluyen informes 10-K, conocimientos de embarque, manuales técnicos, documentos financieros, notas clínicas, solicitudes de patentes y financiamiento gubernamental, entre otros.

image9.gif
Ejemplos de documentos complejos incluidos en nuestra evaluación comparativa interna

Diseño de referencia y comparaciones de modelos

Un punto de partida natural para la extracción de documentos es una única llamada al modelo de frontera: se introduce el documento y el esquema, y se le pide al modelo que devuelva el resultado estructurado. Sin embargo, en los flujos de trabajo densos y complejos que evaluamos, ese enfoque se desmorona rápidamente. Los documentos largos pueden superar los límites de contexto del modelo, lo que genera resultados inexactos e incompletos.

Por lo tanto, realizamos una evaluación comparativa frente a una referencia más sólida y realista: fragmentación y fusión (chunk-and-merge). Dividimos cada documento en fragmentos más pequeños, realizamos la extracción de cada uno de forma independiente y fusionamos los resultados en un producto final, el mismo patrón que vemos utilizar a los ingenieros cuando una sola llamada al modelo no es suficiente.

Probamos el enfoque de fragmentación y fusión utilizando los modelos líderes GPT, Claude y Gemini con sus configuraciones de API predeterminadas. Luego, comparamos cada uno de ellos con Precision Mode en cuanto a la precisión de la extracción. ¹

Resultados de las evaluaciones comparativas

image3.png

En todas nuestras evaluaciones comparativas, Precision Mode alcanza una precisión del 94.7 %, superando por siete puntos a la referencia de fragmentación y fusión del modelo de frontera más sólido, GPT-5.6 Sol.

En particular, en flujos de trabajo difíciles con documentos largos, observamos que los modelos de frontera presentaban numerosos modos de fallo operativo, como tiempos de espera agotados en los fragmentos, resultados truncados y fusiones finales incompletas que no se ajustaban al esquema solicitado. Por otro lado, el enfoque basado en agentes de Precision Mode es resistente a estos modos de fallo, y nuestros modelos de extracción entrenados a medida mantienen las extracciones eficientes y precisas.

Primeros pasos

Para sus tareas de extracción de documentos más complejas, el Precision Mode de AI Extract ya está disponible. Establezca el modo en precision al llamar a la función ai_extract, o active el interruptor de modo de precisión en la UI de extracción de información en la página de Agentes:

image10.gif

Pruebe el Precision Mode de AI Extract

Notas al pie:

¹ Definimos la exactitud como la fracción de objetos extraídos que coinciden con el objeto de referencia. La puntuación depende del tipo. Los tipos primitivos (booleanos, flotantes, enteros, enums) utilizan coincidencia directa. Las cadenas de texto intentan primero una coincidencia directa, luego una coincidencia aproximada y, por último, un juez LLM. Los arrays se puntúan buscando el emparejamiento más cercano entre los elementos predichos y los esperados, y luego calculando el promedio de los pares. Los objetos se puntúan por campo según el tipo y luego se calcula el promedio de todos los campos.

(Esta entrada del blog ha sido traducida utilizando herramientas basadas en inteligencia artificial) Publicación original

Recibe las últimas publicaciones en tu bandeja de entrada

Suscríbete a nuestro blog y recibe las últimas publicaciones directamente en tu bandeja de entrada.