Passa al contenuto principale
Data Science e ML

Databricks Document Intelligence: spingere oltre i limiti dell'estrazione da documenti complessi

Presentazione di Precision Mode in AI Extract: ottieni un'accuratezza di frontiera su documenti lunghi e schemi complessi dove gli approcci esistenti falliscono.

di Jane Zhang, Arnav Singhvi, Ivan Zhou, Archika Dogra, Matthew Ding e Nihit Desai

  • L'estrazione di campi da documenti complessi fallisce comunemente in tre casi d'uso: documenti lunghi che richiedono una riconciliazione tra più pagine, output lunghi come migliaia di voci di fattura e schemi complessi i cui campi richiedono ragionamento e calcolo.
  • Precision Mode associa modelli di estrazione personalizzati sottoposti a fine-tuning a un sistema agentico che ragiona per fasi, genera sub-agenti per l'estrazione in parallelo e unisce i risultati in un unico output, rimanendo robusto man mano che i documenti e gli schemi crescono.
  • In sei benchmark di documenti complessi, Precision Mode supera il miglior modello di frontiera successivo di sette punti in termini di accuratezza.

Ogni azienda possiede dati preziosi intrappolati in documenti disordinati e non strutturati. Oggi, Databricks Document Intelligence aiuta migliaia di clienti a valorizzare i propri dati, trasformando miliardi di pagine in dati strutturati che alimentano pipeline di produzione, agenti e applicazioni. Clienti come Panasonic, EY-Parthenon e Intercontinental Exchange (NYSE) utilizzano Document Intelligence per i loro workflow più complessi, elaborando milioni di documenti ogni settimana.

Lavorando con i clienti, abbiamo notato diversi problemi di estrazione complessi in cui i modelli linguistici di grandi dimensioni (LLM) esistenti o le soluzioni di estrazione di documenti basate su regole si rivelano insufficienti:

  • Documenti lunghi. Un contratto di locazione in cui i termini di rinnovo a pagina 1 dipendono da una clausola a pagina 80, o un accordo in cui un paragrafo a pagina 150 ridefinisce un termine di pagina 3. Le soluzioni esistenti non riescono a risolvere questi riferimenti incrociati.
  • Output ampi e annidati. Una polizza di carico multipagina con centinaia di SKU, o una fattura con migliaia di singole voci. Le soluzioni esistenti tralasciano o troncano i campi man mano che l'output cresce.
  • Schemi e ragionamenti complessi. Una classificazione del rischio che sintetizza tre rendiconti finanziari, o un valore contrattuale che applica gli sconti di listino a ogni prezzo registrato. Le soluzioni esistenti non riescono ad applicare in modo coerente la logica corretta a tutti i documenti.

Oggi siamo entusiasti di presentare la Precision Mode nella nostra API di estrazione dei documenti, ai_extract, che stabilisce un nuovo standard di accuratezza per i documenti e le attività aziendali più complessi.

image3.png

La Precision Mode combina i nostri modelli addestrati su misura per l'estrazione di documenti con un framework agentico per offrire un'estrazione affidabile e accurata su documenti lunghi, output di grandi dimensioni e schemi complessi che richiedono un ragionamento approfondito. Su benchmark che coprono circa 9.000 documenti complessi, la Precision Mode raggiunge una qualità all'avanguardia, superando di gran lunga i più recenti modelli di frontiera in termini di accuratezza dell'estrazione.

"In Intercontinental Exchange, elaboriamo ogni mese milioni di documenti finanziari complessi e altamente variabili. Document Intelligence ci aiuta a trasformare questa complessità in informazioni di mercato strutturate, consentendoci di muoverci più rapidamente, offrire un valore maggiore ai nostri clienti e sbloccare workflow agentici che accelerano l'analisi e il processo decisionale su scala."—Anand Pradhan, CTO e Head of AI, Mortgage Data presso Intercontinental Exchange (NYSE)

Un nuovo approccio all'estrazione di documenti complessi

Per migliorare l'accuratezza nelle attività di estrazione più difficili, i nostri team di ricerca e ingegneria hanno affrontato la qualità dell'estrazione dei documenti da due livelli: personalizzando il modello stesso e creando un framework agentico efficace attorno al modello.

  • Abbiamo addestrato modelli personalizzati ed efficienti per l'estrazione di documenti. Partendo da benchmark basati su carichi di lavoro complessi dei clienti, il nostro team di ricerca ha addestrato modelli personalizzati per trovare, analizzare ed estrarre informazioni strutturate da documenti complessi. Invece di affidarci a modelli general-purpose sempre più grandi, ci siamo concentrati sull'attività che vogliamo risolvere: un'estrazione strutturata e accurata.
  • Abbiamo creato un framework di estrazione progettato per superare le modalità di errore del modello. Anche un modello potente può riscontrare difficoltà quando deve analizzare centinaia di pagine o generare migliaia di campi contemporaneamente. Il nostro team ha sviluppato un framework agentico, ispirato a Databricks MemEx, che decompone semanticamente i grandi processi di estrazione, esegue attività più piccole in parallelo, conserva i risultati intermedi e li riconcilia in un unico output strutturato finale.
image7.png
Utilizzo di un framework agentico per gestire l'estrazione di documenti lunghi

Metodologia di valutazione

Progettazione del benchmark e composizione del dataset

Per convalidare la Precision Mode, abbiamo progettato i nostri benchmark di valutazione attorno a carichi di lavoro che spingono gli approcci esistenti al limite.

In concreto, abbiamo valutato la Precision Mode su circa 9.000 documenti che coprono le tre sfide di estrazione per cui è stata progettata. La valutazione include documenti fino a 2.000 pagine, fatture con migliaia di singole voci, tabelle e grafici multipagina densi di informazioni, schemi con oltre 300 campi profondamente annidati e attività complesse che richiedono il riferimento incrociato delle informazioni all'interno di un documento.

I documenti provengono da due set di benchmark:

  • 10 dataset interni ispirati ai carichi di lavoro più complessi dei nostri clienti, che coprono settori chiave tra cui servizi finanziari, produzione e sanità.
  • 5 benchmark pubblici: VAREX, RealDocBench, LongExtractBench e LEDGER, oltre a uno stress test per documenti lunghi che utilizza il dataset del Caselaw Access Project.

Insieme, questi dataset coprono documenti tra cui relazioni annuali 10-K, polizze di carico, manuali tecnici, documenti finanziari, note cliniche, domande governative di brevetto e finanziamento e altro ancora.

image9.gif
Esempi di documenti complessi inclusi nel nostro benchmark interno

Progettazione della baseline e confronti tra modelli

Un punto di partenza naturale per l'estrazione di documenti è una singola chiamata al modello di frontiera: si passano il documento e lo schema e si chiede al modello di restituire l'output strutturato. Tuttavia, sui carichi di lavoro densi e complessi che valutiamo, questo approccio mostra rapidamente i suoi limiti. I documenti lunghi possono superare i limiti di contesto del modello, causando risultati imprecisi e incompleti.

Abbiamo quindi effettuato un benchmark rispetto a una baseline più solida e realistica: il chunk-and-merge. Dividiamo ogni documento in chunk più piccoli, estraiamo le informazioni da ciascuno in modo indipendente e uniamo i risultati in un output finale, lo stesso pattern che vediamo utilizzare dagli ingegneri quando una singola chiamata al modello non è sufficiente.

Abbiamo testato l'approccio chunk-and-merge utilizzando i principali modelli GPT, Claude e Gemini con le loro impostazioni API predefinite. Successivamente, abbiamo confrontato ciascuno di essi con la Precision Mode in termini di accuratezza dell'estrazione. ¹

Risultati del benchmark

image3.png

Nei nostri benchmark, la Precision Mode raggiunge un'accuratezza del 94,7%, superando di sette punti la baseline chunk-and-merge del modello di frontiera più potente, GPT-5.6 Sol.

In particolare, su carichi di lavoro complessi con documenti lunghi, abbiamo osservato che i modelli di frontiera riscontrano numerose modalità di errore operativo, tra cui timeout dei chunk, output troncati e unioni finali incomplete che non erano conformi allo schema richiesto. D'altra parte, l'approccio agentico della Precision Mode è robusto contro queste modalità di errore e i nostri modelli di estrazione addestrati su misura mantengono le estrazioni efficienti e accurate.

Guida introduttiva

Per le attività di estrazione di documenti più complesse, la Precision Mode di AI Extract è ora disponibile. Imposta la modalità su precision quando chiami la funzione ai_extract, oppure attiva l'opzione Precision Mode nell'interfaccia utente di estrazione delle informazioni nella pagina Agenti:

image10.gif

Prova la Precision Mode di AI Extract

Note a piè di pagina:

¹ Definiamo l'accuratezza come la frazione di oggetti estratti che corrispondono all'oggetto ground truth. Il punteggio dipende dal tipo. Le primitive (booleani, float, interi, enum) utilizzano la corrispondenza diretta. Per le stringhe si tenta prima la corrispondenza diretta, poi la corrispondenza fuzzy e infine un giudice LLM. Gli array vengono valutati trovando l'associazione più vicina tra gli elementi previsti e quelli attesi, per poi calcolare la media tra le coppie. Gli oggetti vengono valutati per campo in base al tipo, quindi viene calcolata la media su tutti i campi.

(Questo post sul blog è stato tradotto utilizzando strumenti basati sull'intelligenza artificiale) Post originale

Ricevi gli ultimi articoli nella tua casella di posta

Iscriviti al nostro blog e ricevi gli ultimi articoli direttamente nella tua casella di posta.