Passa al contenuto principale
Ricerca sull'IA

Migliorare il retrieval degli agenti tramite l'estrazione strutturata di grafici

L'estrazione strutturata dei grafici in ai_parse_document, abbinata a una retrieval di testo leggera, migliora la retrieval dei grafici e la precisione delle risposte dell'agente, superando al contempo i modelli di embedding multimodali di grandi...

di Il team di ricerca sull'IA di Databricks

La motivazione

Sempre più aziende chiedono oggi agli agenti di lavorare con i propri documenti proprietari e di rispondere a domande sul loro contenuto. Tuttavia, gran parte delle informazioni importanti si trova all'interno di figure e grafici. Molti clienti riscontrano che gli agenti hanno difficoltà a rispondere a domande che richiedono la lettura e il conteggio dei valori nei grafici. Affinché gli agenti possano operare in modo affidabile in contesti aziendali eterogenei, dobbiamo rendere i grafici più interpretabili.

Come possiamo rendere un grafico più facile da comprendere per gli agenti? Abbiamo eseguito un test semplice e rapido: abbiamo chiesto a diversi agenti: “Quanti massimi locali ci sono in questo grafico?”

Di seguito è riportato un confronto tra un agente di frontiera e Databricks Genie nel rispondere a questa domanda. L'agente di frontiera ha ricevuto solo l'immagine, ha impiegato 50 secondi per ragionare, ma ha comunque fornito una risposta errata di 17. Nel frattempo, Databricks Genie ha utilizzato un'estrazione strutturata del grafico tramite ai_parse_document e ha ottenuto la risposta corretta di 18.

image12.png

Risposta di un agente di frontiera con la sola immagine (errata):Risposta dell'agente Genie con un'estrazione strutturata del grafico (corretta):
image4.pngimage10.png

Abbiamo notato queste carenze nel nostro benchmark OfficeQA Pro, dove i modelli hanno ottenuto prestazioni inferiori su domande basate su grafici e multimodali rispetto a domande che non richiedevano la comprensione dei grafici. Riscontriamo le stesse lacune nei sistemi di recupero delle informazioni dei clienti, in particolare nei servizi finanziari. Un sistema di recupero basato su testo può cercare solo nello spazio di testo. Una soluzione comune consiste nel generare una didascalia per descrivere l'argomento di un grafico; tuttavia, ciò potrebbe tralasciare i dati necessari per domande dettagliate sui numeri all'interno del grafico. Di conseguenza, il sistema potrebbe recuperare la pagina errata o recuperare la pagina corretta senza disporre di informazioni sufficienti per rispondere alla domanda.

In questo post, mostriamo che l'estrazione strutturata dai grafici migliora sia il recupero che la qualità delle risposte alle domande basate sui grafici. Valutiamo il nostro approccio su due dataset: un sottoinsieme ricco di grafici di ViDoRe V3, un benchmark per il recupero e la risposta alle domande su documenti visivamente ricchi, e un dataset sintetico incentrato sui grafici che chiamiamo Chart-RAG. Il nostro approccio offre prestazioni competitive rispetto ai modelli di embedding multimodali di grandi dimensioni a vettore singolo e multi-vettore.

image9.png
Figura 1: Accuratezza delle risposte per il parsing basato solo su descrizione, ai_parse_document arricchito con le prime tre immagini recuperate e la baseline di embedding multimodale più solida quando per rispondere vengono utilizzate le prime cinque pagine recuperate. I risultati rappresentano la media di tre esecuzioni.

Creiamo una pipeline di recupero sensibile ai grafici end-to-end con le funzioni AI di Databricks, un insieme di funzioni componibili ottimizzate con tecniche di ricerca all'avanguardia (vedere la Figura 2). Abbiamo utilizzato ai_parse_document per estrarre il contenuto dei documenti, inclusi i grafici rappresentati come JSON strutturato, e ai_prep_search per trasformare il contenuto in chunk pronti per il recupero, indicizzati con un modello leggero di embedding di testo da 300 milioni di parametri. Abbiamo creato un indice dai chunk utilizzando ai_search e abbiamo collegato l'indice a Genie per il recupero e la risposta.

image5.png
Figura 2: Pipeline di estrazione e recupero dei grafici implementata utilizzando le funzioni AI di Databricks.

Metodologia di valutazione

Abbiamo confrontato due indici, creati utilizzando un modello di embedding di testo BGE da 300 milioni di parametri, generati a partire dagli stessi PDF di origine, che differiscono solo nella rappresentazione delle figure dei grafici:

  • Solo descrizione (baseline): figure rappresentate solo da didascalie
  • Arricchito con JSON: figure dei grafici rappresentate da didascalie e JSON strutturato del grafico, incorporati inline nel chunk della figura.

Un esempio di estrazione di un grafico:

image3.png
Grafico a barre raggruppate che confronta cinque scenari di previsione economica per la crescita del GDP e l'inflazione complessiva nel 2026 e nel 2027.

Abbiamo valutato 310 domande ricche di grafici e infografiche tratte dal benchmark ViDoRe V3. Il benchmark valuta il recupero e la risposta in sette domini: occupazione, energia, farmaceutica, fisica, finanza, informatica e documenti industriali. Per ogni esperimento, abbiamo analizzato e suddiviso in chunk l'intero corpus in lingua inglese di 16.000 pagine e generato risposte per ogni query, effettuando la ricerca sull'intero indice.

Sebbene siano state selezionate domande incentrate sui grafici, a molte di esse era comunque possibile rispondere utilizzando il testo circostante. Per isolare l'impatto del contenuto dei grafici, abbiamo creato un secondo benchmark focalizzato solo su domande basate su grafici create a partire da tre report complessi e ricchi di grafici (BIS Quarterly Review, IMF World Economic Outlook, J.P. Morgan Long-Term Capital Market Assumptions). Abbiamo scritto 114 domande basate su elementi visivi a partire da questi 3 documenti per un totale di 378 pagine per creare il dataset Chart-RAG sintetico.

Valutazione: abbiamo classificato ogni risposta come Corretta / Parzialmente corretta / Errata utilizzando un LLM come giudice (gemini-3-flash) rispetto alla sua risposta di riferimento.

Recupero: riportiamo Hit Rate@10 e nDCG@10. Hit Rate@10 verifica se almeno una pagina di riferimento appare tra i primi 10 risultati recuperati. Le domande del benchmark ViDoRe possono avere più pagine di riferimento, ciascuna con un punteggio di rilevanza di 1 o 2. Per Hit Rate@10, convertiamo la rilevanza graduata in rilevanza binaria consentendo alle pagine con entrambi i punteggi di essere conteggiate come hit. Per nDCG@10, manteniamo la rilevanza graduata originale. Nel dataset Chart-RAG, ciascuna query ha una sola pagina di riferimento.

Per ottenere una misurazione stabile, abbiamo eseguito ciascuna configurazione tre volte e riportiamo i risultati con intervalli di confidenza.

I dati strutturati dei grafici migliorano il recupero e la risposta

image6.png
Figura 3: Correttezza delle risposte, Hit@10 e nDCG@10 per il recupero basato solo su descrizione e arricchito con JSON del grafico nel sottoinsieme ViDoRe V3 e nei dataset sintetici Chart-RAG. I risultati rappresentano la media di tre esecuzioni.

Il JSON strutturato del grafico migliora sia la qualità delle risposte che il recupero in entrambi i dataset. L'analisi a livello di domanda riportata di seguito mostra quando le risposte corrette coincidono con un recupero migliore.

image7.png
Figura 4: L'aggiunta del JSON del grafico ha corretto risposte precedentemente errate. Tra queste risposte corrette, la figura mostra quanto spesso il JSON abbia migliorato anche il recupero (Hit@10) o il ranking (nDCG@10). I risultati rappresentano la media di tre esecuzioni.

Il seguente esempio tratto dal dataset Chart-RAG dimostra come le rappresentazioni JSON migliorino il recupero e la qualità delle risposte:

DomandaRisposta precedenteRisposta con ai_parse_document arricchito con JSON del grafico

All'incirca quale livello di picco (punti percentuali) ha raggiunto l'Oil VIX verso il primo trimestre del 2026?

Si riferisce al seguente grafico:

image2.png

"Non riesco a trovare informazioni specifiche sul livello di picco esatto dell'Oil VIX nel Q1 2026 nei risultati di ricerca forniti...""In base ai dati presentati, l'Oil VIX ha raggiunto circa 80 punti percentuali nel Q1 2026."

Questo miglioramento del retrieval potrebbe non limitarsi alle domande su un grafico. I valori e le etichette estratti dal grafico possono rendere la pagina stessa più facile da recuperare, anche quando la risposta non appare direttamente nel grafico.

Le immagini migliorano ulteriormente la qualità delle risposte

Alcune domande dipendono dall'aspetto di una figura anziché solo dai suoi valori. Per misurare il vantaggio del ripristino del contesto visivo, abbiamo fornito all'agente le immagini corrispondenti ai primi tre chunk di testo recuperati insieme al JSON al momento della risposta.

image8.png
Figura 5: Tassi di risposta corretti con il solo JSON del grafico e con l'aggiunta delle prime tre immagini recuperate al momento della risposta. I risultati sono la media di tre esecuzioni.

Qui il retrieval rimane invariato. Le immagini aggiungono 4 punti percentuali sul dataset Chart-RAG e 2,6 punti percentuali sul subset ViDoRe V3.

Le rappresentazioni JSON sono competitive con gli embedding multimodali

Una questione riguarda il modo in cui il nostro approccio, che utilizza un modello di text embedding leggero da 300 milioni di parametri, si confronta con i modelli di embedding multimodali. Abbiamo effettuato un benchmark rispetto a quattro alternative: ColQwen2.5-3B, un modello di embedding multimodale multi-vettore di grandi dimensioni che utilizza lo scoring late-interaction, Qwen3-VL-Embedding-2B, un modello di embedding multimodale a vettore singolo di grandi dimensioni, e i modelli a vettore singolo più leggeri Jina CLIP v2 (0,9 miliardi di parametri) e CLIP ViT-L/14 (428 milioni di parametri). Ogni modello multimodale ha generato l'embedding di ogni pagina. Al momento della query, abbiamo classificato le pagine utilizzando MaxSim per ColQwen2.5-3B e la similarità del coseno per i modelli a vettore singolo, effettuato la ricerca sull'intero corpus e passato le cinque pagine con il punteggio più alto al VLM di risposta. Riportiamo la correttezza della risposta utilizzando tre o cinque pagine recuperate per due motivi. In primo luogo, fornisce un punto medio bilanciato tra le profondità con le migliori prestazioni per il subset ViDoRe e i dataset Chart-RAG. In secondo luogo, cinque pagine approssimano il contesto di input medio utilizzato nel nostro approccio, consentendo un confronto equo. Riportiamo comunque nDCG@10 come metrica di retrieval standard.

ViDoRe V3:

image11.png

Chart-RAG:

image13.png

Per i modelli più forti, il retrieval sul dataset Chart-RAG è quasi saturo a causa delle dimensioni ridotte del corpus di 378 pagine. Il confronto più interessante in questo caso, quindi, è la qualità della risposta.

Su ViDoRe V3, il chart-JSON con le prime tre immagini raggiunge il 75,9% di correttezza. Su Chart-RAG, la stessa configurazione raggiunge il 75,1%. Entrambi i casi superano le quattro baseline di embedding multimodale pur passando solo tre immagini al modello. Queste prestazioni derivano da un'alternativa circa 10 volte più piccola e semplice rispetto all'architettura multi-vettore e late-interaction di ColQwen2.5-3B. La pre-elaborazione strutturata dei grafici può quindi fornire una qualità della risposta competitiva con un budget di immagini inferiore e un minore overhead di indicizzazione e retrieval.

Conclusione

I grafici sono una forma dominante di informazione nei documenti aziendali. Rendere le informazioni dei grafici facili da trovare e chiaramente interpretabili è fondamentale per l'accuratezza degli agenti di retrieval. Il JSON strutturato dei grafici colma il divario nel classico sistema RAG aggiungendo valori precisi all'indice di retrieval e consentendo agli agenti di ragionare su di essi. Mostriamo che il JSON strutturato dei grafici migliora sia la qualità del retrieval che l'accuratezza delle risposte degli agenti. I lavori futuri potrebbero esplorare ulteriormente l'impatto di diversi formati di rappresentazione dell'estrazione strutturata sulla precisione del retrieval e delle risposte.

L'arricchimento chart-JSON per ai_parse_document sarà presto disponibile, quindi qualsiasi documento analizzato includerà automaticamente i valori dei suoi grafici come testo strutturato, senza alcuna modifica all'interfaccia della funzione. Per il retrieval, consigliamo di associarlo a ai_prep_search. Questa funzionalità alimenterà anche Genie One per migliorare le risposte alle domande relative ai grafici sui PDF per i clienti Databricks.

Autori: Amrutha Srivatsav, Ivan Zhou, Jasmine Collins, Michael Bendersky, Adyasha Maharana, Erich Elsen, Xing Chen, Matei Zaharia

Provalo presto in ai_parse_document con ai_prep_search per creare pipeline di retrieval e risposta ottimizzate per i grafici

(Questo post sul blog è stato tradotto utilizzando strumenti basati sull'intelligenza artificiale) Post originale

Ricevi gli ultimi articoli nella tua casella di posta

Iscriviti al nostro blog e ricevi gli ultimi articoli direttamente nella tua casella di posta.