Passa al contenuto principale
Prodotto

Presentazione di OfficeQA Pro V2: un nuovo benchmark per il ragionamento ancorato aziendale

Una nuova e stimolante valutazione del ragionamento ancorato su dati di tipo aziendale

di Databricks AI Research Team

  • OfficeQA Pro V2 è un nuovo benchmark per il ragionamento ancorato (grounded reasoning) aziendale, creato utilizzando la nostra pipeline interna di dati sintetici a partire da circa 1.400 PDF del Tesoro degli Stati Uniti che coprono 233 anni e circa 120.000 pagine.
  • Sfruttiamo la generazione di dati sintetici per creare OfficeQA Pro V2, consentendoci di scalare domande e risposte verificate e diversificate. La combinazione di queste tecniche di dati sintetici con la nostra comprensione dei workflow aziendali ci consente di creare rapidamente nuovi benchmark per compiere progressi nelle attività che stanno a cuore ai nostri clienti, come il ragionamento ancorato.
  • Un harness per agenti ottimizzato può migliorare drasticamente le prestazioni. Gli agenti out-of-the-box hanno registrato una precisione media di appena il 26,0% su OfficeQA Pro V2, mentre Genie di Databricks ha offerto un miglioramento relativo medio del 92% tra i modelli corrispondenti e ha raggiunto una precisione fino al 60% utilizzando gli stessi modelli. Nonostante questi progressi, rimane un significativo margine di miglioramento nel ragionamento ancorato.

Oggi rilasciamo OfficeQA Pro V2, un nuovo benchmark progettato per valutare se gli agenti di IA sono in grado di generalizzare a compiti di grounded reasoning non familiari e di tipo enterprise.

Sette mesi fa, abbiamo introdotto il benchmark OfficeQA per misurare l'efficacia dei sistemi di IA nel rispondere a domande analitiche utilizzando prove tratte da ampie raccolte di documenti, un compito aziendale estremamente comune e importante con cui abbiamo notato che gli agenti faticano. Dalla sua introduzione, OfficeQA e il suo subset di frontiera, OfficeQA Pro, sono diventati un importante metro di misura per le capacità dei modelli e degli agenti di frontiera, guidando i progressi nel recupero dei documenti, nel parsing e nel ragionamento analitico. Ma questo progresso solleva una domanda fondamentale: questi miglioramenti riflettono progressi più ampi nel grounded reasoning o progressi specifici per un singolo corpus e una singola distribuzione dei compiti? Questa distinzione è fondamentale nei contesti aziendali, dove gli agenti raramente operano su una raccolta di documenti singola e stabile.

Il nostro nuovo benchmark, OfficeQA Pro V2, è progettato per testare direttamente questa capacità di generalizzazione. Inizialmente abbiamo sviluppato OfficeQA Pro V2 as benchmark per l'inaugurale Databricks Grounded Reasoning Cup, una competizione dal vivo in cui 11 team accademici, supportati da OpenAI, Anthropic e Google DeepMind, hanno creato agenti valutati su un corpus e un insieme di compiti di grounded reasoning mai visti prima. Il benchmark contiene 90 domande basate su circa 120.000 pagine tratte dagli Accounts of Receipts and Expenditures del Tesoro degli Stati Uniti, rilasciati per la prima volta come dataset coeso dal Tesoro statunitense in concomitanza con il 250° anniversario degli Stati Uniti. Ora siamo entusiasti di rilasciare il benchmark a una comunità più ampia di professionisti dell'IA affinché possano utilizzarlo per i propri sviluppi.

Prestazioni degli agenti su OfficeQA Pro V2
Accuratezza su OfficeQA Pro V2 utilizzando gli harness dei fornitori di modelli (Claude Code per i modelli Anthropic e Codex per i modelli OpenAI) rispetto a Databricks Genie. Tra i quattro modelli confrontati, Genie ha migliorato l'accuratezza media di 15,3 punti percentuali, passando dal 37,5% al 52,8%.

OfficeQA Pro V2 rimane una sfida per i sistemi di IA odierni. Gli agenti di frontiera pronti all'uso che utilizzano Claude Code con Claude Opus 4.8 e Claude Fable 5, o Codex con GPT-5.5 e GPT-5.6 Sol, hanno ottenuto un'accuratezza media del 37,5%. Gli agenti sviluppati specificamente per la Grounded Reasoning Cup hanno ottenuto prestazioni migliori, con una media del 41,1% e il team vincitore che ha raggiunto il 63,3%. Abbiamo anche valutato Databricks Genie, l'agente di IA di Databricks progettato per rispondere a domande complesse sui dati aziendali, utilizzando gli stessi modelli sottostanti. Genie, che utilizza anche ai_parse di Databricks per eseguire il pre-parsing del corpus di documenti, ha migliorato l'accuratezza in media di 24,0 punti percentuali rispetto agli harness predefiniti, con la configurazione più performante che ha raggiunto il 60%. Insieme, questi risultati dimostrano che il grounded reasoning è ancora lontano dall'essere risolto, ma che l'harness dell'agente corretto può sbloccare vantaggi significativi dai modelli di frontiera esistenti.

Di seguito descriviamo in modo più dettagliato le prestazioni degli agenti su OfficeQA Pro V2, come è stato creato e in cosa si differenzia dal benchmark OfficeQA originale.

Prestazioni degli agenti su OfficeQA Pro V2

Pareto costo-qualità su OfficeQA Pro V2
Costo rispetto alla correttezza per le combinazioni modello + harness su OfficeQA Pro V2. I modelli che utilizzano Databricks Genie dominano la frontiera di Pareto, ottenendo una qualità superiore a un costo inferiore. I costi per rollout non includono il costo iniziale una tantum per il parsing del corpus con ai_parse.

Abbiamo prima valutato i modelli di frontiera utilizzando l'harness associato a ciascun fornitore di modelli, con Codex per i modelli GPT e Claude Code per i modelli Claude, utilizzando la stessa metrica deterministica di corrispondenza esatta (exact-match) con tolleranza dello 0,0% utilizzata per OfficeQA. Tra i cinque modelli valutati in entrambi gli harness, queste configurazioni di base hanno ottenuto un'accuratezza media del 26,0%. Le prestazioni variano notevolmente a seconda del modello e un costo più elevato non si è tradotto costantemente in una maggiore accuratezza. Ad esempio, Sonnet 5 su Claude Code ha ottenuto il 15,6% a 5,01 $ per rollout, mentre GPT-5.6 Sol su Codex ha raggiunto il 33,3% a un costo simile di 4,70 $.

L'utilizzo di questi modelli all'interno di Genie ha prodotto miglioramenti sostanziali. Nei confronti tra modelli accoppiati, Genie ha migliorato l'accuratezza in media di 24,0 punti percentuali (un miglioramento relativo del 92%). Le configurazioni di Genie che utilizzano GPT-5.6 Luna, GPT-5.6 Terra e Claude Fable 5 dominano inoltre la frontiera di Pareto costo-qualità, dimostrando che questi miglioramenti non richiedono di sacrificare l'efficienza a favore dell'accuratezza. Nel caso di Claude Fable 5, il passaggio a Genie migliora le prestazioni di 14,4 punti percentuali (+32% relativo) riducendo al contempo i costi di circa 9 volte. Dall'analisi delle tracce, emerge che Fable 5 tende a compiere tentativi ciclici di parsing di molti documenti, il che porta a rollout lunghi con un costo medio di 37,36 $. Genie esegue il parsing dei documenti utilizzando ai_parse per i documenti, consentendo al modello di identificare in modo efficiente le informazioni corrette da ogni pagina, riducendo così i costi e migliorando le prestazioni.

Sebbene questi miglioramenti dell'harness portino a vantaggi sostanziali, rimane un ampio margine di miglioramento in OfficeQA Pro V2. I sistemi continuano a mostrare modalità di errore simili a quelle osservate nell'OfficeQA originale: fedeltà di parsing, errata riconciliazione temporale a causa del cambiamento delle convenzioni contabili nel tempo e interpretazione errata dell'ambito dell'entità o della granularità delle categorie.

Creazione di un nuovo benchmark di grounded reasoning

Per testare realmente la generalizzazione, avevamo bisogno di un nuovo corpus che riflettesse comunque le stesse competenze rilevanti per l'azienda che OfficeQA era stato progettato per misurare: parsing di documenti complessi, recupero delle prove corrette ed esecuzione di un ragionamento analitico ancorato a tali informazioni.

Abbiamo collaborato con il Tesoro degli Stati Uniti per creare il benchmark attorno a un nuovo corpus: gli U.S. Federal Accounts of Receipts and Expenditures, che il Tesoro si stava preparando a rilasciare come dataset unificato per la prima volta in concomitanza con il 250° anniversario degli Stati Uniti. Il corpus è composto da circa 1.400 PDF e 120.000 pagine contenenti registri contabili dettagliati degli Stati Uniti, dal 1793 al 2024.

Come i Treasury Bulletins degli Stati Uniti utilizzati nel benchmark OfficeQA originale, questo nuovo corpus riflette molte delle sfide comuni alle raccolte di documenti aziendali: tabelle e grafici densi, valori rivisti nel tempo, convenzioni di rendicontazione in evoluzione e una profonda conoscenza istituzionale. Queste complessità si traducono anche in una valutazione impegnativa: come per il benchmark OfficeQA originale, notiamo che gli agenti di frontiera di base faticano a raggiungere un'accuratezza costantemente elevata su OfficeQA Pro V2.

Scalare OfficeQA Pro V2 con dati sintetici

Pipeline di dati sintetici utilizzata per creare OfficeQA Pro V2.
Pipeline di dati sintetici utilizzata per creare OfficeQA Pro V2.

Quando abbiamo creato il benchmark OfficeQA originale alla fine del 2025, il processo era fortemente manuale. Gli annotatori umani formulavano domande e risposte a mano esaminando un corpus composto da 89.000 pagine di U.S. Treasury Bulletin, richiedendo spesso numerosi cicli di revisione umana per garantire la qualità delle domande. Sebbene questo approccio abbia infine prodotto un benchmark di alta qualità, richiedeva molto tempo, era costoso e difficile da scalare. Da allora, abbiamo sviluppato tecniche per automatizzare la creazione di benchmark rigorosi in modo molto più efficiente e affidabile.

Per creare OfficeQA Pro V2, abbiamo sfruttato asynth, la nostra libreria interna per la creazione di pipeline di generazione di dati sintetici. Ciò ci ha permesso di creare in modo rapido e scalabile un benchmark diversificato e verificabile che riflettesse accuratamente le sfide del grounded reasoning, utilizzando un processo sistematico per la generazione e la verifica delle domande:

  1. Input. Per promuovere la diversità dei campioni, il sintetizzatore è stato avviato con un periodo di tempo selezionato casualmente, un metodo analitico, un numero target di documenti di origine e un argomento saliente tratto da un elenco sviluppato con il nostro partner, USAFacts, per riflettere le domande che gli analisti potrebbero naturalmente porre al corpus.
  2. Sintesi. Per ogni domanda candidata, un agente di sintesi ha cercato nel corpus le prove corrispondenti a questi criteri e ha generato un campione supportato da una catena tracciabile di grounded reasoning.
  3. Verifica. Successivamente, i campioni sono passati attraverso diversi controlli di qualità per verificarne la fedeltà alla fonte, la rilevanza analitica, la diversità e la possibilità di risposta. Agenti risolutori indipendenti hanno provato a rispondere alla domanda da zero, producendo traiettorie di soluzione alternative, che sono state esaminate da un agente di verifica. Solo i candidati con risposte verificabilmente corrette sono passati alla fase successiva.
  4. Revisione finale. Come fase finale del controllo di qualità, i campioni sono stati esaminati manualmente insieme alle soluzioni prodotte da altri modelli di frontiera. I revisori hanno esaminato insieme la domanda, la risposta, il ragionamento e le prove citate, conservando solo i campioni la cui interpretazione e ground truth fossero inequivocabilmente corretti.

Le domande risultanti richiedono le stesse capacità fondamentali di grounded reasoning misurate dal benchmark OfficeQA originale: recupero di informazioni da più documenti di origine, ragionamento analitico e capacità specializzate come la ricerca web supplementare e l'interpretazione multimodale delle figure. Di seguito sono riportati alcuni esempi di domande del benchmark e dettagli sulla sua composizione.

Esempi di domande

1. Difficoltà bassa: Calcolo dei guadagni del Chief Justice: “Qual è il valore nominale totale in dollari dei guadagni di John Jay come Chief Justice della Corte Suprema, secondo l'Account of Receipts and Expenditures degli Stati Uniti durante la seconda metà del CY 1793, e quali numeri di mandato corrispondevano ai pagamenti? Restituisci la risposta come valori separati da virgole tra parentesi quadre nell'ordine del valore dei suoi guadagni e dei numeri di mandato in ordine di anno solare.”

image4.jpg

Questa domanda richiede di individuare una singola pagina dell'Account of Receipts and Expenditures del 1793 e di leggere i quattro pagamenti di mandato registrati a nome del Chief Justice John Jay (evidenziati in rosso), interpretando correttamente che "do." è l'abbreviazione di "ditto" (idem), che indica la stessa categoria di dati della riga precedente. La domanda richiede poi di comprendere che la “seconda metà del CY 1793” limita l'ambito della risposta ai soli pagamenti di luglio e novembre. Infine, per calcolare la risposta finale sono necessari il recupero dei numeri di mandato corrispondenti e una semplice somma.

2. Difficoltà media: Previsione dell'incremento delle spese Medicare: “Tra il FY1990 e il FY1994 inclusi, le spese di Medicare sono cresciute rapidamente con l'espansione del programma. Adattando una regressione lineare OLS alle cifre annuali riportate per le spese Medicare per quegli anni fiscali, qual è l'aumento medio annuo stimato in dollari delle spese Medicare riportato in milioni di dollari, arrotondato a due cifre decimali?”

image13.png

Questa domanda richiede di recuperare la cifra delle spese Medicare dalla tabella "Outlays by Function" in cinque distinti Combined Statements annuali (FY1990–FY1994, evidenziati in rosso). In particolare, l'agente deve leggere il valore di ogni anno dall'ultima colonna rivista dell'anno precedente, anziché dalla prima cifra riportata. Infine, l'agente deve adattare la serie con un modello di regressione lineare per stimare l'aumento medio annuo.

3. Difficoltà alta: Previsione dell'incremento delle spese tra le agenzie: “Per le spese nette combinate dei Dipartimenti del Commercio, dell'Interno e di Stato, della Environmental Protection Agency e della National Aeronautics and Space Administration raggruppate a partire dalle loro famiglie costitutive di Treasury Account Symbol (TAS) come riportato dal Tesoro degli Stati Uniti, adatta il metodo Theta non stagionale standard sulle spese riportate: stima la componente θ=0 come un trend lineare OLS, costruisci la serie trasformata θ=2, prevedi quella componente con un semplice smoothing esponenziale inizializzato al suo primo valore e scegli α su [0, 1], consentendo α = 1.0. Utilizzando questa previsione e calcolando la media delle previsioni one-step-ahead per θ=0 e θ=2, qual è la previsione per il FY1989 in milioni di dollari arrotondata al centesimo più vicino?”

rendiconto operativo

Questa domanda richiede di assemblare una serie di otto anni (FY1981–FY1988) di spese nette per cinque diverse agenzie (Commerce, Interior, State, EPA e NASA) da otto distinti Combined Statements. Anche in questo caso, l'agente deve utilizzare solo le ultime cifre riportate per ciascun anno. La serie risultante deve quindi essere utilizzata per prevedere le spese nette per il FY1989, utilizzando un metodo di previsione specifico.

Dettagli sul benchmark

Capacità valutate nella suite OfficeQA
Percentuale di domande in ciascun benchmark OfficeQA che richiedono analisi avanzata dei dati, conoscenza esterna, recupero da più di tre documenti di origine o interpretazione di grafici non tabellari. OfficeQA Pro si riferisce alla sezione di frontiera delle domande di OfficeQA, OfficeQA Full è un set combinato che include domande più semplici e OfficeQA Pro V2 è il nostro benchmark appena rilasciato.

OfficeQA Pro V2 consiste di 90 domande, tutte richiedenti prove provenienti dal corpus del benchmark. Come parte della nostra pipeline di verifica dei dati sintetici, abbiamo filtrato le domande a cui era possibile rispondere utilizzando solo la conoscenza parametrica o la ricerca sul web.

Sebbene sia basato su un nuovo corpus, OfficeQA Pro V2 conserva le capacità fondamentali di grounded reasoning aziendale misurate dal benchmark OfficeQA originale, sia nell'intero set di domande, OfficeQA Full, sia nel suo sottoinsieme di difficoltà di frontiera, OfficeQA Pro. Il 7% delle domande richiede la comprensione visiva di diagrammi, grafici o figure, rispetto a circa il 3% in OfficeQA Pro. Un altro 10% richiede informazioni supplementari ottenute tramite ricerca sul web (come indici di inflazione, serie del GDP o dati sulla popolazione), rispetto al 21,8% di OfficeQA Pro e al 15,9% di OfficeQA Full. Insieme, circa una domanda su sei di OfficeQA Pro V2 richiede almeno una di queste capacità specializzate oltre al recupero e all'analisi del testo.

Rispetto a OfficeQA Pro, OfficeQA Pro V2 richiede prove provenienti da un numero significativamente maggiore di documenti di origine per domanda. Le domande di OfficeQA Pro si basano in media su circa 2 documenti del Treasury Bulletin, mentre le domande di OfficeQA Pro V2 richiedono prove da una media di 6,7 documenti di origine, con una mediana di 5,5 e un massimo di 24. In totale, il 74,4% delle domande di OfficeQA Pro V2 richiede quattro o più fonti, rispetto al 62,4% di OfficeQA Pro e al 56,1% di OfficeQA Full.

Nel loro insieme, queste caratteristiche rendono OfficeQA Pro V2 un test di grounded reasoning end-to-end più impegnativo rispetto al benchmark originale, pur conservando lo stesso mix realistico di requisiti analitici, multimodali e di conoscenza esterna tipici dei flussi di lavoro aziendali. Per capire perché il benchmark rimanga impegnativo, è utile esaminare quanto drasticamente i documenti sottostanti e le convenzioni di rendicontazione si siano evoluti nel tempo.

Un corpus che abbraccia oltre due secoli

Abbracciando 232 anni di rendicontazione finanziaria federale degli Stati Uniti, il corpus cattura anche l'evoluzione delle strutture dei documenti, delle convenzioni contabili, della terminologia e delle istituzioni nel corso di oltre due secoli. Ad esempio, i registri della fine del 1700 e dell'inizio del 1800 registrano spesso pagamenti a singoli individui. Questi documenti includono spesso ampie pagine pieghevoli in formato orizzontale, una tipografia arcaica come l'uso della s lunga in parole come “Treaſury” o “Preſident” e convenzioni di scrittura storiche come la registrazione di “do./ditto”, che pongono nuove sfide per le moderne soluzioni di parsing.

image11.jpg
(A sinistra) Scansione di una parte di un Revenue Summary del 1793. Parole come 'Treasury', 'Merchandise' e 'supervisors' contengono la s lunga arcaica, evidenziata sopra. Le tabelle in questi documenti storici sono spesso organizzate come righe di testo prolisse. (A destra) Una parte di un'ampia tabella pieghevole in formato orizzontale del 1797, contenente cifre densamente raggruppate e indicatori di riga e colonna allineati in modo irregolare.

Verso la metà del XIX secolo, i dati venivano presentati in formati di conto a T su due pagine e in fitte tabelle rigate, mentre il periodo di rendicontazione passava dagli anni solari a quelli fiscali. L'inizio del 1900 ha poi introdotto nuovi termini finanziari come saldi di apertura e chiusura, stanziamenti pluriennali e convenzioni di surplus e deficit.

image7.jpg
Tabelle delle entrate e delle uscite (Receipts & expenditures) del 1854 (a sinistra) e del 1945 (a destra). Nonostante riportino entrambe entrate e uscite, le due tabelle sono organizzate e formattate in modo diverso, evidenziando come le convenzioni di rendicontazione siano cambiate nel tempo all'interno del corpus.

Negli anni '80, il Combined Statement si era evoluto in un report annuale con un'appendice dettagliata. I report sono diventati nativi digitali nei primi anni 2000 e hanno iniziato a incorporare grafici visivi insieme a un indice standardizzato.

image10.jpg
(A sinistra) Esempio dei tipi di grafici introdotti nei moderni documenti del Tesoro, in questo caso del 2020. (A destra) Tabella tratta da un riepilogo dei saldi dei conti registrati nel 2024.

OfficeQA Pro V2 si basa sulle complessità degli Accounts of Receipts and Expenditures, creando uno stress test particolarmente impegnativo per il ragionamento ancorato (grounded reasoning). All'interno del corpus, lo stesso concetto finanziario può cambiare nome, posizione, schema della tabella, unità, base temporale e livello di aggregazione. Oltre al parsing dei documenti e al recupero dei dati, ciò significa che gli agenti devono riconciliare le informazioni tra convenzioni di rendicontazione in continua evoluzione: una complessità tipica dei contesti aziendali.

Conclusioni e ringraziamenti

Il benchmark e il corpus analizzato sono ora disponibili pubblicamente su Hugging Face, con il codice di valutazione disponibile su GitHub. Incoraggiamo ricercatori e professionisti a valutare i propri sistemi agentici su OfficeQA Pro V2 e ne consigliamo l'uso come set di test per OfficeQA Pro. Per gli sviluppatori aziendali, OfficeQA Pro V2 può fungere da banco di prova per la creazione di agenti che devono rispondere a domande complesse su raccolte di documenti ampie ed eterogenee. I team possono utilizzarlo per confrontare modelli e architetture di agenti, identificare se i problemi hanno origine nel parsing, nel recupero, nel ragionamento o nella verifica, e misurare in che modo le modifiche ai loro sistemi influiscono su accuratezza, latenza e costi prima di applicare tali approcci ai propri dati aziendali. Infine, lasciamo ai lettori tre spunti di riflessione:

  1. Le valutazioni rappresentative sono essenziali e i dati sintetici possono aiutare a scalarle. Gli agenti di frontiera riscontrano ancora difficoltà con i flussi di lavoro aziendali pronti all'uso, rendendo fondamentale valutare i sistemi su attività che riflettono la complessità del mondo reale e verificare se i miglioramenti si generalizzano a contesti non familiari. In Databricks, combiniamo tecniche di dati sintetici con la nostra comprensione dei flussi di lavoro dei clienti per creare valutazioni rappresentative come OfficeQA Pro V2 in modo più efficiente e su scala più ampia.
  2. Un harness ottimizzato per gli agenti è fondamentale per ottenere le migliori prestazioni. Il passaggio dagli harness di base dei fornitori di modelli a Databricks Genie ha migliorato le prestazioni in media di 24,0 punti percentuali (+92% relativo) tra i modelli valutati. Questi risultati dimostrano che le scelte relative all'elaborazione dei documenti, al recupero, all'uso degli strumenti e all'orchestrazione possono influire in modo sostanziale sia sull'accuratezza che sull'efficienza dei sistemi di ragionamento ancorato.
  3. Il ragionamento ancorato ha ancora ampi margini di miglioramento. Sebbene le ottimizzazioni dell'harness abbiano prodotto miglioramenti sostanziali rispetto alle baseline pronte all'uso, anche i sistemi più solidi continuano a riscontrare difficoltà con sfide quali il parsing fedele dei documenti, la riconciliazione dei valori nel tempo e il recupero delle cifre riviste più recenti. Un progresso continuo richiederà innovazioni nell'intero stack dell'agente, dal parsing e recupero fino all'analisi e alla verifica.

Ringraziamo USAFacts per la continua collaborazione sulla suite di benchmark OfficeQA, incluso l'aiuto nell'identificare il nuovo corpus, nello sviluppare argomenti e domande analitiche rappresentative e nell'organizzare la Grounded Reasoning Cup. Ringraziamo anche il Tesoro degli Stati Uniti per aver contribuito a identificare gli U.S. Accounts of Receipts and Expenditures come base per il benchmark della competizione e per aver rilasciato il dataset come raccolta coesa per la prima volta.

Autori: Krista Opsahl-Ong, Arnav Singhvi, Josh Joseph, Jasmine Collins, Ivan Zhou, Shubham Toshniwal, Michael Bendersky, Erich Elsen, Xing Chen, Matei Zaharia

Se desideri saperne di più e iniziare a usare OfficeQA Pro V2, dai un'occhiata al benchmark su Hugging Face.

(Questo post sul blog è stato tradotto utilizzando strumenti basati sull'intelligenza artificiale) Post originale

Ricevi gli ultimi articoli nella tua casella di posta

Iscriviti al nostro blog e ricevi gli ultimi articoli direttamente nella tua casella di posta.