Présentation de Precision Mode dans AI Extract : atteignez une précision de pointe sur les documents longs et les schémas complexes là où les approches existantes échouent.
par Jane Zhang, Arnav Singhvi, Ivan Zhou, Archika Dogra, Matthew Ding et Nihit Desai
Chaque entreprise dispose de données précieuses piégées dans des documents complexes et non structurés. Aujourd'hui, Databricks Document Intelligence aide des milliers de clients à exploiter leurs données, transformant des milliards de pages en données structurées qui alimentent les pipelines de production, les agents et les applications. Des clients comme Panasonic, EY-Parthenon et Intercontinental Exchange (NYSE) utilisent Document Intelligence pour leurs flux de travail les plus exigeants, traitant des millions de documents chaque semaine.
En travaillant avec nos clients, nous avons constaté plusieurs problèmes d'extraction difficiles pour lesquels les solutions d'extraction de documents existantes, basées sur des règles ou sur de grands modèles de langage (LLM), s'avèrent insuffisantes :
Aujourd'hui, nous sommes ravis de présenter le Precision Mode dans notre API d'extraction de documents, ai_extract, établissant une nouvelle référence en matière de précision pour les documents et tâches d'entreprise les plus complexes.

Le Precision Mode associe nos modèles entraînés sur mesure pour l'extraction de documents à un harnais agentique afin de fournir une extraction fiable et précise sur les documents longs, les sorties volumineuses et les schémas nécessitant un raisonnement complexe. Sur l'ensemble des benchmarks couvrant environ 9 000 documents complexes, le Precision Mode atteint une qualité de pointe, surpassant largement les derniers modèles de pointe (frontier models) en matière de précision d'extraction.
“Chez Intercontinental Exchange, nous traitons chaque mois des millions de documents financiers complexes et très variables. Document Intelligence nous aide à transformer cette complexité en intelligence de marché structurée, nous permettant d'agir plus rapidement, d'apporter une plus grande valeur à nos clients et de débloquer des flux de travail agentiques qui accélèrent l'analyse et la prise de décision à grande échelle.”—Anand Pradhan, CTO et responsable de l'IA, Mortgage Data chez Intercontinental Exchange (NYSE)
Pour repousser les limites de la précision sur les tâches d'extraction les plus difficiles, nos équipes de recherche et d'ingénierie ont abordé la qualité de l'extraction de documents sous deux angles : la personnalisation du modèle lui-même et la construction d'un harnais d'agent efficace autour du modèle.
Pour valider le Precision Mode, nous avons conçu nos benchmarks d'évaluation autour de charges de travail qui poussent les approches existantes dans leurs retranchements.
Concrétement, nous avons évalué le Precision Mode sur environ 9 000 documents couvrant les trois défis d'extraction qu'il a été conçu pour résoudre. L'évaluation comprend des documents allant jusqu'à 2 000 pages, des factures comportant des milliers de lignes, des tableaux et graphiques denses de plusieurs pages, des schémas contenant plus de 300 champs profondément imbriqués, et des tâches nécessitant un raisonnement complexe pour croiser les informations au sein d'un document.
Les documents proviennent de deux ensembles de benchmarks :
Ensemble, ces jeux de données couvrent des documents tels que des rapports financiers 10-K, des connaissements, des manuels techniques, des documents financiers, des notes cliniques, des demandes de brevets et de financements gouvernementaux, et bien plus encore.
Un point de départ naturel pour l'extraction de documents est un appel unique à un modèle de pointe : transmettre le document et le schéma, et demander au modèle de renvoyer la sortie structurée. Mais sur les charges de travail denses et complexes que nous évaluons, cette approche montre rapidement ses limites. Les documents longs peuvent dépasser les limites de contexte du modèle, ce qui entraîne des résultats inexacts et incomplets.
Nous avons donc effectué des benchmarks par rapport à une baseline plus solide et plus réaliste : le chunk-and-merge (découpage et fusion). Nous divisons chaque document en fragments plus petits (chunks), effectuons l'extraction de manière indépendante pour chacun d'eux, puis fusionnons les résultats dans une sortie finale — la même méthode que celle utilisée par les ingénieurs lorsqu'un seul appel de modèle ne suffit pas.
Nous avons testé l'approche chunk-and-merge en utilisant les principaux modèles GPT, Claude et Gemini avec leurs paramètres d'API par défaut. Ensuite, nous avons comparé chacun d'eux au Precision Mode en termes de précision d'extraction. ¹

Sur l'ensemble de nos benchmarks, le Precision Mode atteint une précision de 94,7 %, surpassant de sept points la baseline de chunk-and-merge du modèle de pointe le plus performant, GPT-5.6 Sol.
En particulier, sur les charges de travail difficiles liées aux documents longs, nous avons constaté que les modèles de pointe rencontraient de nombreux modes de défaillance opérationnelle, notamment des expirations de délai (timeouts) sur les fragments, des sorties tronquées et des fusions finales incomplètes non conformes au schéma demandé. En revanche, l'approche agentique du Precision Mode est robuste face à ces modes de défaillance, et nos modèles d'extraction entraînés sur mesure garantissent des extractions efficaces et précises.
Pour vos tâches d'extraction de documents les plus complexes, le Precision Mode d'AI Extract est désormais disponible. Définissez le mode sur precision lors de l'appel de la fonction ai_extract, ou activez le bouton du Precision Mode dans l'interface utilisateur d'extraction d'informations (Information Extraction UI) sur la page Agents :

Essayer le Precision Mode d'AI Extract
Notes de bas de page :
¹ Nous définissons l'exactitude comme la fraction d'objets extraits qui correspondent à l'objet de la vérité terrain. Le calcul du score dépend du type. Les primitives (booléens, flottants, entiers, énumérations) utilisent la correspondance directe. Les chaînes de caractères tentent d'abord une correspondance directe, puis une correspondance floue, et enfin un juge LLM. Les tableaux sont évalués en trouvant l'association la plus proche entre les éléments prédits et attendus, puis en calculant la moyenne des paires. Les objets sont évalués par champ selon leur type, puis la moyenne est calculée sur l'ensemble des champs.
(Cet article de blog a été traduit à l'aide d'outils basés sur l'intelligence artificielle) Article original
Abonnez-vous à notre blog et recevez les derniers articles directement dans votre boîte mail.