L'extraction structurée de graphiques dans ai_parse_document, associée à une recherche textuelle légère, améliore la recherche de graphiques et la précision des réponses des agents tout en surpassant les grands modèles d'embeddings multimodaux.
De plus en plus d'entreprises demandent aujourd'hui à des agents de travailler avec leurs documents propriétaires et de répondre à des questions sur leur contenu. Cependant, une grande partie des informations importantes se trouve dans des illustrations et des graphiques. De nombreux clients constatent que les agents ont du mal à répondre aux questions qui nécessitent de lire et de compter des valeurs dans des graphiques. Pour que les agents fonctionnent de manière fiable dans divers environnements d'entreprise, nous devons rendre les graphiques plus interprétables.
Comment rendre un graphique plus facile à comprendre pour des agents ? Nous avons effectué un test simple et rapide : nous avons demandé à différents agents, « Combien de maxima locaux figurent sur ce graphique ? »
Voici ci-dessous une comparaison entre un agent de pointe et Databricks Genie pour répondre à cette question. L'agent de pointe a reçu uniquement l'image, a passé 50 secondes à raisonner, mais a tout de même obtenu une réponse incorrecte de 17. Pendant ce temps, Databricks Genie a utilisé une extraction structurée du graphique via ai_parse_document et a obtenu la bonne réponse, à savoir 18.

| Réponse d'un agent de pointe avec uniquement l'image (incorrecte) : | Réponse de l'agent Genie avec une extraction structurée du graphique (correcte) : |
![]() | ![]() |
Nous avons constaté ces lacunes dans notre benchmark OfficeQA Pro, où les modèles ont obtenu de moins bons résultats sur les questions basées sur des graphiques et multimodales que sur les questions ne nécessitant pas de comprendre des graphiques. Nous constatons les mêmes lacunes dans les systèmes de recherche d'informations de nos clients, en particulier dans les services financiers. Un système de recherche textuel ne peut effectuer des recherches que dans l'espace textuel. Une solution courante consiste à générer une légende pour décrire le sujet du graphique ; cependant, cela peut omettre les données nécessaires pour répondre à des questions précises sur les chiffres figurant dans le graphique. Par conséquent, le système peut récupérer la mauvaise page, ou récupérer la bonne page sans disposer de suffisamment d'informations pour répondre à la question.
Dans cet article, nous montrons que l'extraction structurée à partir de graphiques améliore à la fois la recherche et la qualité des réponses pour les questions basées sur des graphiques. Nous évaluons notre approche sur deux ensembles de données : un sous-ensemble riche en graphiques de ViDoRe V3, un benchmark pour la recherche et les questions-réponses sur des documents visuellement riches, et un ensemble de données synthétiques axé sur les graphiques que nous appelons Chart-RAG. Notre approche est compétitive par rapport aux grands modèles d'embeddings multimodaux mono-vecteur et multi-vecteurs.
Nous construisons un pipeline de recherche adapté aux graphiques de bout en bout avec les fonctions IA de Databricks, un ensemble de fonctions composables optimisées grâce à des techniques de recherche de pointe (voir Figure 2). Nous avons utilisé ai_parse_document pour extraire le contenu des documents, y compris les graphiques représentés sous forme de JSON structuré, et ai_prep_search pour transformer le contenu en fragments prêts pour la recherche, indexés avec un modèle d'embeddings textuels léger de 300 millions de paramètres. Nous avons créé un index à partir des fragments à l'aide de ai_search et connecté l'index à Genie pour la recherche et la génération de réponses.
Nous avons comparé deux index, créés à l'aide d'un modèle d'embeddings textuels BGE de 300 millions de paramètres, construits à partir des mêmes PDF sources, ne différant que par la représentation des graphiques :
Exemple d'extraction de graphique :
Nous avons évalué 310 questions riches en graphiques et infographies issues du benchmark ViDoRe V3. Le benchmark évalue la recherche et la génération de réponses dans sept domaines : l'emploi, l'énergie, la pharmacie, la physique, la finance, l'informatique et les documents industriels. Pour chaque expérience, nous avons analysé et découpé en fragments l'ensemble du corpus en anglais de 16 000 pages et généré des réponses pour chaque requête, en effectuant des recherches sur l'index complet.
Bien que des questions axées sur les graphiques aient été sélectionnées, il était encore possible de répondre à beaucoup d'entre elles en utilisant le texte environnant. Pour isoler l'impact du contenu des graphiques, nous avons créé un second benchmark axé uniquement sur des questions basées sur des graphiques, créées à partir de trois rapports complexes et riches en graphiques (BIS Quarterly Review, IMF World Economic Outlook, J.P. Morgan Long-Term Capital Market Assumptions). Nous avons rédigé 114 questions basées sur le contenu visuel à partir de ces 3 documents totalisant 378 pages pour construire l'ensemble de données synthétiques Chart-RAG.
Évaluation : Nous avons attribué à chaque réponse la note Correct / Partiellement correct / Incorrect à l'aide d'un LLM juge (gemini-3-flash) par rapport à sa réponse de référence.
Recherche : Nous rapportons le Hit Rate@10 et le nDCG@10. Le Hit Rate@10 vérifie si au moins une page de référence apparaît dans les 10 premiers résultats récupérés. Les questions du benchmark ViDoRe peuvent avoir plusieurs pages de référence, chacune ayant un score de pertinence de 1 ou 2. Pour le Hit Rate@10, nous convertissons la pertinence graduée en pertinence binaire en permettant aux pages ayant l'un ou l'autre score d'être comptabilisées comme un succès. Pour le nDCG@10, nous conservons la pertinence graduée d'origine. Dans l'ensemble de données Chart-RAG, chaque requête comporte une seule page de référence.
Pour obtenir des mesures stables, nous avons exécuté chaque configuration trois fois et rapportons les résultats avec des intervalles de confiance.
Le JSON structuré des graphiques améliore à la fois la qualité des réponses et la recherche sur les deux ensembles de données. L'analyse au niveau des questions ci-dessous montre quand les réponses corrigées coïncident avec une meilleure recherche.
L'exemple suivant tiré de l'ensemble de données Chart-RAG montre comment les représentations JSON améliorent la recherche et la qualité des réponses :
| Question | Réponse avant | Réponse avec ai_parse_document enrichi en JSON de graphique |
|---|---|---|
À quel niveau maximal approximatif (en points de pourcentage) l'Oil VIX est-il parvenu vers le premier trimestre 2026 ? Fait référence au graphique suivant :
| "Je ne trouve pas d'informations spécifiques sur le niveau maximal exact de l'Oil VIX au Q1 2026 dans les résultats de recherche fournis..." | "Selon les données présentées, l'Oil VIX a atteint environ 80 points de pourcentage au Q1 2026." |
Ce gain de récupération ne se limite pas nécessairement aux questions sur un graphique. Les valeurs et étiquettes extraites des graphiques peuvent faciliter la récupération de la page elle-même, même lorsque la réponse n'apparaît pas directement sur le graphique.
Certaines questions dépendent de l'aspect visuel d'une figure plutôt que de ses seules valeurs. Pour mesurer l'avantage de restaurer le contexte visuel, nous avons fourni à l'agent, au moment de la réponse, les images correspondant aux trois segments de texte récupérés les plus pertinents avec le JSON.
Ici, la récupération reste inchangée. Les images ajoutent 4 points de pourcentage sur le jeu de données Chart-RAG, et 2,6 points de pourcentage sur le sous-ensemble ViDoRe V3.
Une question se pose : comment notre approche, qui utilise un modèle d'embedding de texte léger de 300 millions de paramètres, se compare-t-elle aux modèles d'embedding multimodaux ? Nous avons effectué une évaluation comparative par rapport à quatre alternatives : ColQwen2.5-3B, un grand modèle d'embedding multimodal multi-vectoriel qui utilise un score d'interaction tardive (late-interaction), Qwen3-VL-Embedding-2B, un grand modèle d'embedding multimodal mono-vectoriel, et les modèles mono-vectoriels plus légers Jina CLIP v2 (0,9 milliard de paramètres) et CLIP ViT-L/14 (428 millions de paramètres). Chaque modèle multimodal a généré un embedding pour chaque page. Lors de la requête, nous avons classé les pages en utilisant MaxSim pour ColQwen2.5-3B et la similarité cosinus pour les modèles mono-vectoriels, effectué la recherche sur l'ensemble du corpus, puis transmis les cinq pages ayant obtenu le meilleur score au VLM de réponse. Nous évaluons l'exactitude des réponses à l'aide de cet ensemble de cinq pages récupérées pour deux raisons. Premièrement, cela offre un juste milieu équilibré entre les profondeurs les plus performantes pour le sous-ensemble ViDoRe et les jeux de données Chart-RAG. Deuxièmement, cinq pages correspondent approximativement au contexte d'entrée moyen utilisé dans notre approche, ce qui permet une comparaison équitable. Nous continuons à présenter le nDCG@10 comme métrique de récupération standard.


Pour les modèles les plus performants, la récupération sur le jeu de données Chart-RAG est proche de la saturation en raison de la petite taille du corpus (378 pages). La comparaison la plus intéressante ici concerne donc la qualité des réponses.
Sur ViDoRe V3, le format chart-JSON avec les trois meilleures images atteint une exactitude de 75,9 %. Sur Chart-RAG, la même configuration atteint 75,1 %. Dans les deux cas, ces résultats dépassent les quatre baselines d'embeddings multimodaux, tout en ne transmettant que trois images au modèle. Cette performance provient d'une alternative environ 10 fois plus petite et plus simple que l'architecture multi-vectorielle à interaction tardive de ColQwen2.5-3B. Le prétraitement structuré des graphiques peut donc offrir une qualité de réponse compétitive avec un budget d'images plus restreint et une surcharge d'indexation et de récupération réduite.
Les graphiques constituent une forme d'information prédominante dans les documents d'entreprise. Rendre les informations des graphiques faciles à trouver et clairement interprétables est essentiel pour la précision des agents de récupération. Le format JSON structuré pour les graphiques comble l'écart dans le système RAG classique en ajoutant des valeurs précises à l'index de récupération, permettant ainsi aux agents de raisonner avec ces données. Nous démontrons que le JSON structuré pour les graphiques améliore à la fois la qualité de la récupération et la précision des réponses de l'agent. Des travaux futurs pourraient explorer plus en détail l'impact des différents formats de représentation d'extraction structurée sur la précision de la récupération et des réponses.
L'enrichissement chart-JSON pour ai_parse_document sera bientôt disponible. Ainsi, tout document analysé inclura automatiquement ses valeurs de graphique sous forme de texte structuré, sans aucune modification de l'interface de la fonction. Pour la récupération, nous vous recommandons de l'associer à ai_prep_search. Cette fonctionnalité alimentera également Genie One afin d'améliorer les réponses aux questions relatives aux graphiques sur les PDF pour les clients Databricks.
Auteurs : Amrutha Srivatsav, Ivan Zhou, Jasmine Collins, Michael Bendersky, Adyasha Maharana, Erich Elsen, Xing Chen, Matei Zaharia
(Cet article de blog a été traduit à l'aide d'outils basés sur l'intelligence artificielle) Article original
Abonnez-vous à notre blog et recevez les derniers articles directement dans votre boîte mail.