Revenir au contenu principal
Recherche en IA

Améliorer la récupération des agents grâce à l'extraction structurée de graphiques

L'extraction structurée de graphiques dans ai_parse_document, associée à une recherche textuelle légère, améliore la recherche de graphiques et la précision des réponses des agents tout en surpassant les grands modèles d'embeddings multimodaux.

par L'équipe de recherche en IA de Databricks

La motivation

De plus en plus d'entreprises demandent aujourd'hui à des agents de travailler avec leurs documents propriétaires et de répondre à des questions sur leur contenu. Cependant, une grande partie des informations importantes se trouve dans des illustrations et des graphiques. De nombreux clients constatent que les agents ont du mal à répondre aux questions qui nécessitent de lire et de compter des valeurs dans des graphiques. Pour que les agents fonctionnent de manière fiable dans divers environnements d'entreprise, nous devons rendre les graphiques plus interprétables.

Comment rendre un graphique plus facile à comprendre pour des agents ? Nous avons effectué un test simple et rapide : nous avons demandé à différents agents, « Combien de maxima locaux figurent sur ce graphique ? »

Voici ci-dessous une comparaison entre un agent de pointe et Databricks Genie pour répondre à cette question. L'agent de pointe a reçu uniquement l'image, a passé 50 secondes à raisonner, mais a tout de même obtenu une réponse incorrecte de 17. Pendant ce temps, Databricks Genie a utilisé une extraction structurée du graphique via ai_parse_document et a obtenu la bonne réponse, à savoir 18.

image12.png

Réponse d'un agent de pointe avec uniquement l'image (incorrecte) :Réponse de l'agent Genie avec une extraction structurée du graphique (correcte) :
image4.pngimage10.png

Nous avons constaté ces lacunes dans notre benchmark OfficeQA Pro, où les modèles ont obtenu de moins bons résultats sur les questions basées sur des graphiques et multimodales que sur les questions ne nécessitant pas de comprendre des graphiques. Nous constatons les mêmes lacunes dans les systèmes de recherche d'informations de nos clients, en particulier dans les services financiers. Un système de recherche textuel ne peut effectuer des recherches que dans l'espace textuel. Une solution courante consiste à générer une légende pour décrire le sujet du graphique ; cependant, cela peut omettre les données nécessaires pour répondre à des questions précises sur les chiffres figurant dans le graphique. Par conséquent, le système peut récupérer la mauvaise page, ou récupérer la bonne page sans disposer de suffisamment d'informations pour répondre à la question.

Dans cet article, nous montrons que l'extraction structurée à partir de graphiques améliore à la fois la recherche et la qualité des réponses pour les questions basées sur des graphiques. Nous évaluons notre approche sur deux ensembles de données : un sous-ensemble riche en graphiques de ViDoRe V3, un benchmark pour la recherche et les questions-réponses sur des documents visuellement riches, et un ensemble de données synthétiques axé sur les graphiques que nous appelons Chart-RAG. Notre approche est compétitive par rapport aux grands modèles d'embeddings multimodaux mono-vecteur et multi-vecteurs.

image9.png
Figure 1 : Précision des réponses pour l'analyse basée uniquement sur la description, ai_parse_document enrichi avec les trois premières images récupérées, et la référence d'embedding multimodal la plus solide lorsque les cinq premières pages récupérées sont utilisées pour répondre. Les résultats sont la moyenne de trois exécutions.

Nous construisons un pipeline de recherche adapté aux graphiques de bout en bout avec les fonctions IA de Databricks, un ensemble de fonctions composables optimisées grâce à des techniques de recherche de pointe (voir Figure 2). Nous avons utilisé ai_parse_document pour extraire le contenu des documents, y compris les graphiques représentés sous forme de JSON structuré, et ai_prep_search pour transformer le contenu en fragments prêts pour la recherche, indexés avec un modèle d'embeddings textuels léger de 300 millions de paramètres. Nous avons créé un index à partir des fragments à l'aide de ai_search et connecté l'index à Genie pour la recherche et la génération de réponses.

image5.png
Figure 2 : Pipeline d'extraction et de recherche de graphiques implémenté à l'aide des fonctions IA de Databricks.

Méthodologie d'évaluation

Nous avons comparé deux index, créés à l'aide d'un modèle d'embeddings textuels BGE de 300 millions de paramètres, construits à partir des mêmes PDF sources, ne différant que par la représentation des graphiques :

  • Description uniquement (baseline) : illustrations représentées uniquement par des légendes
  • Enrichi en JSON : graphiques représentés par des légendes et du JSON structuré, intégrés directement dans le fragment de l'illustration.

Exemple d'extraction de graphique :

image3.png
Graphique à barres groupées comparant cinq scénarios de prévisions économiques pour la croissance du GDP et l'inflation globale en 2026 et 2027.

Nous avons évalué 310 questions riches en graphiques et infographies issues du benchmark ViDoRe V3. Le benchmark évalue la recherche et la génération de réponses dans sept domaines : l'emploi, l'énergie, la pharmacie, la physique, la finance, l'informatique et les documents industriels. Pour chaque expérience, nous avons analysé et découpé en fragments l'ensemble du corpus en anglais de 16 000 pages et généré des réponses pour chaque requête, en effectuant des recherches sur l'index complet.

Bien que des questions axées sur les graphiques aient été sélectionnées, il était encore possible de répondre à beaucoup d'entre elles en utilisant le texte environnant. Pour isoler l'impact du contenu des graphiques, nous avons créé un second benchmark axé uniquement sur des questions basées sur des graphiques, créées à partir de trois rapports complexes et riches en graphiques (BIS Quarterly Review, IMF World Economic Outlook, J.P. Morgan Long-Term Capital Market Assumptions). Nous avons rédigé 114 questions basées sur le contenu visuel à partir de ces 3 documents totalisant 378 pages pour construire l'ensemble de données synthétiques Chart-RAG.

Évaluation : Nous avons attribué à chaque réponse la note Correct / Partiellement correct / Incorrect à l'aide d'un LLM juge (gemini-3-flash) par rapport à sa réponse de référence.

Recherche : Nous rapportons le Hit Rate@10 et le nDCG@10. Le Hit Rate@10 vérifie si au moins une page de référence apparaît dans les 10 premiers résultats récupérés. Les questions du benchmark ViDoRe peuvent avoir plusieurs pages de référence, chacune ayant un score de pertinence de 1 ou 2. Pour le Hit Rate@10, nous convertissons la pertinence graduée en pertinence binaire en permettant aux pages ayant l'un ou l'autre score d'être comptabilisées comme un succès. Pour le nDCG@10, nous conservons la pertinence graduée d'origine. Dans l'ensemble de données Chart-RAG, chaque requête comporte une seule page de référence.

Pour obtenir des mesures stables, nous avons exécuté chaque configuration trois fois et rapportons les résultats avec des intervalles de confiance.

Les données de graphiques structurées améliorent la recherche et la génération de réponses

image6.png
Figure 3 : Exactitude des réponses, Hit@10 et nDCG@10 pour la recherche basée uniquement sur la description et enrichie en JSON de graphique sur le sous-ensemble ViDoRe V3 et les ensembles de données synthétiques Chart-RAG. Les résultats sont la moyenne de trois exécutions.

Le JSON structuré des graphiques améliore à la fois la qualité des réponses et la recherche sur les deux ensembles de données. L'analyse au niveau des questions ci-dessous montre quand les réponses corrigées coïncident avec une meilleure recherche.

image7.png
Figure 4 : L'ajout du JSON de graphique a corrigé des réponses qui étaient auparavant incorrectes. Parmi ces réponses corrigées, l'illustration montre à quelle fréquence le JSON a également amélioré la recherche (Hit@10) ou le classement (nDCG@10). Les résultats sont la moyenne de trois exécutions.

L'exemple suivant tiré de l'ensemble de données Chart-RAG montre comment les représentations JSON améliorent la recherche et la qualité des réponses :

QuestionRéponse avantRéponse avec ai_parse_document enrichi en JSON de graphique

À quel niveau maximal approximatif (en points de pourcentage) l'Oil VIX est-il parvenu vers le premier trimestre 2026 ?

Fait référence au graphique suivant :

image2.png

"Je ne trouve pas d'informations spécifiques sur le niveau maximal exact de l'Oil VIX au Q1 2026 dans les résultats de recherche fournis...""Selon les données présentées, l'Oil VIX a atteint environ 80 points de pourcentage au Q1 2026."

Ce gain de récupération ne se limite pas nécessairement aux questions sur un graphique. Les valeurs et étiquettes extraites des graphiques peuvent faciliter la récupération de la page elle-même, même lorsque la réponse n'apparaît pas directement sur le graphique.

Les images améliorent encore la qualité des réponses

Certaines questions dépendent de l'aspect visuel d'une figure plutôt que de ses seules valeurs. Pour mesurer l'avantage de restaurer le contexte visuel, nous avons fourni à l'agent, au moment de la réponse, les images correspondant aux trois segments de texte récupérés les plus pertinents avec le JSON.

image8.png
Figure 5 : Taux de réponses correctes avec le JSON de graphique seul et avec l'ajout des trois meilleures images récupérées au moment de la réponse. Les résultats représentent la moyenne de trois exécutions.

Ici, la récupération reste inchangée. Les images ajoutent 4 points de pourcentage sur le jeu de données Chart-RAG, et 2,6 points de pourcentage sur le sous-ensemble ViDoRe V3.

Les représentations JSON sont compétitives par rapport aux embeddings multimodaux

Une question se pose : comment notre approche, qui utilise un modèle d'embedding de texte léger de 300 millions de paramètres, se compare-t-elle aux modèles d'embedding multimodaux ? Nous avons effectué une évaluation comparative par rapport à quatre alternatives : ColQwen2.5-3B, un grand modèle d'embedding multimodal multi-vectoriel qui utilise un score d'interaction tardive (late-interaction), Qwen3-VL-Embedding-2B, un grand modèle d'embedding multimodal mono-vectoriel, et les modèles mono-vectoriels plus légers Jina CLIP v2 (0,9 milliard de paramètres) et CLIP ViT-L/14 (428 millions de paramètres). Chaque modèle multimodal a généré un embedding pour chaque page. Lors de la requête, nous avons classé les pages en utilisant MaxSim pour ColQwen2.5-3B et la similarité cosinus pour les modèles mono-vectoriels, effectué la recherche sur l'ensemble du corpus, puis transmis les cinq pages ayant obtenu le meilleur score au VLM de réponse. Nous évaluons l'exactitude des réponses à l'aide de cet ensemble de cinq pages récupérées pour deux raisons. Premièrement, cela offre un juste milieu équilibré entre les profondeurs les plus performantes pour le sous-ensemble ViDoRe et les jeux de données Chart-RAG. Deuxièmement, cinq pages correspondent approximativement au contexte d'entrée moyen utilisé dans notre approche, ce qui permet une comparaison équitable. Nous continuons à présenter le nDCG@10 comme métrique de récupération standard.

ViDoRe V3 :

image11.png

Chart-RAG :

image13.png

Pour les modèles les plus performants, la récupération sur le jeu de données Chart-RAG est proche de la saturation en raison de la petite taille du corpus (378 pages). La comparaison la plus intéressante ici concerne donc la qualité des réponses.

Sur ViDoRe V3, le format chart-JSON avec les trois meilleures images atteint une exactitude de 75,9 %. Sur Chart-RAG, la même configuration atteint 75,1 %. Dans les deux cas, ces résultats dépassent les quatre baselines d'embeddings multimodaux, tout en ne transmettant que trois images au modèle. Cette performance provient d'une alternative environ 10 fois plus petite et plus simple que l'architecture multi-vectorielle à interaction tardive de ColQwen2.5-3B. Le prétraitement structuré des graphiques peut donc offrir une qualité de réponse compétitive avec un budget d'images plus restreint et une surcharge d'indexation et de récupération réduite.

Conclusion

Les graphiques constituent une forme d'information prédominante dans les documents d'entreprise. Rendre les informations des graphiques faciles à trouver et clairement interprétables est essentiel pour la précision des agents de récupération. Le format JSON structuré pour les graphiques comble l'écart dans le système RAG classique en ajoutant des valeurs précises à l'index de récupération, permettant ainsi aux agents de raisonner avec ces données. Nous démontrons que le JSON structuré pour les graphiques améliore à la fois la qualité de la récupération et la précision des réponses de l'agent. Des travaux futurs pourraient explorer plus en détail l'impact des différents formats de représentation d'extraction structurée sur la précision de la récupération et des réponses.

L'enrichissement chart-JSON pour ai_parse_document sera bientôt disponible. Ainsi, tout document analysé inclura automatiquement ses valeurs de graphique sous forme de texte structuré, sans aucune modification de l'interface de la fonction. Pour la récupération, nous vous recommandons de l'associer à ai_prep_search. Cette fonctionnalité alimentera également Genie One afin d'améliorer les réponses aux questions relatives aux graphiques sur les PDF pour les clients Databricks.

Auteurs : Amrutha Srivatsav, Ivan Zhou, Jasmine Collins, Michael Bendersky, Adyasha Maharana, Erich Elsen, Xing Chen, Matei Zaharia

Essayez bientôt dans ai_parse_document avec ai_prep_search pour créer des pipelines de récupération et de réponse prenant en compte les graphiques

(Cet article de blog a été traduit à l'aide d'outils basés sur l'intelligence artificielle) Article original

Recevez les derniers articles dans votre boîte mail

Abonnez-vous à notre blog et recevez les derniers articles directement dans votre boîte mail.