Die strukturierte Diagrammextraktion in ai_parse_document, kombiniert mit leichtgewichtigem Text-Retrieval, verbessert das Diagramm-Retrieval sowie die Genauigkeit von Agenten-Antworten und übertrifft große multimodale Embedding-Modelle.
Immer mehr Unternehmen lassen ihre Agenten mit proprietären Dokumenten arbeiten, um Fragen zu deren Inhalten zu beantworten. Viele wichtige Informationen stecken jedoch in Abbildungen und Diagrammen. Viele Kunden stellen fest, dass Agenten Schwierigkeiten haben, Fragen zu beantworten, bei denen Werte in Diagrammen abgelesen oder gezählt werden müssen. Damit Agenten in verschiedenen Unternehmensumgebungen zuverlässig arbeiten können, müssen wir Diagramme besser interpretierbar machen.
Wie können wir Diagramme für Agenten verständlicher machen? Wir haben einen einfachen, schnellen Test durchgeführt und verschiedene Agenten gefragt: „Wie viele lokale Maxima gibt es in diesem Diagramm?“
Unten sehen Sie einen Vergleich zwischen einem führenden Agenten (Frontier-Modell) und Databricks Genie bei der Beantwortung dieser Frage. Dem anderen Agenten wurde nur das Bild übergeben. Er verbrachte 50 Sekunden mit der logischen Analyse, lieferte aber dennoch die falsche Antwort 17. Databricks Genie hingegen nutzte eine strukturierte Extraktion des Diagramms über ai_parse_document und erhielt die richtige Antwort 18.

| Antwort eines führenden Agenten nur mit dem Bild (falsch): | Antwort des Genie-Agenten mit einer strukturierten Extraktion des Diagramms (richtig): |
![]() | ![]() |
Diese Schwachstellen sind uns in unserem OfficeQA Pro-Benchmark aufgefallen, bei dem Modelle bei diagrammbasierten und multimodalen Fragen schlechter abschnitten als bei Fragen, die kein Diagrammverständnis erforderten. Dieselben Lücken sehen wir in den Information-Retrieval-Systemen unserer Kunden, insbesondere im Finanzdienstleistungsbereich. Ein textbasiertes Retrieval-System kann nur den Textraum durchsuchen. Eine gängige Lösung besteht darin, eine Bildunterschrift zu generieren, um den Inhalt eines Diagramms zu beschreiben. Dabei fehlen jedoch möglicherweise die Daten, die für detaillierte Fragen zu den Zahlen im Diagramm benötigt werden. Infolgedessen ruft das System eventuell die falsche Seite auf oder die richtige Seite, verfügt aber nicht über genügend Informationen, um die Frage zu beantworten.
In diesem Beitrag zeigen wir, dass die strukturierte Extraktion aus Diagrammen sowohl die Retrieval- als auch die Antwortqualität bei diagrammbasierten Fragen verbessert. Wir evaluieren unseren Ansatz auf zwei Datensätzen: einer diagrammlastigen Teilmenge von ViDoRe V3, einem Benchmark für Retrieval und Question Answering über visuell reichhaltige Dokumente, und einem synthetischen, diagrammfokussierten Datensatz, den wir Chart-RAG nennen. Unser Ansatz schneidet im Vergleich zu großen Single-Vector- und Multi-Vector-Multimodal-Embedding-Modellen konkurrenzfähig ab.
Wir erstellen eine diagrammbewusste Retrieval-Pipeline End-to-End mit den AI-Funktionen von Databricks, einer Reihe von kombinierbaren Funktionen, die mit modernsten Forschungsmethoden optimiert wurden (siehe Abbildung 2). Wir haben ai_parse_document verwendet, um Dokumenteninhalte zu extrahieren, einschließlich Diagrammen, die als strukturiertes JSON dargestellt werden, und ai_prep_search, um die Inhalte in abrufbereite Chunks umzuwandeln, die mit einem leichtgewichtigen Text-Embedding-Modell mit 300 Millionen Parametern indiziert wurden. Wir haben mit ai_search einen Index aus den Chunks erstellt und diesen Index mit Genie für das Retrieval und die Beantwortung verbunden.
Wir haben zwei Indizes verglichen, die mit einem BGE-Text-Embedding-Modell mit 300 Millionen Parametern aus denselben Quell-PDFs erstellt wurden und sich nur in der Darstellung der Diagramme unterschieden:
Ein Beispiel für eine Diagrammextraktion:
Wir haben 310 diagramm- und infografiklastige Fragen aus dem ViDoRe V3-Benchmark evaluiert. Der Benchmark bewertet das Retrieval und die Beantwortung in sieben Bereichen: Beschäftigung, Energie, Pharmazie, Physik, Finanzen, Informatik und Industriedokumente. Für jedes Experiment haben wir den gesamten 16.000-seitigen englischen Korpus geparst und in Chunks aufgeteilt und Antworten auf jede Abfrage generiert, indem wir den gesamten Index durchsucht haben.
Obwohl diagrammfokussierte Fragen ausgewählt wurden, konnten viele davon immer noch mithilfe des umgebenden Textes beantwortet werden. Um den Einfluss des Diagramminhalts zu isolieren, haben wir einen zweiten Benchmark erstellt, der sich ausschließlich auf diagrammbasierte Fragen konzentriert, die aus drei komplexen, diagrammlastigen Berichten erstellt wurden (BIS Quarterly Review, IMF World Economic Outlook, J.P. Morgan Long-Term Capital Market Assumptions). Wir haben 114 visuell fundierte Fragen aus diesen 3 Dokumenten mit insgesamt 378 Seiten verfasst, um den synthetischen Chart-RAG-Datensatz zu erstellen.
Bewertung: Wir haben jede Antwort mit einem LLM-Judge (gemini-3-flash) im Vergleich zur Referenzantwort als Richtig / Teilweise richtig / Falsch eingestuft.
Retrieval: Wir weisen die Hit Rate@10 und nDCG@10 aus. Die Hit Rate@10 prüft, ob mindestens eine Referenzseite unter den Top 10 der abgerufenen Ergebnisse erscheint. Die Fragen aus dem ViDoRe-Benchmark können mehrere Referenzseiten haben, jeweils mit einem Relevanzwert von 1 oder 2. Für die Hit Rate@10 konvertieren wir die abgestufte Relevanz in eine binäre Relevanz, indem wir Seiten mit beiden Werten als Treffer zählen lassen. Für nDCG@10 behalten wir die ursprüngliche abgestufte Relevanz bei. Im Chart-RAG-Datensatz hat jede Abfrage eine Referenzseite.
Um eine stabile Messung zu erreichen, wir haben jede Konfiguration dreimal ausgeführt und geben die Ergebnisse mit Konfidenzintervallen an.
Strukturiertes Diagramm-JSON verbessert sowohl die Antwortqualität als auch das Retrieval über beide Datensätze hinweg. Die folgende Analyse auf Fragenebene zeigt, wann korrigierte Antworten mit einem besseren Retrieval übereinstimmen.
Das folgende Beispiel aus dem Chart-RAG-Datensatz zeigt, wie JSON-Darstellungen das Retrieval und die Antwortqualität verbessern:
| Frage | Antwort vorher | Antwort mit Diagramm-JSON-angereichertem ai_parse_document |
|---|---|---|
Welchen Höchstwert (Prozentpunkte) erreichte der Oil VIX in etwa gegen Q1 2026? Bezieht sich auf das folgende Diagramm:
| "Ich kann in den bereitgestellten Suchergebnissen keine spezifischen Informationen über den genauen Höchststand des Oil VIX im Q1 2026 finden..." | "Den dargestellten Daten zufolge erreichte der Oil VIX im Q1 2026 etwa 80 Prozentpunkte." |
Dieser Retrieval-Gewinn beschränkt sich möglicherweise nicht nur auf Fragen über ein Diagramm. Extrahierte Diagrammwerte und -beschriftungen können das Auffinden der Seite selbst erleichtern, selbst wenn die Antwort nicht direkt im Diagramm erscheint.
Einige Fragen hängen davon ab, wie eine Abbildung aussieht, und nicht nur von ihren Werten. Um den Nutzen der Wiederherstellung des visuellen Kontextes zu messen, haben wir dem Agenten zum Zeitpunkt der Beantwortung Bilder zur Verfügung gestellt, die den drei am besten bewerteten abgerufenen Textabschnitten mit dem JSON entsprechen.
Hier bleibt das Retrieval unverändert. Bilder bringen ein Plus von 4 Prozentpunkten auf dem Chart-RAG-Datensatz und 2,6 Prozentpunkten auf dem ViDoRe V3-Subset.
Eine Frage ist, wie unser Ansatz, der ein leichtgewichtiges Text-Embedding-Modell mit 300 Millionen Parametern verwendet, im Vergleich zu multimodalen Embedding-Modellen abschneidet. Wir haben einen Benchmark-Vergleich mit vier Alternativen durchgeführt: ColQwen2.5-3B, einem großen multimodalen Multi-Vektor-Embedding-Modell, das Late-Interaction-Scoring verwendet, Qwen3-VL-Embedding-2B, einem großen multimodalen Einzel-Vektor-Embedding-Modell, und den leichteren Einzel-Vektor-Modellen Jina CLIP v2 (0,9 Mrd. Parameter) und CLIP ViT-L/14 (428 Mio. Parameter). Jedes multimodale Modell hat für jede Seite Embeddings erstellt. Bei der Abfrage haben wir die Seiten mithilfe von MaxSim für ColQwen2.5-3B und der Kosinus-Ähnlichkeit für die Einzel-Vektor-Modelle bewertet, den gesamten Korpus durchsucht und die fünf am besten bewerteten Seiten an das antwortende VLM übergeben. Wir berichten über die Richtigkeit der Antworten unter Verwendung von fünf abgerufenen Seiten aus zwei Gründen. Erstens bietet dies einen ausgewogenen Mittelweg zwischen den leistungsstärksten Tiefen für das ViDoRe-Subset und die Chart-RAG-Datensätze. Zweitens entsprechen fünf Seiten in etwa dem in unserem Ansatz verwendeten durchschnittlichen Eingabekontext, was einen fairen Vergleich ermöglicht. Wir weisen nDCG@10 weiterhin als Standard-Retrieval-Metrik aus.


Für die stärksten Modelle ist das Retrieval auf dem Chart-RAG-Datensatz aufgrund der geringen Korpusgröße von 378 Seiten nahezu gesättigt. Der interessantere Vergleich ist hier daher die Antwortqualität.
Auf ViDoRe V3 erreicht Chart-JSON mit den drei besten Bildern eine Richtigkeit von 75,9 %. Auf Chart-RAG erreicht dasselbe Setup 75,1 %. Beide Fälle übertreffen die vier multimodalen Embedding-Baselines, obwohl nur drei Bilder an das Modell übergeben werden. Diese Leistung resultiert aus einer etwa 10-mal kleineren und einfacheren Alternative zur Multi-Vektor- und Late-Interaction-Architektur von ColQwen2.5-3B. Eine strukturierte Diagramm-Vorverarbeitung kann daher eine wettbewerbsfähige Antwortqualität bei geringerem Bildbudget und weniger Indexierungs- und Retrieval-Overhead bieten.
Diagramme sind eine dominierende Form der Informationsdarstellung in Unternehmensdokumenten. Die Informationen in Diagrammen leicht auffindbar und klar interpretierbar zu machen, ist entscheidend für die Genauigkeit von Retrieval-Agenten. Strukturiertes Diagramm-JSON schließt die Lücke im klassischen RAG-System, indem es dem Retrieval-Index präzise Werte hinzufügt, mit denen Agenten logische Schlüsse ziehen können. Wir zeigen, dass strukturiertes Diagramm-JSON sowohl die Retrieval-Qualität als auch die Antwortgenauigkeit der Agenten verbessert. Zukünftige Arbeiten könnten weiter untersuchen, wie sich verschiedene strukturierte Extraktionsdarstellungsformate auf das Retrieval und die Antwortgenauigkeit auswirken.
Die Chart-JSON-Erweiterung für ai_parse_document wird in Kürze verfügbar sein, sodass jedes analysierte Dokument automatisch seine Diagrammwerte als strukturierten Text enthält, ohne dass Änderungen an der Schnittstelle der Funktion erforderlich sind. Für das Retrieval empfehlen wir die Kombination mit ai_prep_search. Diese Funktion wird auch Genie One unterstützen, um Antworten auf diagrammbezogene Fragen in PDFs für Databricks-Kunden zu verbessern.
Autoren: Amrutha Srivatsav, Ivan Zhou, Jasmine Collins, Michael Bendersky, Adyasha Maharana, Erich Elsen, Xing Chen, Matei Zaharia
(Dieser Blogbeitrag wurde mit KI-gestützten Tools übersetzt.) Originalbeitrag
Abonnieren Sie unseren Blog und erhalten Sie die neuesten Beiträge direkt in Ihren Posteingang.