Direkt zum Hauptinhalt
Data Science und ML

Databricks Document Intelligence: Neue Maßstäbe bei der Extraktion komplexer Dokumente

Wir stellen den Precision Mode in AI Extract vor: Erreichen Sie Spitzengenauigkeit bei langen Dokumenten und komplexen Schemata, bei denen bestehende Ansätze an ihre Grenzen stoßen.

von Jane Zhang, Arnav Singhvi, Ivan Zhou, Archika Dogra, Matthew Ding und Nihit Desai

  • Die Extraktion von Feldern aus komplexen Dokumenten scheitert häufig in drei Anwendungsfällen: lange Dokumente, die einen seitenübergreifenden Abgleich erfordern, umfangreiche Ausgaben wie Tausende von Rechnungsposten und komplexe Schemata, deren Felder logisches Denken und Berechnungen erfordern.
  • Der Precision Mode kombiniert maßgeschneiderte, feinabgestimmte Extraktionsmodelle mit einer agentenbasierten Steuerung, die schrittweise logische Schlüsse zieht, Subagenten für die parallele Extraktion startet und die Ergebnisse in einer einzigen Ausgabe zusammenführt. So bleibt das System auch bei wachsenden Dokumenten und Schemata robust.
  • In sechs Benchmarks für komplexe Dokumente übertrifft der Precision Mode das nächstbeste Frontier-Modell bei der Genauigkeit um sieben Punkte.

Jedes Unternehmen verfügt über wertvolle Daten, die in unübersichtlichen, unstrukturierten Dokumenten gefangen sind. Heute hilft Databricks Document Intelligence Tausenden von Kunden, ihre Daten nutzbar zu machen, indem es Milliarden von Seiten in strukturierte Daten umwandelt, die produktive Pipelines, Agents und Anwendungen antreiben. Kunden wie Panasonic, EY-Parthenon und Intercontinental Exchange (NYSE) nutzen Document Intelligence für ihre anspruchsvollsten Workflows und verarbeiten wöchentlich Millionen von Dokumenten.

Bei der Arbeit mit Kunden haben wir einige schwierige Extraktionsprobleme festgestellt, bei denen bestehende Lösungen auf Basis von Large Language Models (LLM) oder regelbasierten Dokumentenextraktionen an ihre Grenzen stoßen:

  • Lange Dokumente. Ein Mietvertrag, dessen Verlängerungsbedingungen auf Seite 1 von einer Klausel auf Seite 80 abhängen, oder eine Vereinbarung, deren Absatz auf Seite 150 einen Begriff von Seite 3 neu definiert. Bestehende Lösungen scheitern daran, diese Querverweise aufzulösen.
  • Große, verschachtelte Ausgaben. Ein mehrseitiger Frachtbrief mit Hunderten von SKUs oder eine Rechnung mit Tausenden von Einzelposten. Bestehende Lösungen verwerfen oder kürzen Felder, wenn die Ausgaben wachsen.
  • Komplexe Schemata und logische Schlussfolgerungen. Eine Risikoklassifizierung, die drei Finanzberichte zusammenfasst, oder ein Vertragswert, der aufgelistete Rabatte auf jeden erfassten Preis anwendet. Bestehende Lösungen scheitern daran, die richtige Logik konsistent auf alle Dokumente anzuwenden.

Heute freuen wir uns, den Precision Mode in unserer API zur Dokumentenextraktion, ai_extract, vorzustellen, der neue Maßstäbe für die Genauigkeit bei den komplexesten Dokumenten und Aufgaben in Unternehmen setzt.

image3.png

Der Precision Mode kombiniert unsere speziell trainierten Modelle für die Dokumentenextraktion mit einem Agenten-Harness, um eine zuverlässige und genaue Extraktion bei langen Dokumenten, großen Ausgaben und komplexen Schemata mit hohem Reasoning-Anteil zu liefern. In Benchmarks mit rund 9.000 komplexen Dokumenten erreicht der Precision Mode eine State-of-the-Art-Qualität und übertrifft die neuesten Frontier-Modelle bei der Extraktionsgenauigkeit deutlich.

„Bei Intercontinental Exchange verarbeiten wir jeden Monat Millionen komplexer, hochgradig variabler Finanzdokumente. Document Intelligence hilft uns, diese Komplexität in strukturierte Market Intelligence umzuwandeln. So können wir schneller agieren, unseren Kunden einen größeren Mehrwert bieten und agentenbasierte Workflows freisetzen, die Analysen und Entscheidungsfindungen in großem Maßstab beschleunigen.“—Anand Pradhan, CTO und Head of AI, Mortgage Data bei Intercontinental Exchange (NYSE)

Ein neuer Ansatz für die komplexe Dokumentenextraktion

Um die Genauigkeit bei den schwierigsten Extraktionsaufgaben zu maximieren, haben unsere Forschungs- und Entwicklungsteams die Qualität der Dokumentenextraktion auf zwei Ebenen angegangen: die Anpassung des Modells selbst und die Entwicklung eines effektiven Agenten-Harness um das Modell herum.

  • Wir haben maßgeschneiderte, effiziente Modelle für die Dokumentenextraktion trainiert. Basierend auf Benchmarks, die an schwierigen Kunden-Workflows ausgerichtet sind, hat unser Forschungsteam maßgeschneiderte Modelle trainiert, um strukturierte Informationen in komplexen Dokumenten zu finden, logisch zu verknüpfen und zu extrahieren. Anstatt uns auf immer größere Allzweckmodelle zu verlassen, haben wir uns auf die Aufgabe optimiert, die wir lösen wollen: die präzise strukturierte Extraktion.
  • Wir haben ein Extraktions-Harness entwickelt, das Fehlerquellen von Modellen überwindet. Selbst ein starkes Modell kann an seine Grenzen stoßen, wenn es logische Schlüsse über Hunderte von Seiten hinweg ziehen oder Tausende von Feldern auf einmal generieren muss. Unser Team hat ein Agenten-Harness entwickelt, inspiriert von Databricks MemEx, das große Extraktionsaufträge semantisch zerlegt, kleinere Aufgaben parallel ausführt, Zwischenergebnisse speichert und diese zu einer finalen strukturierten Ausgabe zusammenführt.
image7.png
Verwendung eines Agenten-Harness zur Verwaltung der Extraktion langer Dokumente

Evaluierungsmethodik

Benchmark-Design und Zusammensetzung des Datensatzes

Um den Precision Mode zu validieren, haben wir unsere Evaluierungs-Benchmarks auf Workflows ausgelegt, die bestehende Ansätze an ihre Grenzen bringen.

Konkret haben wir den Precision Mode anhand von rund 9.000 Dokumenten evaluiert, welche die drei Extraktionsherausforderungen abdecken, für die er entwickelt wurde. Die Evaluierung umfasst Dokumente mit bis zu 2.000 Seiten, Rechnungen mit Tausenden von Einzelposten, dichte mehrseitige Tabellen und Diagramme, Schemata mit mehr als 300 tief verschachtelten Feldern sowie Aufgaben mit hohem Reasoning-Anteil, die Querverweise auf Informationen im gesamten Dokument erfordern.

Die Dokumente stammen aus zwei Benchmark-Sets:

  • 10 interne Datensätze, die von den schwierigsten Kunden-Workflows inspiriert sind, die wir gesehen haben, und die wichtige Branchen wie Finanzdienstleistungen, Fertigung und das Gesundheitswesen abdecken.
  • 5 öffentliche Benchmarks: VAREX, RealDocBench, LongExtractBench und LEDGER, plus ein Stresstest für lange Dokumente unter Verwendung des Datensatzes des Caselaw Access Project.

Zusammen decken diese Datensätze Dokumente wie 10-K-Berichte, Frachtbriefe, technische Handbücher, Finanzdokumente, klinische Notizen, staatliche Patent- und Förderanträge und mehr ab.

image9.gif
Beispiele für komplexe Dokumente, die in unserem internen Benchmark enthalten sind

Baseline-Design und Modellvergleiche

Ein natürlicher Ausgangspunkt für die Dokumentenextraktion ist ein einzelner Aufruf eines Frontier-Modells: Sie übergeben das Dokument und das Schema und lassen das Modell die strukturierte Ausgabe zurückgeben. Bei den dichten und komplexen Workflows, die wir evaluieren, stößt dieser Ansatz jedoch schnell an seine Grenzen. Lange Dokumente können die Kontextlimits des Modells überschreiten, was zu ungenauen und unvollständigen Ergebnissen führt.

Daher haben wir einen Vergleich mit einer stärkeren, realistischeren Baseline durchgeführt: Chunk-and-Merge. Wir teilen jedes Dokument in kleinere Chunks auf, extrahieren unabhängig aus jedem einzelnen und führen die Ergebnisse zu einer finalen Ausgabe zusammen – genau das Muster, das Entwickler verwenden, wenn ein einzelner Modellaufruf nicht ausreicht.

Wir haben den Chunk-and-Merge-Ansatz mit führenden GPT-, Claude- und Gemini-Modellen unter Verwendung ihrer Standard-API-Einstellungen getestet. Anschließend haben wir jedes Modell im Hinblick auf die Extraktionsgenauigkeit mit dem Precision Mode verglichen. ¹

Benchmark-Ergebnisse

image3.png

Über alle unsere Benchmarks hinweg erreicht der Precision Mode eine Genauigkeit von 94,7 % und übertrifft damit die stärkste Chunk-and-Merge-Baseline eines Frontier-Modells, GPT-5.6 Sol, um sieben Prozentpunkte.

Insbesondere bei schwierigen Workflows mit langen Dokumenten konnten wir bei Frontier-Modellen zahlreiche betriebliche Fehlerquellen beobachten, darunter Chunk-Timeouts, abgeschnittene Ausgaben und unvollständige finale Zusammenführungen, die nicht dem angeforderten Schema entsprachen. Der agentenbasierte Ansatz des Precision Mode hingegen ist robust gegenüber diesen Fehlerquellen, und unsere speziell trainierten Extraktionsmodelle sorgen für eine effiziente und präzise Extraktion.

Erste Schritte

Für Ihre komplexesten Aufgaben zur Dokumentenextraktion ist der AI Extract Precision Mode ab sofort verfügbar. Stellen Sie den Modus beim Aufruf der Funktion ai_extract auf precision ein, oder aktivieren Sie den Schalter für den Precision Mode in der Information Extraction UI auf der Seite „Agents“:

image10.gif

AI Extract Precision Mode ausprobieren

Fußnoten:

¹ Wir definieren Genauigkeit als den Anteil der extrahierten Objekte, die mit dem Ground-Truth-Objekt übereinstimmen. Die Bewertung hängt vom Typ ab. Primitive Datentypen (Booleans, Floats, Integers, Enums) nutzen eine direkte Übereinstimmung. Bei Strings wird zuerst eine direkte Übereinstimmung versucht, dann ein Fuzzy-Match und schließlich eine Bewertung durch einen LLM-Judge. Arrays werden bewertet, indem die engste Paarung zwischen vorhergesagten und erwarteten Elementen ermittelt und anschließend der Durchschnitt über die Paare gebildet wird. Objekte werden pro Feld je nach Typ bewertet und anschließend über alle Felder gemittelt.

(Dieser Blogbeitrag wurde mit KI-gestützten Tools übersetzt.) Originalbeitrag

Erhalten Sie die neuesten Beiträge in Ihrem Posteingang

Abonnieren Sie unseren Blog und erhalten Sie die neuesten Beiträge direkt in Ihren Posteingang.