Wir stellen den Precision Mode in AI Extract vor: Erreichen Sie Spitzengenauigkeit bei langen Dokumenten und komplexen Schemata, bei denen bestehende Ansätze an ihre Grenzen stoßen.
von Jane Zhang, Arnav Singhvi, Ivan Zhou, Archika Dogra, Matthew Ding und Nihit Desai
Jedes Unternehmen verfügt über wertvolle Daten, die in unübersichtlichen, unstrukturierten Dokumenten gefangen sind. Heute hilft Databricks Document Intelligence Tausenden von Kunden, ihre Daten nutzbar zu machen, indem es Milliarden von Seiten in strukturierte Daten umwandelt, die produktive Pipelines, Agents und Anwendungen antreiben. Kunden wie Panasonic, EY-Parthenon und Intercontinental Exchange (NYSE) nutzen Document Intelligence für ihre anspruchsvollsten Workflows und verarbeiten wöchentlich Millionen von Dokumenten.
Bei der Arbeit mit Kunden haben wir einige schwierige Extraktionsprobleme festgestellt, bei denen bestehende Lösungen auf Basis von Large Language Models (LLM) oder regelbasierten Dokumentenextraktionen an ihre Grenzen stoßen:
Heute freuen wir uns, den Precision Mode in unserer API zur Dokumentenextraktion, ai_extract, vorzustellen, der neue Maßstäbe für die Genauigkeit bei den komplexesten Dokumenten und Aufgaben in Unternehmen setzt.

Der Precision Mode kombiniert unsere speziell trainierten Modelle für die Dokumentenextraktion mit einem Agenten-Harness, um eine zuverlässige und genaue Extraktion bei langen Dokumenten, großen Ausgaben und komplexen Schemata mit hohem Reasoning-Anteil zu liefern. In Benchmarks mit rund 9.000 komplexen Dokumenten erreicht der Precision Mode eine State-of-the-Art-Qualität und übertrifft die neuesten Frontier-Modelle bei der Extraktionsgenauigkeit deutlich.
„Bei Intercontinental Exchange verarbeiten wir jeden Monat Millionen komplexer, hochgradig variabler Finanzdokumente. Document Intelligence hilft uns, diese Komplexität in strukturierte Market Intelligence umzuwandeln. So können wir schneller agieren, unseren Kunden einen größeren Mehrwert bieten und agentenbasierte Workflows freisetzen, die Analysen und Entscheidungsfindungen in großem Maßstab beschleunigen.“—Anand Pradhan, CTO und Head of AI, Mortgage Data bei Intercontinental Exchange (NYSE)
Um die Genauigkeit bei den schwierigsten Extraktionsaufgaben zu maximieren, haben unsere Forschungs- und Entwicklungsteams die Qualität der Dokumentenextraktion auf zwei Ebenen angegangen: die Anpassung des Modells selbst und die Entwicklung eines effektiven Agenten-Harness um das Modell herum.
Um den Precision Mode zu validieren, haben wir unsere Evaluierungs-Benchmarks auf Workflows ausgelegt, die bestehende Ansätze an ihre Grenzen bringen.
Konkret haben wir den Precision Mode anhand von rund 9.000 Dokumenten evaluiert, welche die drei Extraktionsherausforderungen abdecken, für die er entwickelt wurde. Die Evaluierung umfasst Dokumente mit bis zu 2.000 Seiten, Rechnungen mit Tausenden von Einzelposten, dichte mehrseitige Tabellen und Diagramme, Schemata mit mehr als 300 tief verschachtelten Feldern sowie Aufgaben mit hohem Reasoning-Anteil, die Querverweise auf Informationen im gesamten Dokument erfordern.
Die Dokumente stammen aus zwei Benchmark-Sets:
Zusammen decken diese Datensätze Dokumente wie 10-K-Berichte, Frachtbriefe, technische Handbücher, Finanzdokumente, klinische Notizen, staatliche Patent- und Förderanträge und mehr ab.
Ein natürlicher Ausgangspunkt für die Dokumentenextraktion ist ein einzelner Aufruf eines Frontier-Modells: Sie übergeben das Dokument und das Schema und lassen das Modell die strukturierte Ausgabe zurückgeben. Bei den dichten und komplexen Workflows, die wir evaluieren, stößt dieser Ansatz jedoch schnell an seine Grenzen. Lange Dokumente können die Kontextlimits des Modells überschreiten, was zu ungenauen und unvollständigen Ergebnissen führt.
Daher haben wir einen Vergleich mit einer stärkeren, realistischeren Baseline durchgeführt: Chunk-and-Merge. Wir teilen jedes Dokument in kleinere Chunks auf, extrahieren unabhängig aus jedem einzelnen und führen die Ergebnisse zu einer finalen Ausgabe zusammen – genau das Muster, das Entwickler verwenden, wenn ein einzelner Modellaufruf nicht ausreicht.
Wir haben den Chunk-and-Merge-Ansatz mit führenden GPT-, Claude- und Gemini-Modellen unter Verwendung ihrer Standard-API-Einstellungen getestet. Anschließend haben wir jedes Modell im Hinblick auf die Extraktionsgenauigkeit mit dem Precision Mode verglichen. ¹

Über alle unsere Benchmarks hinweg erreicht der Precision Mode eine Genauigkeit von 94,7 % und übertrifft damit die stärkste Chunk-and-Merge-Baseline eines Frontier-Modells, GPT-5.6 Sol, um sieben Prozentpunkte.
Insbesondere bei schwierigen Workflows mit langen Dokumenten konnten wir bei Frontier-Modellen zahlreiche betriebliche Fehlerquellen beobachten, darunter Chunk-Timeouts, abgeschnittene Ausgaben und unvollständige finale Zusammenführungen, die nicht dem angeforderten Schema entsprachen. Der agentenbasierte Ansatz des Precision Mode hingegen ist robust gegenüber diesen Fehlerquellen, und unsere speziell trainierten Extraktionsmodelle sorgen für eine effiziente und präzise Extraktion.
Für Ihre komplexesten Aufgaben zur Dokumentenextraktion ist der AI Extract Precision Mode ab sofort verfügbar. Stellen Sie den Modus beim Aufruf der Funktion ai_extract auf precision ein, oder aktivieren Sie den Schalter für den Precision Mode in der Information Extraction UI auf der Seite „Agents“:

AI Extract Precision Mode ausprobieren
Fußnoten:
¹ Wir definieren Genauigkeit als den Anteil der extrahierten Objekte, die mit dem Ground-Truth-Objekt übereinstimmen. Die Bewertung hängt vom Typ ab. Primitive Datentypen (Booleans, Floats, Integers, Enums) nutzen eine direkte Übereinstimmung. Bei Strings wird zuerst eine direkte Übereinstimmung versucht, dann ein Fuzzy-Match und schließlich eine Bewertung durch einen LLM-Judge. Arrays werden bewertet, indem die engste Paarung zwischen vorhergesagten und erwarteten Elementen ermittelt und anschließend der Durchschnitt über die Paare gebildet wird. Objekte werden pro Feld je nach Typ bewertet und anschließend über alle Felder gemittelt.
(Dieser Blogbeitrag wurde mit KI-gestützten Tools übersetzt.) Originalbeitrag
Abonnieren Sie unseren Blog und erhalten Sie die neuesten Beiträge direkt in Ihren Posteingang.