Der FILE-Typ macht Ihre Dokumente, Bilder, Videos und andere unstrukturierte Daten nativ für Ihr Lakehouse und bereit für KI.
von Michael Armbrust, Burak Yavuz, Dejan Krakovic und John Spencer
Ihr Datenbestand umfasst weit mehr als nur strukturierte Tabellen, Metriken und Transaktionsprotokolle – er enthält Verträge, Produktbilder, Anrufaufzeichnungen und Videos. KI kann diese unstrukturierten Daten nun in etwas verwandeln, das Sie abfragen und analysieren können – aber nur, wenn sie zusammen mit allen anderen Daten verwaltet und kontrolliert werden.
Heute kündigen wir die Beta-Version des Typs FILE an: ein neuer Spaltentyp, der unstrukturierte Daten als native, kontrollierte Spalte in Ihren Tabellen speichert. Mit FILE sind Ihre unstrukturierten Daten bereit für KI: abfragbar, sicher und direkt neben Ihren strukturierten Daten verwaltet, anstatt in einem separaten System zu liegen. Zu den Vorteilen von FILE gehören:
FILE ist eine Innovation, die wir offen vorantreiben: Wir arbeiten mit der Community zusammen, um die Unterstützung direkt in Parquet, Delta Lake, Apache Iceberg und Apache Spark zu integrieren, damit das gesamte Ökosystem davon profitieren kann. So bleiben Ihre multimodalen Daten offen und portabel, sodass Sie nie an einen einzigen Anbieter oder Modellbereitsteller gebunden sind.
Heutzutage möchten Ihre Datenteams Anwendungen auf multimodalen Daten aufbauen, um geschäftlichen Nutzen zu erzielen:
FILE reduziert Reibungsverluste über den gesamten Lebenszyklus multimodaler Daten hinweg – von der explorativen Analyse über das Modelltraining bis hin zur Bereitstellung von Daten für Agenten in Echtzeit. Um dies zu demonstrieren, gehen wir ein Beispiel durch. Sie können beim Lesen jedoch gerne Ihren eigenen Anwendungsfall im Hinterkopf behalten.
Beginnen wir unser Beispiel mit einer gezielten Frage des CEO eines Unternehmens für autonomes Fahren:
Können wir die Anzahl der zufälligen Stopps reduzieren? Wenn unser selbstfahrendes Auto ohne ersichtlichen Grund anhält, verlieren die Fahrgäste das Vertrauen in unseren Service.
Die zur Lösung dieses Problems benötigten Daten sind unstrukturierte Dashcam-Videos, die von jedem selbstfahrenden Auto aufgenommen wurden. Hier sehen Sie, wie FILE diese Daten bereit für KI macht, damit wir die Anfrage des CEO beantworten können:

Abbildung 1: Konzeptdiagramm zur Veranschaulichung einer FILE-Spalte, die Videos speichert
footage vom Typ FILE hinzu, die jeden Clip im Objektspeicher einer Zeile zuordnetUnten finden Sie eine Beispielsyntax zum Erstellen einer Tabelle mit einer FILE-Spalte. Um den vollständigen Durchlauf einer Dateiverarbeitungspipeline mit FILE auszuprobieren, lesen Sie die begleitende Dokumentation, die Beispiel-Notebooks enthält.

Abbildung 2: Diagramm zur Veranschaulichung verarbeiteter Video-FILEs
frame Spalte, die ebenfalls als FILE typisiert isthazard für jedes Frame zu erhaltenhazard = none – das ist die Erkenntnis, nach der wir suchenDer Vorteil bei der Verwendung von FILE besteht darin, dass Sie problemlos mit Gigabytes an Videodaten arbeiten können, ohne dass die Abfrageleistung beeinträchtigt wird. Da die FILE-Spalte eine schlanke Referenz enthält, lädt die Engine die tatsächlichen Bytes erst bei dem Schritt, der sie benötigt. Vergleichen Sie das mit der Codierung der Rohbinärdaten in der Tabelle, bei der jede Operation die große Binärdatei durch den Speicher der Engine zieht und die Performance beeinträchtigt.

Abbildung 3: Diagramm zur Veranschaulichung der Abfrage einer multimodalen Tabelle
hazard mit den strukturierten Fahrtdaten und filtert nach den Videos, in denen das Auto bei freier Straße vollständig zum Stillstand kamDer Agent kann die Frage nun schnell und präzise beantworten, da alles in einer Zeile liegt: Das originale Video-Frame als Ground Truth, das Embedding, extrahierte Erkenntnisse wie vorhandene Hindernisse und die Fahrt-Metadaten (Geschwindigkeit, Zeitstempel usw.) befinden sich direkt nebeneinander.
Wir sehen oft, dass Kunden versuchen, solche Anwendungsfälle zu lösen, indem sie eine URL-Zeichenfolge, die den Pfad zur Datei enthält, in der Tabelle speichern. Diese Zeichenfolgen werden jedoch von einem völlig anderen System mit weitreichenden Berechtigungen auf Ordnerebene kontrolliert. Sie sind nun gezwungen, zwei Berechtigungsmodelle für einen einzigen Datensatz zu verwalten, und ein Zeilenfilter, der einen Pfad schützt, tut nichts zum Schutz des Videos am Ende dieses Pfads.
Wir haben diese Governance-Herausforderung gelöst, indem wir FILE in Unity Catalog integriert haben. Dort werden FILEs auch durch Zugriffskontrollen auf Zeilen- und Spaltenebene sowie durch attributbasierte Zugriffskontrolle (ABAC) gesichert, um sicherzustellen, dass die richtigen Personen Zugriff auf Ihre Daten haben.
Ein weiteres Problem, vor dem Teams heute stehen, ist die Koordinierung des Lebenszyklus ihrer unstrukturierten Daten. Wenn jemand ein Video im Objektspeicher löscht, hat die Tabelle keine Ahnung von der Speicher-Lebenszyklusrichtlinie, und Tabelle und Speicher wissen nichts voneinander, sodass Sie eine Referenz erhalten, die ins Leere weist.
Mit FILE ist der Lebenszyklus des Videos direkt mit seiner Zeile im Datensatz verknüpft: Wenn Sie eine Zeile löschen, bleiben die Daten und ihre Referenz synchron – keine verwaisten Dateien, keine Compliance-Lücken. Jetzt können Ihre Teams schnell agieren, ohne sich Gedanken über Anträge auf Vergessenwerden (z. B. GDPR) und die manuelle Suche nach jeder einzelnen Kopie der Daten machen zu müssen.
Mit FILE können Ihre unstrukturierten Daten nun von derselben offenen Basis, demselben Governance-Modell und demselben AI-Stack profitieren, den Sie bereits für strukturierte Daten nutzen.
AI_PARSE_DOCUMENT, AI_QUERY und Ihre eigenen UDFs direkt über der FILE-Spalte aus, um unformatierte Dokumente, Bilder und Videos in strukturierte Spalten umzuwandeln, die Ihre Agents und Analysten bereits abfragen.Der FILE-Typ ist ab sofort in der Beta-Phase verfügbar und wir freuen uns über Ihr Feedback. Lesen Sie die Beta-Dokumentation für eine vollständige Liste aller Funktionen, die Sie heute ausprobieren können, sowie für Schritt-für-Schritt-Anleitungen.
Dies ist erst der Anfang für den FILE-Typ, und wir haben eine spannende Roadmap mit Funktionen geplant, die in Kürze erscheinen und Ihre AI-Projekte beschleunigen werden, darunter:
Wenn Sie mehr darüber erfahren möchten, wie wir AI-Workloads in Databricks optimieren, wenden Sie sich an Ihr Databricks-Account-Team.
(Dieser Blogbeitrag wurde mit KI-gestützten Tools übersetzt.) Originalbeitrag
Abonnieren Sie unseren Blog und erhalten Sie die neuesten Beiträge direkt in Ihren Posteingang.