Direkt zum Hauptinhalt
Plattform

Einführung des FILE-Typs: ein nativer Spaltentyp für multimodale Daten

Der FILE-Typ macht Ihre Dokumente, Bilder, Videos und andere unstrukturierte Daten nativ für Ihr Lakehouse und bereit für KI.

von Michael Armbrust, Burak Yavuz, Dejan Krakovic und John Spencer

  1. FILE ist ein neuer Spaltentyp, der sich derzeit in der Beta-Phase befindet und unstrukturierte Daten wie Dokumente, Bilder, Audio und Video nativ in Ihren Tabellen speichert.
  2. FILE ermöglicht eine einheitliche Governance, bei der Sie genau dieselben feingranularen Zugriffskontrollen und Sicherheitsrichtlinien auf Ihre Rohdateien anwenden können wie auf Ihre Standardtabellen
  3. Wir arbeiten mit der Community zusammen, um die Unterstützung direkt in Parquet, Delta Lake, Iceberg und Spark zu integrieren, sodass das gesamte Ökosystem davon profitieren kann und Ihre Daten portabel bleiben.

Ihr Datenbestand umfasst weit mehr als nur strukturierte Tabellen, Metriken und Transaktionsprotokolle – er enthält Verträge, Produktbilder, Anrufaufzeichnungen und Videos. KI kann diese unstrukturierten Daten nun in etwas verwandeln, das Sie abfragen und analysieren können – aber nur, wenn sie zusammen mit allen anderen Daten verwaltet und kontrolliert werden.

Heute kündigen wir die Beta-Version des Typs FILE an: ein neuer Spaltentyp, der unstrukturierte Daten als native, kontrollierte Spalte in Ihren Tabellen speichert. Mit FILE sind Ihre unstrukturierten Daten bereit für KI: abfragbar, sicher und direkt neben Ihren strukturierten Daten verwaltet, anstatt in einem separaten System zu liegen. Zu den Vorteilen von FILE gehören:

  • Einheitliche Governance. Wenden Sie genau dieselben feingranularen Zugriffskontrollen und Sicherheitsrichtlinien auf Ihre Rohdateien an wie auf Ihre Standardtabellen.
  • Automatisierte Compliance. Wenn Sie eine Zeile löschen, die ein FILE enthält, wird auch die Binärdatei des Files im Objektspeicher gelöscht, was das GDPR "Recht auf Vergessenwerden" mühelos macht.
  • Unterstützung für SQL und Python. Führen Sie Standard-SQL und Python-UDFs direkt auf unstrukturierten Dateien aus, genau wie bei jeder normalen Spalte, und erstellen Sie materialisierte Sichten, um KI-Funktionen inkrementell auszuführen.
  • Von Grund auf hohe Performance. FILE-Spalten speichern nur schlanke Pointer anstelle von schweren Dateibinärdaten und verarbeiten den tatsächlichen Dateiinhalt erst dann, wenn eine Abfrage ihn explizit erfordert.

FILE ist eine Innovation, die wir offen vorantreiben: Wir arbeiten mit der Community zusammen, um die Unterstützung direkt in Parquet, Delta Lake, Apache Iceberg und Apache Spark zu integrieren, damit das gesamte Ökosystem davon profitieren kann. So bleiben Ihre multimodalen Daten offen und portabel, sodass Sie nie an einen einzigen Anbieter oder Modellbereitsteller gebunden sind.

Was Sie mit dem Typ FILE tun können

Heutzutage möchten Ihre Datenteams Anwendungen auf multimodalen Daten aufbauen, um geschäftlichen Nutzen zu erzielen:

  • Dokumentenassistenten für Unternehmen für Verträge, Richtlinien und Forschung – um Papierkram in eine interaktive Wissensdatenbank zu verwandeln.
  • Visuelle Inspektion von Produktbildern – um Fehler in großem Maßstab zu erkennen, anstatt jedes einzelne Bild manuell prüfen zu müssen.
  • Anrufanalysen von Audioaufzeichnungen – um aus bereits geführten Gesprächen herauszufinden, warum Kunden konvertieren oder abwandern.
  • Videoverständnis von Ereignissen – um stundenlanges Bildmaterial durchsuch- und abfragbar zu machen.
  • Multimodales Retrieval für Agenten, die echte Belege zitieren und darauf reagieren müssen, nicht nur Text.

FILE reduziert Reibungsverluste über den gesamten Lebenszyklus multimodaler Daten hinweg – von der explorativen Analyse über das Modelltraining bis hin zur Bereitstellung von Daten für Agenten in Echtzeit. Um dies zu demonstrieren, gehen wir ein Beispiel durch. Sie können beim Lesen jedoch gerne Ihren eigenen Anwendungsfall im Hinterkopf behalten.

Beginnen wir unser Beispiel mit einer gezielten Frage des CEO eines Unternehmens für autonomes Fahren:

Können wir die Anzahl der zufälligen Stopps reduzieren? Wenn unser selbstfahrendes Auto ohne ersichtlichen Grund anhält, verlieren die Fahrgäste das Vertrauen in unseren Service.

Die zur Lösung dieses Problems benötigten Daten sind unstrukturierte Dashcam-Videos, die von jedem selbstfahrenden Auto aufgenommen wurden. Hier sehen Sie, wie FILE diese Daten bereit für KI macht, damit wir die Anfrage des CEO beantworten können:

  1. Sie beginnen mit dem Erstellen einer Spalte mit FILEs – erstellen Sie eine Tabelle mit einer FILE-Spalte, die aus dem Speichervolumen liest, das die Dashcam-Videos enthält

image4.png

Abbildung 1: Konzeptdiagramm zur Veranschaulichung einer FILE-Spalte, die Videos speichert

  1. Fügen Sie eine Spalte footage vom Typ FILE hinzu, die jeden Clip im Objektspeicher einer Zeile zuordnet
  2. Die Tabelle enthält nun diese FILE-Spalte neben strukturierten Metadaten
  3. Einer dieser Dashcam-Clips zeigt, wie das Auto ohne ersichtlichen Grund anhält – ein Beispiel für das, was wir finden und untersuchen müssen

Unten finden Sie eine Beispielsyntax zum Erstellen einer Tabelle mit einer FILE-Spalte. Um den vollständigen Durchlauf einer Dateiverarbeitungspipeline mit FILE auszuprobieren, lesen Sie die begleitende Dokumentation, die Beispiel-Notebooks enthält.

  1. Verarbeiten Sie die Dashcam-Videos performant. Da die Spalte als FILE typisiert ist, können Sie damit wie mit jeder anderen Spalte arbeiten: Nutzen Sie integrierte KI-Funktionen oder Ihre eigenen Python-UDFs. Hier extrahiert eine UDF ein Frame aus jedem Clip in eine neue FILE-Spalte mit Bildern, und ein Objekterkennungsmodell fügt den bereits vorhandenen Metadaten eine weitere Spalte hinzu – die angibt, ob sich tatsächlich ein Hindernis vor dem Auto befindet, das einen Stopp erfordert.

image2.png

Abbildung 2: Diagramm zur Veranschaulichung verarbeiteter Video-FILEs

  1. Ein extrahiertes Frame landet in einer neuen frame Spalte, die ebenfalls als FILE typisiert ist
  2. Wir führen eine Funktion direkt auf dieser FILE-Spalte aus, um den Wert hazard für jedes Frame zu erhalten
  3. Der gestoppte Clip liefert das Ergebnis hazard = none – das ist die Erkenntnis, nach der wir suchen

Der Vorteil bei der Verwendung von FILE besteht darin, dass Sie problemlos mit Gigabytes an Videodaten arbeiten können, ohne dass die Abfrageleistung beeinträchtigt wird. Da die FILE-Spalte eine schlanke Referenz enthält, lädt die Engine die tatsächlichen Bytes erst bei dem Schritt, der sie benötigt. Vergleichen Sie das mit der Codierung der Rohbinärdaten in der Tabelle, bei der jede Operation die große Binärdatei durch den Speicher der Engine zieht und die Performance beeinträchtigt.

  1. Beantworten Sie die Frage des CEO. Nun kann ein Agent Ihren gesamten multimodalen Datenbestand analysieren – indem er die extrahierten Informationen mit den strukturierten Fahrtdaten verknüpft, um jedes Video anzuzeigen, in dem das Auto plötzlich und ohne Hindernis vor sich angehalten hat.

image3.png

Abbildung 3: Diagramm zur Veranschaulichung der Abfrage einer multimodalen Tabelle

  1. Eine Abfrage verknüpft die extrahierte Spalte hazard mit den strukturierten Fahrtdaten und filtert nach den Videos, in denen das Auto bei freier Straße vollständig zum Stillstand kam
  2. Von hier aus kann Ihr Machine-Learning-Team ganz einfach Trainingsdatensätze kuratieren, um das selbstfahrende System zu verbessern

Der Agent kann die Frage nun schnell und präzise beantworten, da alles in einer Zeile liegt: Das originale Video-Frame als Ground Truth, das Embedding, extrahierte Erkenntnisse wie vorhandene Hindernisse und die Fahrt-Metadaten (Geschwindigkeit, Zeitstempel usw.) befinden sich direkt nebeneinander.

Wir sehen oft, dass Kunden versuchen, solche Anwendungsfälle zu lösen, indem sie eine URL-Zeichenfolge, die den Pfad zur Datei enthält, in der Tabelle speichern. Diese Zeichenfolgen werden jedoch von einem völlig anderen System mit weitreichenden Berechtigungen auf Ordnerebene kontrolliert. Sie sind nun gezwungen, zwei Berechtigungsmodelle für einen einzigen Datensatz zu verwalten, und ein Zeilenfilter, der einen Pfad schützt, tut nichts zum Schutz des Videos am Ende dieses Pfads.

Wir haben diese Governance-Herausforderung gelöst, indem wir FILE in Unity Catalog integriert haben. Dort werden FILEs auch durch Zugriffskontrollen auf Zeilen- und Spaltenebene sowie durch attributbasierte Zugriffskontrolle (ABAC) gesichert, um sicherzustellen, dass die richtigen Personen Zugriff auf Ihre Daten haben.

Ein weiteres Problem, vor dem Teams heute stehen, ist die Koordinierung des Lebenszyklus ihrer unstrukturierten Daten. Wenn jemand ein Video im Objektspeicher löscht, hat die Tabelle keine Ahnung von der Speicher-Lebenszyklusrichtlinie, und Tabelle und Speicher wissen nichts voneinander, sodass Sie eine Referenz erhalten, die ins Leere weist.

Mit FILE ist der Lebenszyklus des Videos direkt mit seiner Zeile im Datensatz verknüpft: Wenn Sie eine Zeile löschen, bleiben die Daten und ihre Referenz synchron – keine verwaisten Dateien, keine Compliance-Lücken. Jetzt können Ihre Teams schnell agieren, ohne sich Gedanken über Anträge auf Vergessenwerden (z. B. GDPR) und die manuelle Suche nach jeder einzelnen Kopie der Daten machen zu müssen.

FILE ist in die Tools integriert, die Sie bereits verwenden

Mit FILE können Ihre unstrukturierten Daten nun von derselben offenen Basis, demselben Governance-Modell und demselben AI-Stack profitieren, den Sie bereits für strukturierte Daten nutzen.

  • Mühelos erfassen oder direkt vor Ort referenzieren. Verbinden Sie sich über Point-and-Click-Konnektoren von Lakeflow direkt mit Quellen wie SharePoint und Google Drive. Oder, wenn sich Ihre Daten bereits im Cloud-Speicher oder On-Premises befinden, können FILE-Spalten direkt darauf verweisen, wo sie liegen – ganz ohne Datenverschiebung.
  • Erstellen Sie multimodale Pipelines mit Spark Declarative Pipelines. Die inkrementelle Verarbeitung unstrukturierter Daten ist wichtiger denn je, da jedes neu verarbeitete Dokument einen teuren Modell-API-Aufruf bedeuten kann. Und genau wie bei Ihren herkömmlichen Datenpipelines sollten Ihre Ingenieure nicht um 3 Uhr morgens aufstehen müssen, wenn eine einzelne Datei fehlschlägt. Mit FILE und SDP deklarieren Sie die gewünschten multimodalen Tabellen, und der DAG löst sich von selbst auf. Die Erfassung erfolgt inkrementell, sodass nur neue Dokumente verarbeitet werden. Wiederholungsversuche und Wiederherstellung sind integriert, sodass ein vorübergehender Fehler keinen Neustart erfordert.
  • Nutzen Sie jedes beliebige Modell zur Verarbeitung Ihrer unstrukturierten Daten, einschließlich erstklassiger AI-Funktionen. Führen Sie AI_PARSE_DOCUMENT, AI_QUERY und Ihre eigenen UDFs direkt über der FILE-Spalte aus, um unformatierte Dokumente, Bilder und Videos in strukturierte Spalten umzuwandeln, die Ihre Agents und Analysten bereits abfragen.
    Und da Databricks von Grund auf für Multi-Cloud-Umgebungen entwickelt wurde, fügt sich FILE nahtlos bei allen Cloud-Anbietern ein und bietet Ihrem Team ein einziges, einheitliches Lakehouse.

Erste Schritte mit dem FILE-Typ

Der FILE-Typ ist ab sofort in der Beta-Phase verfügbar und wir freuen uns über Ihr Feedback. Lesen Sie die Beta-Dokumentation für eine vollständige Liste aller Funktionen, die Sie heute ausprobieren können, sowie für Schritt-für-Schritt-Anleitungen.

Dies ist erst der Anfang für den FILE-Typ, und wir haben eine spannende Roadmap mit Funktionen geplant, die in Kürze erscheinen und Ihre AI-Projekte beschleunigen werden, darunter:

  • Schneller experimentieren ohne zusätzliche Kosten. Das Trainieren und Iterieren auf einem Datensatz sollte nicht bedeuten, Terabytes an unstrukturierten Daten zu duplizieren. Mit FILE können Sie Daten versionieren und klonen, ohne die zugrunde liegenden Binärdateien zu kopieren, und dieselben Bytes aus vielen Tabellen gleichzeitig referenzieren. Beispielsweise kann ein Machine-Learning-Agent eine isolierte Sandbox auf echten Daten erstellen, und die Lineage verfolgt jede Regression bis zu dem genauen Asset zurück, das sie verursacht hat.
  • Datensätze direkt in PyTorch streamen. Führen Sie SQL-Abfragen auf Ihren FILE-Daten aus und laden Sie die Ergebnisse sofort in native PyTorch-Datasets. So erhalten Sie GPU-fähige Tensoren direkt in Ihren Trainingsschleifen, ohne zusätzliche Datenvorbereitung.
  • Feature Engineering ohne Tabellen-Rewrite. Fügen Sie eine abgeleitete Spalte wie extrahierten Text, ein Embedding oder eine Klassifizierung hinzu oder befüllen Sie diese rückwirkend, ohne die gesamte Tabelle neu schreiben zu müssen – einschließlich großer Binärdateien der unstrukturierten Quelldaten.
  • Eine einzige Kopie Ihrer unstrukturierten Daten für Analysen und Serving. Suchen und rufen Sie Daten direkt aus der Tabelle ab – mit Vektor-, Volltext- und Point-Lookup-Indizes auf der Tabelle selbst. So sind Ihre Retrieval-Ebene und Ihre Source of Truth dasselbe Lakehouse.

Wenn Sie mehr darüber erfahren möchten, wie wir AI-Workloads in Databricks optimieren, wenden Sie sich an Ihr Databricks-Account-Team.

(Dieser Blogbeitrag wurde mit KI-gestützten Tools übersetzt.) Originalbeitrag

Erhalten Sie die neuesten Beiträge in Ihrem Posteingang

Abonnieren Sie unseren Blog und erhalten Sie die neuesten Beiträge direkt in Ihren Posteingang.