Le type FILE intègre nativement vos documents, images, vidéos et autres données non structurées à votre lakehouse et les prépare pour l'AI.
par Michael Armbrust, Burak Yavuz, Dejan Krakovic et John Spencer
Votre patrimoine de données contient bien plus que des tables structurées, des métriques et des journaux de transactions : il contient des contrats, des images de produits, des enregistrements d'appels et des vidéos. L'AI peut désormais transformer ces données non structurées en éléments que vous pouvez interroger et analyser, mais seulement si elles sont gouvernées et gérées aux côtés de tout le reste.
Aujourd'hui, nous annonçons la version bêta du type FILE : un nouveau type de colonne qui stocke les données non structurées sous forme de colonne native et gouvernée dans vos tables. Avec FILE, vos données non structurées sont prêtes pour l'AI : interrogeables, sécurisées et gérées aux côtés de vos données structurées, au lieu de résider dans un système distinct. Les avantages de FILE incluent :
FILE est une innovation que nous menons de manière ouverte : nous travaillons avec la communauté pour intégrer son support directement dans Parquet, Delta Lake, Apache Iceberg et Apache Spark, afin que tout l'écosystème puisse en tirer parti. Cela permet de garder vos données multimodales ouvertes et portables, de sorte que vous ne soyez jamais bloqué par un seul fournisseur de technologies ou de modèles.
Aujourd'hui, vos équipes de données souhaitent créer des applications sur des données multimodales pour générer un impact commercial :
FILE réduit les frictions tout au long du cycle de vie des données multimodales, de l'analyse exploratoire à l'entraînement des modèles, en passant par la mise à disposition des données aux agents en temps réel. Pour le démontrer, nous allons détailler un exemple, mais vous pouvez le remplacer par votre propre cas d'usage au fil de votre lecture.
Commençons notre exemple par une question précise du CEO d'une entreprise de conduite autonome :
Pouvons-nous réduire le nombre d'arrêts aléatoires ? Lorsque notre voiture autonome s'arrête sans raison apparente, les passagers perdent confiance dans notre service.
Les données nécessaires pour répondre à cette question sont des vidéos non structurées issues des caméras embarquées (dashcams) de chaque voiture autonome. Voici comment FILE rend ces données prêtes pour l'AI afin que nous puissions répondre à la demande du CEO :

Figure 1 : Schéma conceptuel illustrant une colonne FILE stockant des vidéos
footage de type FILE, associant chaque clip du stockage d'objets à une ligneVous trouverez ci-dessous un exemple de syntaxe pour créer une table avec une colonne FILE. Pour essayer l'intégralité d'un pipeline de traitement de fichiers utilisant FILE, consultez la documentation d'accompagnement qui comprend des exemples de notebooks.

Figure 2 : Schéma illustrant les fichiers FILE vidéo traités
frame, également de type FILEhazard pour chaque imagehazard = none : c'est l'information que nous recherchonsL'avantage d'utiliser FILE est que vous pouvez facilement travailler avec des gigaoctets de vidéo sans impacter les performances des requêtes. Comme la colonne FILE contient une référence légère, le moteur ne récupère les octets réels qu'à l'étape qui en a besoin. Comparez cela à l'encodage du binaire brut dans la table, où chaque opération entraîne le transfert du binaire volumineux dans la mémoire du moteur et nuit aux performances.

Figure 3 : Schéma illustrant la requête d'une table multimodale
hazard extraite aux données de trajet structurées, filtrant les vidéos où la voiture s'est complètement arrêtée alors que la route était dégagéeL'agent peut désormais répondre rapidement et précisément à la question car tout réside dans une seule ligne : l'image vidéo d'origine comme vérité terrain, l'embedding, les informations extraites comme les dangers présents, et les métadonnées du trajet (vitesse, horodatage, etc.) se trouvent côte à côte.
Nous constatons souvent que des clients tentent de résoudre ce genre de cas d'utilisation en stockant dans la table une chaîne URL contenant le chemin d'accès au fichier. Or, ces chaînes sont régies par un système de droits d'accès totalement différent, défini au niveau des dossiers. Vous êtes alors contraint de gérer deux modèles de droits d'accès pour un même ensemble de données, et un filtre de ligne qui protège un path ne protège en rien la vidéo qui s'y trouve.
Nous avons résolu ce défi de gouvernance en intégrant FILE dans Unity Catalog, où les FILEs sont également sécurisés par des contrôles d'accès au niveau des lignes et des colonnes ainsi que par un contrôle d'accès basé sur les attributs (ABAC), garantissant que les bonnes personnes ont accès à vos données.
Un autre problème auquel les équipes sont confrontées aujourd'hui est la coordination du cycle de vie de leurs données non structurées. Si quelqu'un supprime une vidéo dans le stockage d'objets, la table n'a aucune idée de la politique de cycle de vie du stockage et ils ne savent rien l'un de l'autre, vous vous retrouvez donc avec une référence qui ne pointe vers rien.
Avec FILE, le cycle de vie de la vidéo suit sa ligne dans le jeu de données : supprimez une ligne, et les données ainsi que leur référence restent synchronisées - pas de fichiers orphelins, pas de failles de conformité. Désormais, vos équipes peuvent avancer rapidement sans se soucier des demandes de droit à l'oubli (par exemple, le GDPR) et d'une recherche manuelle fastidieuse pour retrouver chaque copie des données.
FILE permet désormais à vos données non structurées de bénéficier de la même fondation ouverte, du même modèle de gouvernance et de la même pile d'intelligence artificielle que ceux que vous utilisez déjà pour vos données structurées.
AI_PARSE_DOCUMENT, AI_QUERY et vos propres UDF directement sur la colonne FILE pour transformer des documents bruts, des images et des vidéos en colonnes structurées que vos agents et analystes interrogent déjà.Le type FILE est désormais disponible en version bêta et nous serions ravis de recevoir vos commentaires. Consultez la documentation de la version bêta pour obtenir la liste complète de ce que vous pouvez essayer aujourd'hui ainsi que des instructions étape par étape.
Ce n'est que le début pour le type FILE et nous avons une feuille de route passionnante de fonctionnalités à venir qui accéléreront vos projets d'intelligence artificielle, notamment :
Si vous souhaitez en savoir plus sur la manière dont nous optimisons les charges de travail d'intelligence artificielle dans Databricks, contactez votre équipe de compte Databricks.
(Cet article de blog a été traduit à l'aide d'outils basés sur l'intelligence artificielle) Article original
Abonnez-vous à notre blog et recevez les derniers articles directement dans votre boîte mail.