El tipo FILE hace que sus documentos, imágenes, videos y otros datos no estructurados sean nativos de su lakehouse y estén listos para la AI.
por Michael Armbrust, Burak Yavuz, Dejan Krakovic y John Spencer
Su patrimonio de datos contiene mucho más que tablas estructuradas, métricas y registros de transacciones: contiene contratos, imágenes de productos, grabaciones de llamadas y videos. La AI ahora puede convertir esos datos no estructurados en algo que puede consultar y analizar, pero solo si se gobiernan y gestionan junto con todo lo demás.
Hoy anunciamos la versión beta del tipo FILE: un nuevo tipo de columna que almacena datos no estructurados como una columna nativa y gobernada en sus tablas. Con FILE, sus datos no estructurados están listos para la AI: se pueden consultar, proteger y gestionar junto con sus datos estructurados, en lugar de vivir en un sistema independiente. Los beneficios de FILE incluyen:
FILE es una innovación que estamos impulsando de forma abierta: estamos trabajando con la comunidad para integrar el soporte directamente en Parquet, Delta Lake, Apache Iceberg y Apache Spark, para que todo el ecosistema pueda aprovecharlo. Esto mantiene sus datos multimodales abiertos y portables, de modo que nunca se verá atrapado por un solo proveedor de servicios o de modelos.
Hoy en día, sus equipos de datos quieren crear aplicaciones sobre datos multimodales para generar un impacto empresarial:
FILE reduce la fricción a lo largo de todo el ciclo de vida de los datos multimodales: desde el análisis exploratorio hasta el entrenamiento de modelos y el servicio de datos a los agentes en tiempo real. Para demostrar esto, analizaremos un ejemplo, pero puede adaptarlo a su propio caso de uso a medida que avanza en la lectura.
Comencemos nuestro ejemplo con una pregunta directa del CEO de una empresa de conducción autónoma:
¿Podemos reducir el número de paradas aleatorias? Cuando nuestro auto autónomo se detiene sin motivo aparente, pasajeros pierden la confianza en nuestro servicio
Los datos necesarios para abordar esto son videos no estructurados de cámaras de tablero (dashcam) capturados desde cada auto autónomo. Así es como FILE prepara esos datos para la AI para que podamos responder a la solicitud del CEO

Figura 1: Diagrama conceptual que muestra una columna FILE que almacena videos
footage con el tipo FILE, asignando cada clip en el almacenamiento de objetos a una filaA continuación se muestra una sintaxis de ejemplo para crear una tabla con una columna FILE. Para probar el recorrido completo de una canalización de procesamiento de archivos utilizando FILE, consulte la documentación adjunta, que incluye notebooks de ejemplo.

Figura 2: Diagrama que muestra los FILEs de video procesados
frame, también con el tipo FILEhazard para cada fotogramahazard = none ; esta es la información clave que buscamosLa ventaja de utilizar FILE es que puede trabajar fácilmente con gigabytes de video sin que el rendimiento de las consultas se vea afectado. Debido a que la columna FILE contiene una referencia ligera, el motor extrae los bytes reales solo en el paso que los necesita. Compare esto con la codificación del binario sin procesar en la tabla, donde cada operación arrastra el binario de gran tamaño a través de la memoria del motor y dificulta el rendimiento.

Figura 3: Diagrama que muestra la consulta de una tabla multimodal
hazard extraída con los datos estructurados del viaje, filtrando los videos en los que el auto se detuvo por completo con la carretera despejada por delanteEl agente ahora puede responder a la pregunta de manera rápida y precisa porque todo reside en una sola fila: el fotograma de video original como verdad de referencia (ground truth), el embedding, la información extraída (como los peligros presentes) y los metadatos del viaje (velocidad, marca de tiempo, etc.) se encuentran uno al lado del otro.
A menudo vemos que los clientes intentan resolver casos de uso como este almacenando en la tabla una cadena URL que contiene una ruta al archivo. Sin embargo, esas cadenas se rigen por un sistema completamente diferente de permisos amplios a nivel de carpeta. Ahora se ve obligado a mantener dos modelos de permisos para un solo conjunto de datos, y un filtro de filas que protege una ruta no hace nada para proteger el video al final de la misma.
Hemos rozuelto este desafío de gobernanza integrando FILE en Unity Catalog, donde los FILEs también están protegidos por controles de acceso a nivel de fila y columna, así como por el control de acceso basado en atributos (ABAC), lo que garantiza que las personas adecuadas tengan acceso a sus datos.
Otro problema al que se enfrentan los equipos hoy en día es la coordinación del ciclo de vida de sus datos no estructurados. Si alguien elimina un video en el almacenamiento de objetos, la tabla no tiene idea de la política de ciclo de vida del almacenamiento y no saben nada la una de la otra, por lo que se queda con una referencia que no apunta a nada.
Con FILE, el ciclo de vida del video se desplaza con su fila en el dataset: elimine una fila y los datos y su referencia se mantendrán sincronizados; sin archivos huérfanos ni brechas de cumplimiento. Ahora sus equipos pueden avanzar rápidamente sin preocuparse por las solicitudes de derecho al olvido (por ejemplo, GDPR) ni por la búsqueda manual de cada copia de los datos.
FILE ahora permite que sus datos no estructurados se beneficien de la misma base abierta, modelo de gobernanza y pila de AI que ya utiliza para los datos estructurados.
AI_PARSE_DOCUMENT, AI_QUERY y sus propias UDFs directamente sobre la columna FILE para convertir documentos, imágenes y videos sin procesar en las columnas estructuradas que sus agentes y analistas ya consultan.El tipo FILE ya está disponible en versión Beta y nos encantaría recibir sus comentarios. Lea la documentación de la versión Beta para obtener la lista completa de lo que puede probar hoy mismo y una guía paso a paso.
Esto es solo el comienzo para el tipo FILE y tenemos una emocionante hoja de ruta de funciones que llegarán pronto y que acelerarán sus proyectos de AI, que incluyen:
Si desea obtener más información sobre cómo estamos optimizando las cargas de trabajo de AI en Databricks, póngase en contacto con el equipo de su cuenta de Databricks.
(Esta entrada del blog ha sido traducida utilizando herramientas basadas en inteligencia artificial) Publicación original
Suscríbete a nuestro blog y recibe las últimas publicaciones directamente en tu bandeja de entrada.