Nos dirigimos a VLDB 2026 para compartir múltiples innovaciones que impulsan la plataforma Databricks. El cofundador y arquitecto principal de Databricks, Reynold Xin, inaugurará la conferencia con la presentación de apertura. Databricks cuenta con cuatro artículos aceptados relacionados con Lakebase, Spark Structured Streaming y optimizaciones automáticas de Lakehouse. El artículo de demostración sobre el motor Enzyme mostrará cómo mantenemos de forma incremental las vistas materializadas. A continuación, se presenta un avance de estas presentaciones.
Presentación de apertura: Las tres edades de oro de la ingeniería de bases de datos
El cofundador de Databricks, Reynold Xin, analizará cómo los agentes de AI están marcando el comienzo de la "tercera edad de oro" de la ingeniería de bases de datos. Es posible que algunos recuerden su trabajo inicial de 2012 en Berkeley sobre el sistema analítico escalable llamado Shark. Reynold reflexionará sobre cómo ha evolucionado su propia perspectiva de la tecnología de bases de datos a lo largo de los años, desde su época en Berkeley, pasando por el auge de la arquitectura Lakehouse, hasta las cambiantes demandas actuales de los motores transaccionales y analíticos. Presentará dos nuevos paradigmas que ayudarán a satisfacer las necesidades de los agentes de AI: (1) Lakebase, que aplica la separación de almacenamiento y cómputo a las bases de datos OLTP, y (2) LTAP (Lake Transactional Analytical Processing), que unifica el procesamiento transaccional y analítico.
Lakebase: Postgres serverless sobre almacenamiento de lago abierto
Las cargas de trabajo de los agentes de AI están creando patrones de uso únicos, como millones de bases de datos ramificadas profundamente y de corta duración. Los motores OLTP tradicionales son monolíticos y no pueden cumplir con estos exigentes requisitos. Stas Kelvich presentará la arquitectura Lakebase, que es una arquitectura de base de datos en la nube de tercera generación. Lakebase cumple con los requisitos de los flujos de trabajo de agentes al desacoplar el cómputo de PostgreSQL serverless del almacenamiento, conservando los datos y los registros de escritura previa (write-ahead logs) directamente en el almacenamiento de objetos en la nube mediante formatos abiertos. Lakebase no solo proporciona inicios en frío de menos de un segundo, sino también flujos de trabajo de bases de datos eficientes similares a Git mediante la ramificación de copia en escritura (copy-on-write). Además, gracias a su separación de cómputo y almacenamiento, permite realizar análisis de baja latencia en datos transaccionales en tiempo real. La Figura 1 muestra cómo Lakebase está marcando el comienzo de la tercera generación de bases de datos en la nube.

Figura 1: Lakebase Postgres se adapta perfectamente a la era de los agentes y está construido sobre el data lake abierto.
Una década de Apache Spark Structured Streaming: cómo evolucionamos la arquitectura para satisfacer las necesidades del mundo real
Structured Streaming impulsa millones de trabajos semanales en Databricks. Utiliza una arquitectura de procesamiento de micro lotes (micro-batch) única que ofrece ventajas de escalabilidad, tolerancia a fallos y semántica de exactamente una vez (exactly-once) en comparación con otros diseños. Sin embargo, Structured Streaming requirió muchas innovaciones nuevas para satisfacer las demandas de los clientes del mundo real y alcanzar la escala actual. Siying Dong presentará cómo ha evolucionado la arquitectura de streaming a lo largo de los años: la canalización de micro lotes mejoró el rendimiento hasta 3 veces, las nuevas API con estado facilitan la expresión de lógica empresarial compleja y el sistema ahora admite un control de acceso de grano fino.
AutoLiquid: optimización autónoma del diseño de datos para Databricks Lakehouse
La agrupación (clustering) de tablas por claves puede mejorar significativamente el rendimiento de las consultas. Sin embargo, seleccionar manualmente las claves de agrupación óptimas en millones de tablas de Lakehouse no es escalable. Yunjia Zhang describirá cómo AutoLiquid automatiza este ciclo de vida a través de una primitiva simple CLUSTER BY AUTO. AutoLiquid utiliza una combinación de heurísticas para la selección de claves y una verificación de sombra eficiente para agrupar millones de tablas. Con estas técnicas, AutoLiquid puede superar el rendimiento de las claves seleccionadas por el cliente en más del 95 % de las cargas de trabajo evaluadas.
Ultron: optimización de consultas basada en el historial en Databricks
La latencia de las consultas de Lakehouse podría mejorar significativamente si el optimizador tuviera un conocimiento casi perfecto de los datos. Ultron es un marco de optimización de consultas basado en el historial que aprovecha la naturaleza repetitiva de las cargas de trabajo analíticas para mejorar las decisiones del optimizador, como la selección del tipo de operador de unión (join). Eric Liang describirá la arquitectura de Ultron, incluyendo cómo almacena de manera eficiente el historial y gestiona los registros de las consultas ejecutadas. Ultron ha mejorado significativamente el rendimiento de las cargas de trabajo de producción, lo que incluye una reducción del 25 % en la mediana de la latencia de las uniones.
Además de estos cuatro artículos, acompáñenos a ver a Yuhong Chen demostrar Enzyme, nuestro motor de mantenimiento incremental de vistas para cargas de trabajo de ingeniería de datos.
Infraestructura de datos nativa para agentes: LakehouseRT, Lakebase y LTAP (charla del patrocinador)
Databricks es patrocinador de oro de VLDB 2026. Ippokratis Pandis ofrecerá la charla del patrocinador de Databricks, donde describirá cómo Databricks está evolucionando la arquitectura de su sistema para adaptarse a los bucles autónomos de los agentes. Con esto en mente, presentaremos LakehouseRT. LakehouseRT cuenta con la tecnología del nuevo motor Reyden y está diseñado para análisis en tiempo real y de baja latencia directamente sobre el almacenamiento de lago abierto. La combinación de Lakebase y LakehouseRT sienta las bases para ofrecer el primer sistema real de procesamiento analítico transaccional de lago (LTAP).
Conozca al equipo en el VLDB 2026
Pase por el stand de Databricks para conectar con nuestros equipos de ingeniería e investigación, debatir sobre nuestros artículos y hablar con nuestros reclutadores.
(Esta entrada del blog ha sido traducida utilizando herramientas basadas en inteligencia artificial) Publicación original
Suscríbete a nuestro blog y recibe las últimas publicaciones directamente en tu bandeja de entrada.