Revenir au contenu principal
Entreprise

Bâtir pour l'ère de l'IA : innovations Lakebase, Streaming et Lakehouse au VLDB 2026

par Indrajit Roy et Ippokratis Pandis

  • Découvrez les innovations de Databricks autour de Lakebase, Structured Streaming et des optimisations Lakehouse
  • Comprenez comment Lakebase, une base de données cloud de troisième génération qui découple le calcul transactionnel du stockage, est parfaitement adaptée aux workflows d'agents
  • Rencontrez nos équipes d'ingénierie et de recrutement au VLDB

Nous nous rendons au VLDB 2026 pour partager plusieurs innovations qui propulsent la plateforme Databricks.  Le cofondateur et architecte en chef de Databricks, Reynold Xin, lancera la conférence avec le discours d'ouverture. Databricks a quatre articles acceptés liés à Lakebase, Spark Structured Streaming et aux optimisations automatiques de Lakehouse. L'article de démonstration sur le moteur Enzyme présentera comment nous maintenons de manière incrémentielle les vues matérialisées. Voici un aperçu de ces présentations. 

Keynote : Les trois âges d'or de l'ingénierie des bases de données

Le cofondateur de Databricks, Reynold Xin, expliquera comment les agents d'IA inaugurent le « troisième âge d'or » de l'ingénierie des bases de données. Certains d'entre vous se souviennent peut-être de ses premiers travaux en 2012 à Berkeley sur le système analytique évolutif appelé Shark. Reynold reviendra sur l'évolution de sa propre perspective sur la technologie des bases de données au fil des ans, depuis ses années à Berkeley jusqu'aux nouvelles exigences imposées aux moteurs transactionnels et analytiques, en passant par l'essor de l'architecture Lakehouse. Il présentera deux nouveaux paradigmes qui aideront à répondre aux besoins des agents d'IA : (1)  Lakebase, qui applique la séparation du stockage et du calcul aux bases de données OLTP, et (2)  LTAP (Lake Transactional Analytical Processing) qui unifie les traitements transactionnels et analytiques. 

Lakebase : Postgres serverless sur stockage open lake

Les charges de travail des agents d'IA créent des modèles d'utilisation uniques, tels que des millions de bases de données éphémères et profondément ramifiées. Les moteurs OLTP traditionnels sont monolithiques et ne peuvent pas répondre à ces exigences complexes. Stas Kelvich présentera l'architecture Lakebase, qui est une architecture de base de données cloud de troisième génération. Lakebase répond aux exigences des workflows d'agents en découplant le calcul PostgreSQL serverless du stockage, en conservant les données et les journaux d'écriture anticipée (write-ahead logs) directement dans le stockage d'objets cloud à l'aide de formats ouverts. Lakebase offre non seulement des démarrages à froid en moins d'une seconde, mais aussi des workflows de base de données efficaces de type Git utilisant le branchement par copie sur écriture (copy-on-write). De plus, grâce à sa séparation calcul-stockage, il permet des analyses à faible latence sur des données transactionnelles en direct. La figure 1 montre comment Lakebase inaugure la troisième génération de bases de données cloud.

 

Figure 1 : Lakebase Postgres est parfaitement adapté à l'ère des agents et est construit sur le lac de données ouvert (open data lake).

Une décennie d'Apache Spark Structured Streaming : comment nous avons fait évoluer l'architecture pour répondre aux besoins réels

Structured Streaming propulse des millions de tâches hebdomadaires chez Databricks. Il utilise une architecture de traitement par micro-lots unique qui présente des avantages en termes d'évolutivité, de tolérance aux pannes et de sémantique « exactly-once » (une seule fois) par rapport à d'autres conceptions. Cependant, Structured Streaming a nécessité de nombreuses innovations pour répondre aux exigences des clients du monde réel et atteindre l'échelle d'aujourd'hui. Siying Dong présentera comment l'architecture de streaming a évolué au fil des ans : le pipelining de micro-lots a amélioré le débit jusqu'à 3 fois, de nouvelles API avec état facilitent l'expression de logiques métier complexes, et le système prend désormais en charge le contrôle d'accès précis.

AutoLiquid : optimisation autonome de la disposition des données pour le Lakehouse Databricks

Le clustering de tables par clés peut améliorer considérablement les performances des requêtes. Cependant, la sélection manuelle des clés de clustering optimales sur des millions de tables de lakehouse n'est pas viable à grande échelle. Yunjia Zhang expliquera comment AutoLiquid automatise ce cycle de vie via une simple primitive CLUSTER BY AUTO. AutoLiquid utilise une combinaison d'heuristiques pour la sélection des clés et une vérification fantôme (shadow verification) efficace pour clusteriser des millions de tables. Grâce à ces techniques, AutoLiquid est capable de surpasser les clés sélectionnées par les clients sur plus de 95 % des charges de travail évaluées.

Ultron : optimisation des requêtes basée sur l'historique chez Databricks

La latence des requêtes Lakehouse pourrait être considérablement améliorée si l'optimiseur disposait d'une connaissance presque parfaite des données. Ultron est un framework d'optimisation de requêtes basé sur l'historique qui tire parti de la nature répétitive des charges de travail analytiques pour améliorer les choix de l'optimiseur, comme la sélection du type d'opérateur de jointure. Eric Liang décrira l'architecture d'Ultron, notamment la manière dont il stocke efficacement l'historique et gère les journaux des requêtes exécutées. Ultron a considérablement amélioré les performances des charges de travail de production, notamment en réduisant de 25 % la latence médiane des jointures.

En plus de ces quatre articles, rejoignez-nous pour voir Yuhong Chen faire une démonstration d'Enzyme, notre moteur de maintenance incrémentielle des vues pour les charges de travail d'ingénierie des données.

Infrastructure de données native pour les agents : LakehouseRT, Lakebase et LTAP (présentation sponsorisée)
Databricks est sponsor Gold de VLDB 2026. Ippokratis Pandis donnera la présentation sponsorisée de Databricks, où il décrira comment Databricks fait évoluer l'architecture de son système pour s'adapter aux boucles autonomes d'agents. Dans cette optique, nous présenterons LakehouseRT. LakehouseRT est propulsé par le nouveau moteur Reyden et est conçu pour des analyses en temps réel à faible latence directement sur le stockage open lake. La combinaison de Lakebase et de LakehouseRT jette les bases du tout premier véritable système LTAP (Lake Transactional Analytical Processing).

Rencontrez l'équipe au VLDB 2026

Passez sur le stand Databricks pour échanger avec nos équipes d'ingénierie et de recherche, discuter de nos articles et parler à nos recruteurs.

(Cet article de blog a été traduit à l'aide d'outils basés sur l'intelligence artificielle) Article original

Recevez les derniers articles dans votre boîte mail

Abonnez-vous à notre blog et recevez les derniers articles directement dans votre boîte mail.