Le nouveau data warehouse en temps réel de Databricks offre une réactivité de l'ordre de la milliseconde directement sur votre lakehouse, sans systèmes distincts ni déplacement de données.
par Nong Li, Shoumik Palkar, Shant Hovsepian, Mostafa Mokhtar et Reynold Xin
Lorsque nous avons introduit l' architecture lakehouse, notre vision était de créer une plateforme unique et unifiée pour tous vos besoins en données en éliminant la frontière entre les lacs de données et les entrepôts de données. Nous avons prouvé que cela était possible avec Databricks Lakehouse, en rassemblant des charges de travail diverses en analyses, BI, AI et ETL sur une plateforme unique utilisant des données ouvertes, éliminant ainsi les doublons et centralisant la gouvernance.
Aujourd'hui, nous unifions le service en temps réel avec notre plateforme de données principale. Actuellement, cela se fait le plus souvent en utilisant une couche de service distincte ou un moteur spécialisé. Cela entraîne des copies de données cloisonnées qui ajoutent de la complexité, des coûts et des risques à votre architecture de données.
Databricks a le plaisir d'annoncer que nous apportons des performances de l'ordre de la milliseconde directement au lakehouse. Nous présentons Lakehouse//RT, le nouvel entrepôt de données en temps réel de Databricks conçu pour les analyses opérationnelles, le service d'applications et de BI, et les charges de travail d'observabilité. Lakehouse//RT est propulsé par Reyden, un nouveau moteur révolutionnaire pour les charges de travail en temps réel qui exigent une réactivité immédiate avec une concurrence élevée.

À mesure que les organisations élargissent l'accès aux données aux utilisateurs, applications, tableaux de bord et agents, la demande de réactivité en temps réel sous une concurrence élevée continue de croître. La réponse traditionnelle consistait à introduire une couche de service dédiée. Bien que rapide pour les lectures, cette approche vous oblige à copier les données vers une nouvelle couche, ce qui l'isole du reste de votre plateforme tout en introduisant plus de complexité dans votre environnement.
Copier vos données dans une couche de service distincte n'est pas gratuit. Cela vous coûte trois fois, avant même d'avoir traité une seule requête.
Le comble : et après avoir payé ces trois coûts, la couche de service ne peut toujours pas exécuter toutes vos requêtes. Dès qu'une requête devient complexe (par exemple, des jointures ou des fonctions de fenêtrage) ou que le volume de données augmente, elle s'effondre.
Lakehouse//RT est un nouvel entrepôt en temps réel qui offre des performances de l'ordre de la milliseconde à grande échelle, sans déplacement de données. Vous pouvez prendre en charge les charges de travail en temps réel tout en continuant à utiliser les mêmes formats ouverts, le même modèle de gouvernance et la même architecture de données centrale qui alimentent déjà vos analyses et votre AI.
Les participants à la version préliminaire ont constaté des performances jusqu'à 16 fois supérieures à celles des couches de service en temps réel, avec des temps de réponse d'à peine 10 ms sur les ensembles de données plus petits et des performances inférieures à 100 ms sur les plus grands. Sur les benchmarks analytiques standards, Lakehouse//RT offre une latence inférieure à 100 millisecondes à 12 000 requêtes par seconde.
Mais il est facile de choisir un chiffre sur mesure dans un benchmark unique. Le véritable test consiste à voir si cette vitesse se maintient partout : sur davantage de données, avec des requêtes plus complexes et sous une charge plus lourde.
Cette nouvelle approche signifie que Lakehouse//RT peut maintenir une faible latence, même avec des milliers de requêtes par seconde, sur des ensembles de données volumineux ou restreints, là où d'autres entrepôts de données ou moteurs temps réel spécialisés peuvent ralentir considérablement ou même échouer complètement.
Voici ce que cela donne selon trois dimensions :
1. Sous charge : Il est facile d'offrir une faible latence avec une seule requête. Le défi se présente lorsqu'un tableau de bord ou une application envoie des milliers de requêtes simultanément au système. Vous ne voulez pas que vos utilisateurs finaux ouvrent votre application analytique et attendent des secondes, voire des minutes, pour qu'elle se charge. Nous avons testé la latence des requêtes de Lakehouse//RT par rapport aux principales alternatives en faisant passer le débit de quelques requêtes par seconde à des milliers. Les alternatives se comportent toutes de la même manière. La latence reste stable pendant un moment, puis grimpe, et enfin le moteur cesse complètement de répondre. Lakehouse//RT reste stable sur toute la plage, s'adaptant à des milliers de requêtes par seconde sans sacrifier la latence des requêtes.

2. À l'échelle : Ce test est basé sur TPCH, un benchmark standard d'aide à la décision. Nous avons exécuté une suite de requêtes sur un schéma de vente qui combine des analyses de grandes tables, des jointures multi-tables et des agrégations, ce qui correspond au reporting d'activité quotidien. Nous l'avons exécuté sur des ensembles de données allant de tailles réduites jusqu'à un téraoctet, l'évolution naturelle de tout ensemble de données à mesure que l'utilisation et l'historique s'accumulent. Lakehouse//RT maintient une latence faible à mesure que les données augmentent, et le graphique montre comment les performances se maintiennent à travers les différents facteurs d'échelle. Malheureusement, à grande échelle, 2 des 3 alternatives testées ont échoué. Cela met en évidence l'incapacité de ces architectures secondaires en temps réel à gérer des volumes de données significatifs.

3. Sur les requêtes les plus complexes : Ce test est basé sur TPCDS, un benchmark d'aide à la décision plus exigeant pour les entrepôts de données. Nous avons exécuté une suite de requêtes complexes composées de jointures multi-tables approfondies, de sous-requêtes et de fonctions de fenêtrage sur un schéma d'entrepôt réaliste, le type d'analyses qu'un analyste écrit lorsque la question va bien au-delà d'une simple recherche. Lakehouse//RT maintient une latence faible même lorsque les requêtes se complexifient, et le graphique montre que l'écart ne fait que se creuser, une alternative fonctionnant jusqu'à 25 fois plus lentement. Et une fois de plus, à la plus grande échelle, cette même alternative a complètement échoué. C'est une preuve supplémentaire que les architectures secondaires en temps réel conçues pour des recherches simples ne peuvent pas gérer les analyses complexes que les entreprises exécutent au quotidien.

Le résultat est cohérent sur les trois aspects. Rapide sous charge, rapide à l'échelle et rapide sur les requêtes les plus complexes, le tout dans un seul moteur et sur une seule copie de vos données. Nos clients de la version préliminaire ont constaté des gains de performance similaires avec Lakehouse//RT dans des scénarios réels, allant des tableaux de bord aux applications analytiques en temps réel.
En unifiant les performances en temps réel avec votre plateforme de données centrale, Lakehouse//RT élimine les compromis architecturaux pour offrir trois avantages clés : des réponses en temps réel, une architecture simplifiée et une gouvernance cohérente.
Lorsqu'il est crucial d'obtenir les insights les plus rapides et les plus récents, Lakehouse//RT répond présent. Les clients des secteurs exigeants où chaque milliseconde compte, quel que soit le nombre de requêtes simultanées, réduisent considérablement leur délai d'obtention des insights grâce au lakehouse en temps réel.
Voici les gains de performance constatés par certains de nos premiers clients de la version préliminaire :
« Meta Enterprise exécute des analyses pour nos propres équipes dans les domaines de la chaîne d'approvisionnement, de la finance et au-delà, où les analystes attendent des réponses instantanées, même en cas de forte concurrence sur nos tables les plus volumineuses. Avec Lakehouse//RT, les résultats de nos requêtes types reviennent en quelques dizaines de millisecondes avec les données sur le lac, sans système distinct en parallèle. »
— Srikanth Sakhamuri, Data Engineering Leader chez Meta
« SES, une entreprise de solutions spatiales, aide les gouvernements à protéger, les entreprises à se développer et les personnes à rester connectées, où qu'elles soient. Grâce à des satellites multi-orbites intégrés et à notre réseau terrestre mondial, nous offrons une connectivité résiliente et fluide. Nos tableaux de bord opérationnels s'appuient sur des milliards de lignes de télémétrie en direct et exigent des réponses en quelques millisecondes avec une concurrence élevée.
Lakehouse//RT offre exactement cela, directement sur nos données Databricks : 20 fois plus vite que nos temps de requête précédents et pour une fraction du coût, car nous n'avons plus besoin de gérer une couche de service distincte pour répondre à nos exigences de latence. »
— Dennis Rossberg, Senior Data Cloud Architect chez SES
"Enverus est la plateforme de données et d'AI du secteur de l'énergie, s'appuyant sur plus de 25 ans de veille exclusive avec 2,7 pétaoctets de données continuellement mises à jour, plus de 350 millions de registres judiciaires et plus de 500 milliards de dollars de transactions annuelles couvrant l'ensemble de la chaîne de valeur énergétique. Cela signifie que nos analyses doivent rester interactives, même lorsque le trafic des analystes et des applications intégrées augmente.
Avec Lakehouse//RT, les requêtes s'exécutent en quelques dizaines de millisecondes pour certaines requêtes, et jusqu'à 100 fois plus vite pour d'autres par rapport à notre moteur temps réel spécialisé. Cette performance nous permet de fusionner notre pile analytique distincte en un seul Lakehouse unifié."
— Paul Lamb, Directeur de l'analyse d'entreprise chez Enverus
Au lieu de copier et de déplacer des données et de créer des pipelines supplémentaires, les équipes peuvent s'appuyer sur une plateforme unique et agile pour obtenir la puissance de calcul dont elles ont besoin sans outils propriétaires. Cela réduit la complexité et la dispersion des systèmes.
"Notre plateforme traite des centaines de requêtes par seconde pour fournir des données de performance en temps réel à l'ensemble de notre clientèle, de sorte que la cohérence et la latence ont un impact direct sur l'expérience client.
Avec Lakehouse//RT, nous constatons des performances constantes de moins de 200 millisecondes sur les requêtes de nos tableaux de bord principaux. Le fait de pouvoir y parvenir directement sur des données de lakehouse gouvernées simplifie considérablement notre pipeline et notre architecture de service."
— Kayvon Raphael, Directeur principal de l'ingénierie chez Magnite
"La recherche de menaces exige une latence constamment faible, même lorsque l'utilisation augmente parmi les utilisateurs et les agents. Ce que nous constatons avec Lakehouse//RT, ce sont des performances de l'ordre de la milliseconde sur des données en direct avec une amélioration de 5x du temps de réponse, ce qui ouvre la voie à l'exécution de ces charges de travail sur notre lakehouse au lieu de maintenir un système de service distinct."
— Chris Kopek, Responsable des plateformes de données, Cisco
"Chez Halcyon, nos équipes surveillent les données de sécurité sur des millions de points de terminaison, corrélant des signaux disparates afin d'identifier les menaces critiques en quelques secondes. À mesure que les besoins de sécurité de nos clients augmentaient, la charge sur nos systèmes augmentait également.
Lakehouse//RT a fourni les performances et la simultanéité dont nous avions besoin. Nos requêtes critiques s'exécutent désormais environ 4x plus vite, directement sur notre Lakehouse, sans système de mise en cache distinct."
— Seagen Levites, Directeur principal de l'analyse quantitative chez Halcyon AI
Dans le même temps, la gouvernance reste centralisée. Les politiques de sécurité, les autorisations, les contrôles d'accès et la logique métier restent définis et appliqués de manière cohérente avec Unity Catalog. Vos équipes n'ont pas besoin de dupliquer les règles ou de gérer une gouvernance fragmentée. Vous la configurez une fois, et elle fonctionne partout.
"Lakehouse//RT a fonctionné en moyenne plus d'un tiers plus rapidement que notre ancien entrepôt de données sur notre jeu de données de santé, avec des requêtes 10× plus rapides [sur certaines charges de travail]. Cela se traduit directement par un accès plus rapide aux informations et plus de temps de décision pour nos clients. Nous avions envisagé un système temps réel dédié pour compléter notre architecture Lakehouse, mais Lakehouse//RT a éliminé ce besoin, nous offrant cette vitesse de manière native avec une gouvernance cohérente."
— Mehrshad Setayesh, SVP Ingénierie (Données, Plateforme, AI) chez PointClickCare
"Bally’s est l'un des plus grands groupes mondiaux de technologies de jeux et de loterie du secteur, avec des millions de transactions par jour sur environ 60TB dans Delta Lake sous Unity Catalog. Nos équipes opérationnelles ont besoin de réponses en quelques secondes et, pour y parvenir, nous exploitions des systèmes de service distincts à faible latence en parallèle du lakehouse. Lakehouse//RT élimine ce compromis : des performances 7x plus rapides, de l'ordre de la sous-seconde sur les mêmes données, directement à partir de nos tables Delta gouvernées. Pas de copies, pas de clusters supplémentaires, pas de second système à sécuriser.
Cette simplicité est particulièrement importante dans un secteur hautement réglementé, où le maintien des normes les plus élevées en matière de gouvernance, de sécurité et de confidentialité des données est fondamental pour notre fonctionnement."
— Mark Borg, Vice-président principal des données chez Bally’s
"Equilibrium Energy réinvente la façon dont le trading d'énergie est effectué : des agents d'AI travaillant aux côtés de traders humains, sur des données en direct tirées de dizaines de sources disparates, aux vitesses réellement exigées par le marché. C'est une charge de travail que la plupart des architectures temps réel ne peuvent pas suivre. Lakehouse//RT a offert une latence médiane jusqu'à 3,6x plus rapide que SQL Serverless sur les requêtes de notre portail, suffisamment rapide pour que les traders puissent réfléchir avec les données au lieu de les attendre – en exécutant des scénarios, en explorant aux côtés d'agents d'AI et en prenant des décisions en quelques secondes.
Tout conserver sur une plateforme unique – au lieu de greffer une couche temps réel distincte sur notre pile – nous permet d'avancer à cette vitesse sans sacrifier la gouvernance."
— Tarek Rached, Directeur de la plateforme de données chez Equilibrium Energy
En plus de nos clients en version Preview, certains des plus grands partenaires mondiaux de Databricks partagent déjà notre vision pour Lakehouse//RT. Ils reconnaissent l'incroyable potentiel que cela apporte au marché et sont impatients de collaborer avec nous alors que nous ouvrons la voie à l'entreposage de données en temps réel.
"L'alliance de Deloitte avec Databricks continue de générer une dynamique incroyable alors que nous aidons les organisations à transformer leurs données en actifs stratégiques prêts pour l'AI. Le lancement de Lakehouse//RT marque un bond en avant significatif, offrant les capacités en temps réel nécessaires pour alimenter les analyses avancées et accélérer le délai de rentabilisation. Nous sommes ravis d'approfondir notre collaboration avec Databricks et d'apporter cette dernière innovation à nos clients afin de générer des résultats commerciaux mesurables et percutants."
— Thomas Zipprich, Principal et responsable mondial de l'alliance Databricks, Deloitte Consulting LLP
"Alors que nous constatons une accélération de la dynamique de notre partenariat avec Databricks grâce au lancement de notre nouveau Business Group, la demande des entreprises pour des données en temps réel et l'AI n'a jamais été aussi évidente. Le lancement de Lakehouse//RT offre la vitesse et l'architecture ouverte dont nos clients ont besoin pour mener une réinvention intelligente de leur entreprise. Nous sommes impatients de poursuivre notre parcours avec Databricks pour ouvrir de nouvelles possibilités."
— Jigyasa Singh, Responsable mondial du groupe d'activités Databricks, Accenture
"Sigma se connecte désormais directement à Lakehouse//RT, Agent Bricks, Genie Agents et Lakebase, de sorte que les clients communs peuvent obtenir des performances de requête inférieures à la seconde à grande échelle, explorer des milliards de lignes via une interface de feuille de calcul familière, créer des agents qui agissent sur ces données et gérer l'intégralité du flux de travail des agents - mémoire, état et tout le reste - sans jamais quitter l'environnement gouverné auquel ils font déjà confiance.
La partie la plus difficile de l'AI en entreprise n'est pas de construire le modèle. C'est de faire fonctionner les agents sur de réelles données d'entreprise, avec de réelles autorisations, à grande échelle. C'est exactement ce que Sigma et Databricks résolvent ensemble."
— Mike Palmer, CEO de Sigma
En plus des avantages en termes de performances, de simplicité et de gouvernance, Lakehouse//RT libère également vos équipes du fardeau de la décision :
Dimensionnement AUTO. Vous n'avez plus à choisir une taille de t-shirt. Databricks détermine automatiquement le bon calcul de base pour votre charge de travail, de sorte qu'il n'y a pas de devinettes, ni de cycle d'augmentation de taille lorsque les requêtes ralentissent ou de réduction de taille pour économiser des coûts.
Mise à l'échelle automatique incrémentielle. Les entrepôts de données traditionnels gèrent une plus grande simultanéité en créant des copies entières d'eux-mêmes, 2X, puis 3X, puis 4X. Une légère augmentation de la demande peut doubler votre facture. Lakehouse//RT s'adapte en ajoutant et en supprimant des nœuds individuels à mesure que la charge change, de sorte que vous obtenez exactement la capacité dont vous avez besoin et payez exactement pour cela.
Databricks offre depuis longtemps l'échelle et l'ouverture requises pour l'analytique moderne et l'AI. Les organisations n'ont plus besoin de choisir entre des performances à faible latence et une architecture de données ouverte et unifiée. Vous n'avez pas besoin d'une pile plus fragmentée. Vous avez besoin d'un entrepôt de données plus performant.
Lakehouse//RT est désormais disponible en version bêta pour certaines charges de travail en lecture seule, et d'autres fonctionnalités seront ajoutées dans les mois à venir. Contactez votre équipe de compte Databricks pour commencer et intégrer vos charges de travail en temps réel au lakehouse. À titre d'offre de lancement, bénéficiez de 30 % de réduction sur l'utilisation de Lakehouse//RT jusqu'en janvier 2027. Une fois l'accès configuré, sélectionnez simplement Lakehouse//RT dans le sélecteur d'entrepôt et c'est parti !
(Cet article de blog a été traduit à l'aide d'outils basés sur l'intelligence artificielle) Article original
Abonnez-vous à notre blog et recevez les derniers articles directement dans votre boîte mail.