Revenir au contenu principal

Databricks lance LTAP : la première architecture Lake Transactional/Analytical Processing - Cloné

16 juin 2024

Databricks lance LTAP : la première architecture Lake Transactional/Analytical Processing - Cloné
  • Databricks a lancé aujourd'hui LTAP (Lake Transactional/Analytical Processing), une nouvelle architecture de traitement des données qui unifie OLAP et OLTP sur une copie unique des données dans le lac, éliminant par conception l'ETL, les réplicas et les pipelines.
  • Lakebase, le fondement de l'architecture LTAP, sert désormais des milliers de clients et gère 12 millions de lancements de bases de données par jour sur l'ensemble de la plateforme.
  • Databricks est la première plateforme LTAP au monde. Elle associe Lakebase (Postgres serverless sur un stockage d'objets ouvert) au Lakehouse sous un modèle de gouvernance, une source unique de vérité et une couche de stockage uniques pour toutes les données opérationnelles, analytiques et de streaming.

DATA + AI SUMMIT – 16 juin 2026Databricks, l'entreprise de la donnée et de l'IA, a présenté aujourd'hui Lake Transactional/Analytical Processing (LTAP), une nouvelle architecture de traitement des données qui unifie les transactions, l'analytique, le streaming et les données opérationnelles sur une copie unique de stockage dans le lac. Avec LTAP, les entreprises disposent d'un socle gouverné unique pour lire, raisonner et agir, sans pipelines, sans réplicas ni la surcharge liée à l'ETL qui a défini l'infrastructure de données pendant des décennies. Propulsé par des avancées majeures dans Lakebase, LTAP offre un nouveau socle de données pour l'ère des applications d'IA.

Le nouveau socle de données pour l'ère des agents

Pendant quatre décennies, les charges de travail transactionnelles et analytiques ont coexisté dans des systèmes distincts : les bases de données opérationnelles alimentaient les applications, les systèmes analytiques répondaient aux questions. Les relier impliquait de créer des pipelines CDC fragiles et susceptibles de se rompre sous la pression. C'était déjà un mauvais compromis lorsque les humains écrivaient des logiciels à un rythme humain. Aujourd'hui, l'IA aide les développeurs à écrire environ 50 fois plus d'applications que jamais auparavant, dont beaucoup sont propulsées par des agents qui doivent lire, raisonner et agir sur les données en quasi-temps réel. L'ancienne architecture n'a pas été conçue pour cela.

Le secteur des données a déjà tenté de résoudre le problème des systèmes disparates. HTAP promettait d'unifier les données transactionnelles et analytiques dans un moteur unique, mais a détruit l'isolation des charges de travail au passage, compromis les performances des deux et laissé aux organisations une empreinte propriétaire massive et coûteuse. Le Zero ETL a adopté une approche différente, masquant le pipeline CDC plutôt que de l'éliminer. Le problème architectural sous-jacent est resté entier.

LTAP adopte une approche fondamentalement différente : plutôt que de forcer les deux charges de travail dans un seul moteur ou de masquer le pipeline, elle unifie les données au niveau de la couche de stockage. Toutes les données opérationnelles sont immédiatement interrogeables et disponibles dans le lac pour l'analytique, sans aucun pipeline. Les charges de travail transactionnelles et analytiques évoluent indépendamment avec des performances optimales et une isolation stricte. Et comme LTAP repose sur des standards ouverts, elle fonctionne avec n'importe quelle application compatible avec Postgres et n'importe quel lecteur prenant en charge les formats de table ouverts comme Iceberg et Delta.

« Pendant des décennies, la complexité de l'infrastructure de données était une taxe que les équipes étaient contraintes de payer », a déclaré Ali Ghodsi, cofondateur et CEO de Databricks. « Puis les agents sont arrivés. En quelques mois, les organisations ont de fait doublé leurs effectifs, mais pas avec des humains. Les agents écrivent du code, passent des appels et exécutent des boucles à un rythme que les équipes humaines n'auraient jamais pu atteindre. L'infrastructure qui a propulsé la dernière ère de l'informatique est désormais le goulot d'étranglement que personne ne peut se permettre. LTAP l'élimine. »

Lakebase ajoute la reprise après sinistre, le branching de style Git et les snapshots

La première étape vers LTAP a été Lakebase, qui a apporté des transactions natives Postgres au stockage d'objets, la même couche qui alimente le Lakehouse. En séparant le calcul du stockage, Lakebase transforme l'économie de l'exécution simultanée de milliers d'applications et d'agents. Lancé l'année dernière seulement, Lakebase sert déjà des milliers de clients, dont Block, Ensemble, Superhuman et Zillow, et gère 12 millions de lancements de bases de données par jour.

Aujourd'hui, Databricks a annoncé de nouvelles fonctionnalités qui étendent Lakebase pour l'IA d'entreprise à grande échelle. Une nouvelle reprise après sinistre multi-cloud et multi-région permet aux organisations de concevoir des architectures de données plus résilientes, ce qui est de plus en plus crucial à mesure que les agents prennent en charge des opérations critiques. De plus, le branching de style Git et les snapshots permettent d'expérimenter en toute sécurité sur des données de production, tandis que les opérations de base de données autonomes permettent aux agents de surveiller l'état de santé, de détecter les ralentissements, de proposer des index et d'aider à la récupération.

Comment LTAP complète l'architecture

Lakebase et le Lakehouse partageaient déjà une couche de stockage, mais chacun conservait sa propre copie des données dans son propre format. LTAP comble cet écart. Lakebase stocke les données directement dans Unity Catalog, en utilisant les mêmes formats ouverts que le Lakehouse. Le résultat est une architecture plus épurée, définie par trois propriétés qui éliminent ensemble les compromis ayant caractérisé l'infrastructure de données d'entreprise pendant des décennies :

  • Gouvernance unifiée, source unique de vérité : toutes les données opérationnelles, analytiques et de streaming résident sur un stockage d'objets ouvert dans des formats ouverts — Delta et Iceberg — sans transformation ni dégradation. Tout est gouverné via Unity Catalog avec un modèle unique d'identité, d'autorisations et d'audit, de sorte que chaque moteur lit la même copie et que les agents partagent une surface gouvernée unique pour agir.
  • Aucun compromis sur les performances, quelle que soit la charge de travail : les charges de travail transactionnelles s'exécutent dans Postgres standard avec une sémantique ACID complète. Les charges de travail analytiques s'exécutent sur l'ensemble du Lakehouse, quels que soient l'échelle et le niveau de concurrence. Chacune évolue indépendamment, et comme il n'y a pas de mouvement de données entre les systèmes, les résultats opérationnels et analytiques sont toujours synchronisés — sans copies ni infrastructure fantôme.
  • Aucun pipeline ETL (même masqué) : il n'y a pas de pipelines synchronisant les magasins opérationnels et analytiques, pas de réplicas à maintenir, ni de connecteurs déplaçant les données entre les systèmes. L'architecture élimine entièrement la couche ETL, réduisant ainsi les coûts opérationnels liés à la synchronisation des systèmes tout en garantissant que les données restent à jour.

« Pour les systèmes de santé que nous desservons, la rapidité et la précision du cycle de revenus affectent directement leur capacité à dispenser des soins », a déclaré Grant Veazey, CTO d'Ensemble. « Notre investissement initial avec Databricks nous a aidés à concevoir un socle gouverné prenant en charge plus de deux pétaoctets de données de cycle de revenus propres et harmonisées. Lakebase et LTAP étendent ce socle en unifiant les charges de travail opérationnelles et analytiques sur une seule couche, offrant à notre IA native RCM l'accès en temps réel dont elle a besoin pour fonctionner lors d'opérations en direct. Cela se traduit par une performance financière accrue pour les prestataires et davantage de revenus récupérés réinjectés dans les services d'urgence, les NICU et d'autres services de soins intensifs. »

Disponibilité

LTAP sera bientôt disponible dans le cadre de Lakebase.

À propos de Databricks

Databricks est l'entreprise de la donnée et de l'IA. Plus de 20 000 organisations dans le monde — dont adidas, AT&T, Bayer, Block, Mastercard, Rivian, Unilever et 70 % du Fortune 500 — font confiance à Databricks pour concevoir et déployer des applications de données et d'IA, des analyses et des agents. Basée à San Francisco et comptant plus de 30 bureaux dans le monde, Databricks propose une plateforme unifiée qui comprend Lakebase, Genie, Agent Bricks, Lakeflow, Lakehouse et Unity Catalog. Pour en savoir plus, suivez Databricks sur LinkedIn, X, YouTube et Instagram.

Prêt à devenir une entreprise Data + AI ?