Direkt zum Hauptinhalt
Unternehmen

Entwickeln für das KI-Zeitalter: Lakebase-, Streaming- und Lakehouse-Innovationen auf der VLDB 2026

von Indrajit Roy und Ippokratis Pandis

  • Entdecken Sie die Databricks-Innovationen rund um Lakebase, Structured Streaming und Lakehouse-Optimierungen
  • Erfahren Sie, warum Lakebase, eine Cloud-Datenbank der dritten Generation, die transaktionale Rechenleistung vom Speicher entkoppelt, ideal für agentenbasierte Workflows geeignet ist
  • Treffen Sie unsere Engineering- und Recruiting-Teams auf der VLDB

Wir reisen zur VLDB 2026, um mehrere Innovationen vorzustellen, die die Databricks-Plattform antreiben.  Reynold Xin, Mitgründer und Chief Architect von Databricks, wird die Konferenz mit der Eröffnungs-Keynote einleiten. Databricks hat vier angenommene wissenschaftliche Arbeiten (Papers) zu den Themen Lakebase, Spark Structured Streaming und automatische Lakehouse-Optimierungen. Das Demo-Paper zur Enzyme-Engine zeigt, wie wir materialisierte Sichten inkrementell aktualisieren. Unten finden Sie eine Vorschau auf diese Präsentationen. 

Keynote: Die drei goldenen Zeitalter der Datenbankentwicklung

Reynold Xin, Mitgründer von Databricks, wird darüber sprechen, wie KI-Agenten das „dritte goldene Zeitalter“ der Datenbankentwicklung einläuten. Einige von Ihnen erinnern sich vielleicht an seine frühen Arbeiten im Jahr 2012 in Berkeley an dem skalierbaren Analysesystem namens Shark. Reynold wird darüber reflektieren, wie sich seine eigene Perspektive auf die Datenbanktechnologie im Laufe der Jahre verändert hat – von seiner Zeit in Berkeley über den Aufstieg der Lakehouse-Architektur bis hin zu den heutigen veränderten Anforderungen an Transaktions- und Analyse-Engines. Er wird zwei neue Paradigmen vorstellen, die dazu beitragen, die Anforderungen von KI-Agenten zu erfüllen: (1)  Lakebase, das die Trennung von Speicher und Berechnung auf OLTP-Datenbanken anwendet, und (2)  LTAP (Lake Transactional Analytical Processing), das die transaktionale und analytische Verarbeitung vereinheitlicht. 

Lakebase: Serverless Postgres über Open Lake Storage

Workloads von KI-Agenten erzeugen einzigartige Nutzungsmuster, wie etwa Millionen von kurzlebigen, tief verzweigten Datenbanken. Traditionelle OLTP-Engines sind monolithisch und können diese anspruchsvollen Anforderungen nicht erfüllen. Stas Kelvich wird die Lakebase-Architektur vorstellen, eine Cloud-Datenbankarchitektur der dritten Generation. Lakebase erfüllt die Anforderungen von agentenbasierten Workflows, indem es serverlose PostgreSQL-Berechnungen vom Speicher entkoppelt und Daten sowie Write-Ahead-Logs direkt in Cloud-Objektspeichern unter Verwendung offener Formate speichert. Lakebase bietet nicht nur Kaltstarts im Subsekundenbereich, sondern auch effiziente Git-ähnliche Datenbank-Workflows mittels Copy-on-Write-Branching. Darüber hinaus ermöglicht es durch die Trennung von Rechenleistung und Speicher Analysen mit geringer Latenz auf transaktionalen Live-Daten. Abbildung 1 zeigt, wie Lakebase die dritte Generation von Cloud-Datenbanken einläutet.

 

Abbildung 1: Lakebase Postgres eignet sich hervorragend für das Zeitalter der KI-Agenten und basiert auf dem Open Data Lake.

Ein Jahrzehnt Apache Spark Structured Streaming: Wie wir die Architektur an die Anforderungen der Praxis angepasst haben

Structured Streaming treibt wöchentlich Millionen von Jobs bei Databricks an. Es nutzt eine einzigartige Micro-Batch-Verarbeitungsarchitektur, die im Vergleich zu anderen Designs Vorteile bei der Skalierbarkeit, Fehlertoleranz und Exactly-Once-Semantik bietet. Structured Streaming erforderte jedoch viele neue Innovationen, um den Anforderungen von Kunden in der Praxis gerecht zu werden und die heutige Skalierung zu erreichen. Siying Dong wird vorstellen, wie sich die Streaming-Architektur im Laufe der Jahre entwickelt hat – Micro-Batch-Pipelining verbesserte den Durchsatz um das bis zu Dreifache, neue zustandsbehaftete APIs erleichtern das Ausdrücken komplexer Geschäftslogik und das System unterstützt nun eine feingranulare Zugriffskontrolle.

AutoLiquid: Autonome Optimierung des Datenlayouts für das Databricks Lakehouse

Das Clustern von Tabellen nach Schlüsseln kann die Abfrageleistung erheblich verbessern. Die manuelle Auswahl optimaler Clustering-Schlüssel über Millionen von Lakehouse-Tabellen hinweg ist jedoch nicht skalierbar. Yunjia Zhang wird beschreiben, wie AutoLiquid diesen Lebenszyklus über ein einfaches CLUSTER BY AUTO-Primitiv automatisiert. AutoLiquid nutzt eine Kombination aus Heuristiken zur Schlüsselauswahl und effizienter Schattenverifizierung, um Millionen von Tabellen zu clustern. Mit diesen Techniken kann AutoLiquid die vom Kunden selbst ausgewählten Schlüssel bei über 95 % der evaluierten Workloads übertreffen.

Ultron: Historienbasierte Abfrageoptimierung bei Databricks

Die Latenz von Lakehouse-Abfragen könnte erheblich verbessert werden, wenn der Optimierer nahezu perfekte Kenntnisse über die Daten hätte. Ultron ist ein historienbasiertes Framework zur Abfrageoptimierung, das die repetitive Natur analytischer Workloads nutzt, um die Entscheidungen des Optimierers zu verbessern, wie z. B. die Auswahl des Join-Operatortyps. Eric Liang wird die Architektur von Ultron beschreiben, einschließlich der Frage, wie das System den Verlauf effizient speichert und die Protokolle ausgeführter Abfragen verwaltet. Ultron hat die Leistung von Produktions-Workloads erheblich verbessert, unter anderem durch eine Reduzierung der medianen Join-Latenz um 25 %.

Erleben Sie neben diesen vier Arbeiten auch Yuhong Chen bei der Demonstration von Enzyme, unserer Engine zur inkrementellen Aktualisierung von Sichten für Data-Engineering-Workloads.

Agenten-native Dateninfrastruktur: LakehouseRT, Lakebase und LTAP (Sponsorenvortrag)
Databricks ist Gold-Sponsor der VLDB 2026. Ippokratis Pandis wird den Sponsorenvortrag von Databricks halten und beschreiben, wie Databricks seine Systemarchitektur weiterentwickelt, um den autonomen, agentenbasierten Schleifen gerecht zu werden. In diesem Sinne werden wir LakehouseRT vorstellen. LakehouseRT wird von der neuen Reyden-Engine angetrieben und ist für Echtzeit-Analysen mit geringer Latenz direkt über Open Lake Storage konzipiert. Die Kombination aus Lakebase und LakehouseRT bildet das Fundament für das erste echte LTAP-System (Lake Transactional Analytical Processing).

Treffen Sie das Team auf der VLDB 2026

Besuchen Sie den Databricks-Stand, um sich mit unseren Engineering- und Forschungsteams auszutauschen, über unsere Arbeiten zu diskutieren und mit unseren Recruitern zu sprechen.

(Dieser Blogbeitrag wurde mit KI-gestützten Tools übersetzt.) Originalbeitrag

Erhalten Sie die neuesten Beiträge in Ihrem Posteingang

Abonnieren Sie unseren Blog und erhalten Sie die neuesten Beiträge direkt in Ihren Posteingang.