Passa al contenuto principale
Chi siamo

Costruire per l'era dell'AI: le innovazioni di Lakebase, streaming e Lakehouse a VLDB 2026

di Indrajit Roy e Ippokratis Pandis

  • Scopri le innovazioni di Databricks relative a Lakebase, Structured Streaming e ottimizzazioni di Lakehouse
  • Scopri come Lakebase, un database cloud di terza generazione che disaccoppia l'elaborazione transazionale dall'archiviazione, sia ideale per i flussi di lavoro agentici
  • Incontra i nostri team di ingegneria e recruiting a VLDB

Siamo diretti a VLDB 2026 per condividere diverse innovazioni che alimentano la piattaforma Databricks. Il co-fondatore e Chief Architect di Databricks, Reynold Xin, aprirà la conferenza con il keynote di apertura. Databricks presenterà quattro paper accettati relativi a Lakebase, Spark Structured Streaming e ottimizzazioni automatiche di Lakehouse. Il demo paper sul motore Enzyme mostrerà come gestiamo in modo incrementale le viste materializzate. Ecco un'anteprima di queste presentazioni. 

Keynote: Le tre età dell'oro dell'ingegneria dei database

Il co-fondatore di Databricks Reynold Xin parlerà di come gli agenti AI stiano inaugurando la "terza età dell'oro" dell'ingegneria dei database. Alcuni di voi ricorderanno il suo lavoro del 2012 a Berkeley sul sistema analitico scalabile chiamato Shark. Reynold rifletterà su come la sua prospettiva sulla tecnologia dei database si sia evoluta nel corso degli anni, dai tempi di Berkeley, passando per l'ascesa dell'architettura Lakehouse, fino alle mutevoli esigenze attuali dei motori transazionali e analitici. Introdurrà due nuovi paradigmi che aiuteranno a soddisfare le esigenze degli agenti AI: (1) Lakebase, che applica la separazione tra archiviazione ed elaborazione ai database OLTP, e (2) LTAP (Lake Transactional Analytical Processing), che unifica l'elaborazione transazionale e analitica. 

Lakebase: Postgres serverless su open lake storage

I carichi di lavoro degli agenti AI stanno creando modelli di utilizzo unici, come milioni di database a breve termine e con ramificazioni profonde. I motori OLTP tradizionali sono monolitici e non riescono a soddisfare questi requisiti complessi. Stas Kelvich presenterà l'architettura Lakebase, un'architettura di database cloud di terza generazione. Lakebase soddisfa i requisiti dei flussi di lavoro agentici disaccoppiando l'elaborazione serverless di PostgreSQL dall'archiviazione, salvando i dati e i log write-ahead direttamente nell'object storage cloud tramite formati aperti. Lakebase non solo offre avvii a freddo inferiori al secondo, ma anche flussi di lavoro di database efficienti in stile Git che utilizzano la ramificazione copy-on-write. Inoltre, grazie alla separazione tra elaborazione e archiviazione, consente analisi a bassa latenza su dati transazionali in tempo reale. La Figura 1 mostra come Lakebase stia inaugurando la terza generazione di database cloud.

 

Figura 1: Lakebase Postgres è ideale per l'era agentica ed è integrato sopra l'open data lake.

Un decennio di Apache Spark Structured Streaming: come abbiamo evoluto l'architettura per soddisfare le esigenze reali

Structured Streaming gestisce milioni di job settimanali su Databricks. Utilizza un'architettura di elaborazione micro-batch unica, che offre vantaggi in termini di scalabilità, tolleranza ai guasti e semantica exactly-once rispetto ad altri design. Tuttavia, Structured Streaming ha richiesto molte nuove innovazioni per soddisfare le esigenze dei clienti reali e raggiungere la scala odierna. Siying Dong presenterà l'evoluzione dell'architettura di streaming nel corso degli anni: il pipelining dei micro-batch ha migliorato il throughput fino a 3 volte, le nuove API stateful semplificano l'espressione di logiche di business complesse e il sistema ora supporta il controllo degli accessi granulare.

AutoLiquid: ottimizzazione autonoma del layout dei dati per il Lakehouse di Databricks

Il clustering delle tabelle in base alle chiavi può migliorare notevolmente le prestazioni delle query. Tuttavia, la selezione manuale delle chiavi di clustering ottimali su milioni di tabelle Lakehouse non è scalabile. Yunjia Zhang descriverà come AutoLiquid automatizza questo ciclo di vita tramite una semplice primitiva CLUSTER BY AUTO. AutoLiquid utilizza una combinazione di euristiche per la selezione delle chiavi e una verifica shadow efficiente per raggruppare milioni di tabelle. Utilizzando queste tecniche, AutoLiquid è in grado di superare le prestazioni delle chiavi selezionate dai clienti su oltre il 95% dei carichi di lavoro valutati.

Ultron: ottimizzazione delle query basata sulla cronologia in Databricks

La latenza delle query Lakehouse potrebbe essere notevolmente migliorata se solo l'ottimizzatore avesse una conoscenza quasi perfetta dei dati. Ultron è un framework di ottimizzazione delle query basato sulla cronologia che sfrutta la natura ripetitiva dei carichi di lavoro analitici per migliorare le scelte dell'ottimizzatore, come la selezione del tipo di operatore di join. Eric Liang descriverà l'architettura di Ultron, incluso il modo in cui memorizza in modo efficiente la cronologia e gestisce i log delle query eseguite. Ultron ha migliorato significativamente le prestazioni dei carichi di lavoro di produzione, riducendo la latenza mediana dei join del 25%.

Oltre a questi quattro paper, unisciti a noi per assistere alla dimostrazione di Yuhong Chen su Enzyme, il nostro motore di manutenzione incrementale delle viste per i carichi di lavoro di data engineering.

Infrastruttura dati nativa per gli agenti: LakehouseRT, Lakebase e LTAP (Sponsor talk)
Databricks è Gold Sponsor di VLDB 2026. Ippokratis Pandis terrà il talk sponsorizzato di Databricks, in cui descriverà come Databricks sta evolvendo l'architettura del suo sistema per accogliere i cicli agentici autonomi. Con questo obiettivo, presenteremo LakehouseRT. LakehouseRT è alimentato dal nuovo motore Reyden ed è progettato per l'analisi in tempo reale a bassa latenza direttamente sull'open lake storage. La combinazione di Lakebase e LakehouseRT fornisce le fondamenta per offrire il primo vero sistema LTAP (Lake Transactional Analytical Processing).

Incontra il team a VLDB 2026

Passa dallo stand Databricks per entrare in contatto con i nostri team di ingegneria e ricerca, discutere i nostri paper e parlare con i nostri recruiter.

(Questo post sul blog è stato tradotto utilizzando strumenti basati sull'intelligenza artificiale) Post originale

Ricevi gli ultimi articoli nella tua casella di posta

Iscriviti al nostro blog e ricevi gli ultimi articoli direttamente nella tua casella di posta.