Ir para o conteúdo principal
Empresa

Construindo para a era da AI: inovações em Lakebase, Streaming e Lakehouse no VLDB 2026

por Indrajit Roy e Ippokratis Pandis

  • Descubra as inovações da Databricks em Lakebase, Structured Streaming e otimizações de Lakehouse
  • Entenda como o Lakebase, um banco de dados em nuvem de terceira geração que desacopla a computação transacional do armazenamento, é ideal para fluxos de trabalho de agentes
  • Conheça nossas equipes de engenharia e recrutamento no VLDB

Estamos a caminho do VLDB 2026 para compartilhar várias inovações que impulsionam a plataforma Databricks.  O cofundador e arquiteto-chefe da Databricks, Reynold Xin, dará início à conferência com a palestra de abertura. A Databricks tem quatro artigos aceitos relacionados a Lakebase, Spark Structured Streaming e otimizações automáticas de Lakehouse. O artigo de demonstração sobre o mecanismo Enzyme mostrará como mantemos visualizações materializadas de forma incremental. Abaixo está uma prévia dessas apresentações. 

Palestra de abertura: As três eras de ouro da engenharia de bancos de dados

O cofundador da Databricks, Reynold Xin, discutirá como os agentes de AI estão inaugurando a "terceira era de ouro" da engenharia de bancos de dados. Alguns de vocês devem se lembrar de seu trabalho no início de 2012 em Berkeley no sistema analítico escalável chamado Shark. Reynold refletirá sobre como sua própria perspectiva sobre a tecnologia de banco de dados evoluiu ao longo dos anos, desde seus tempos em Berkeley, passando pelo surgimento da arquitetura Lakehouse e, agora, pelas mudanças nas demandas dos mecanismos transacionais e analíticos. Ele apresentará dois novos paradigmas que ajudarão a atender às necessidades dos agentes de AI: (1)  Lakebase, que aplica a separação de armazenamento e computação a bancos de dados OLTP, e (2)  LTAP (Lake Transactional Analytical Processing), que unifica o processamento transacional e analítico. 

Lakebase: Postgres serverless sobre armazenamento em lake aberto

As cargas de trabalho de agentes de AI estão criando padrões de uso exclusivos, como milhões de bancos de dados de curta duração e ramificações profundas. Os mecanismos OLTP tradicionais são monolíticos e não conseguem atender a esses requisitos desafiadores. Stas Kelvich apresentará a arquitetura Lakebase, que é uma arquitetura de banco de dados em nuvem de terceira geração. O Lakebase atende aos requisitos de fluxos de trabalho de agentes ao desacoplar a computação PostgreSQL serverless do armazenamento, persistindo dados e write-ahead logs diretamente no armazenamento de objetos em nuvem usando formatos abertos. O Lakebase não apenas oferece inicializações a frio em menos de um segundo, mas também fluxos de trabalho de banco de dados eficientes semelhantes ao Git usando ramificação copy-on-write. Além disso, com sua separação de computação e armazenamento, ele permite análises de baixa latência em dados transacionais em tempo real. A Figura 1 mostra como o Lakebase está inaugurando a terceira geração de bancos de dados em nuvem.

 

Figura 1: O Lakebase Postgres é ideal para a era dos agentes e foi desenvolvido com base no data lake aberto.

Uma década de Apache Spark Structured Streaming: como evoluímos a arquitetura para atender às necessidades do mundo real

O Structured Streaming processa milhões de jobs semanais na Databricks. Ele usa uma arquitetura exclusiva de processamento em micro-lotes que oferece vantagens de escalabilidade, tolerância a falhas e semântica de exatamente uma vez em comparação com outros designs. No entanto, o Structured Streaming exigiu muitas inovações para atender às demandas dos clientes do mundo real e alcançar a escala atual. Siying Dong apresentará como a arquitetura de streaming evoluiu ao longo dos anos: o pipelining de micro-lotes melhorou a vazão em até 3 vezes, novas APIs com estado facilitam a expressão de lógicas de negócios complexas e o sistema agora oferece suporte a controle de acesso refinado.

AutoLiquid: otimização autônoma de layout de dados para o Databricks Lakehouse

O agrupamento de tabelas por chaves pode melhorar significativamente o desempenho das consultas. No entanto, selecionar chaves de agrupamento ideais manualmente em milhões de tabelas de lakehouse não é escalável. Yunjia Zhang descreverá como o AutoLiquid automatiza esse ciclo de vida por meio de uma primitiva simples CLUSTER BY AUTO. O AutoLiquid usa uma combinação de heurísticas para seleção de chaves e verificação de sombra eficiente para agrupar milhões de tabelas. Usando essas técnicas, o AutoLiquid consegue superar o desempenho de chaves selecionadas pelos clientes em mais de 95% das cargas de trabalho avaliadas.

Ultron: otimização de consultas baseada em histórico na Databricks

A latência das consultas do Lakehouse poderia ser significativamente melhorada se o otimizador tivesse um conhecimento quase perfeito sobre os dados. O Ultron é um framework de otimização de consultas baseado em histórico que aproveita a natureza repetitiva das cargas de trabalho analíticas para melhorar as escolhas do otimizador, como a seleção do tipo de operador de junção. Eric Liang descreverá a arquitetura do Ultron, incluindo como ele armazena com eficiência o histórico e gerencia os logs de consultas executadas. O Ultron melhorou significativamente o desempenho das cargas de trabalho de produção, incluindo a redução da latência mediana de junção em 25%.

Além desses quatro artigos, junte-se a nós para assistir a Yuhong Chen demonstrar o Enzyme, nosso mecanismo de manutenção incremental de visualizações para cargas de trabalho de engenharia de dados.

Infraestrutura de dados nativa para agentes: LakehouseRT, Lakebase e LTAP (Palestra do patrocinador)
A Databricks é patrocinadora Gold do VLDB 2026. Ippokratis Pandis fará a palestra de patrocínio da Databricks, onde descreverá como a Databricks está evoluindo sua arquitetura de sistema para acomodar os loops autônomos de agentes. Com isso em mente, apresentaremos o LakehouseRT. O LakehouseRT é impulsionado pelo novo mecanismo Reyden e foi projetado para análises em tempo real de baixa latência diretamente no armazenamento em lake aberto. A combinação de Lakebase e LakehouseRT fornece a base para entregar o primeiro sistema real de Processamento Analítico Transacional de Lake (LTAP).

Conheça a equipe no VLDB 2026

Passe no estande da Databricks para se conectar com nossas equipes de engenharia e pesquisa, discutir nossos artigos e conversar com nossos recrutadores.

(Esta publicação no blog foi traduzida utilizando ferramentas baseadas em inteligência artificial) Publicação original

Receba os posts mais recentes na sua caixa de entrada

Assine nosso blog e receba os posts mais recentes diretamente na sua caixa de entrada.