Ir para o conteúdo principal
Anúncios

Apresentando o Lakehouse//RT: desempenho em tempo real em um Lakehouse unificado

O novo data warehouse em tempo real da Databricks oferece resposta em milissegundos diretamente no seu lakehouse, sem sistemas separados ou movimentação de dados.

por Nong Li, Shoumik Palkar, Shant Hovsepian, Mostafa Mokhtar e Reynold Xin

  • A Databricks lança o Lakehouse//RT, alimentado pelo novo mecanismo em tempo real Reyden, para fornecer velocidades de consulta de milissegundos diretamente no seu lakehouse sem movimentação de dados
  • Usuários da versão preview observaram um desempenho até 16 vezes melhor em comparação com camadas de serviço em tempo real, com tempos de resposta de apenas 10 ms em conjuntos de dados menores e desempenho abaixo de 100 ms em conjuntos maiores
  • Isso elimina arquiteturas complexas e pipelines adicionais ao unificar o serviço em tempo real com a governança centralizada do Unity Catalog

Quando introduzimos a arquitetura lakehouse, nossa visão era criar uma plataforma única e unificada para todas as suas necessidades de dados, eliminando a divisão entre data lakes e data warehouses. Provamos que isso era possível com o Databricks Lakehouse, reunindo diversas cargas de trabalho em analytics, BI, AI e ETL em uma única plataforma usando dados abertos, eliminando a duplicação e centralizando a governança.

Agora, estamos unificando o serving em tempo real com nossa plataforma de dados principal. Hoje, isso é mais comumente realizado usando uma camada de serving separada ou um mecanismo especializado. Isso resulta em cópias de dados isoladas em silos que adicionam complexidade, custo e risco à sua arquitetura de dados.

A Databricks tem o prazer de anunciar que estamos trazendo desempenho de milissegundos diretamente para o lakehouse. Estamos apresentando o Lakehouse//RT, o novo data warehouse em tempo real da Databricks projetado para analytics operacional, BI e serving de aplicativos, além de cargas de trabalho de observabilidade. O Lakehouse//RT é alimentado pelo Reyden, um novo mecanismo revolucionário para cargas de trabalho em tempo real que exigem capacidade de resposta imediata com alta simultaneidade.

image18.gif

Camadas de serving separadas: um compromisso quebrado

À medida que as organizações expandem o acesso aos dados para usuários, aplicativos, dashboards e agentes, a demanda por capacidade de resposta em tempo real sob alta simultaneidade continua a crescer. A resposta tradicional era introduzir uma camada de serving dedicada. Embora seja rápida para leituras, essa abordagem exige que você copie os dados para uma nova camada, isolando-os do restante da sua plataforma e introduzindo mais complexidade em todo o seu ambiente.

Copiar seus dados para uma camada de serving separada não é de graça. Isso custa três vezes mais, antes mesmo de você executar uma única consulta.

  1. Você paga com a duplicação. Você extrai seus dados de formatos abertos como Delta e Iceberg e os copia para um armazenamento proprietário que nenhum outro mecanismo consegue ler. Agora você tem um segundo pipeline de ingestão, um novo conjunto de modos de falha toda vez que uma sincronização quebra e uma nova sobrecarga operacional sempre que os dados de origem mudam.
  2. Você paga com a governança. As políticas de segurança, controles de acesso e lógica de negócios que você definiu uma vez no Unity Catalog não acompanham os dados até a camada de serving. Então, você precisa defini-los novamente, em um segundo lugar. No momento em que os dois divergem, você passa a ter regras inconsistentes, acesso fragmentado e uma lacuna que sua equipe de segurança precisará explicar.
  3. Você paga com a engenharia. Alguém precisa gerenciar esse pipeline. Alguém precisa depurar as falhas de sincronização. Alguém precisa executar o segundo cluster. Os engenheiros mais próximos de suas cargas de trabalho mais sensíveis à latência acabam passando os dias lidando com a infraestrutura básica em vez de focar no produto.

O pior de tudo: e depois de pagar por esses três pontos, a camada de serving ainda não consegue executar todas as suas consultas. No momento em que uma consulta se torna complexa (por exemplo, joins, funções de janela) ou os dados ficam grandes demais, ela entra em colapso.

Lakehouse//RT: Desempenho em tempo real, alimentado por Reyden

O Lakehouse//RT é um novo warehouse em tempo real que oferece desempenho de milissegundos em escala massiva, sem movimentação de dados. Você pode dar suporte a cargas de trabalho em tempo real enquanto continua a usar os mesmos formatos abertos, modelo de governança e arquitetura de dados central que já alimentam seu analytics e AI.

Os participantes do preview viram um desempenho até 16 vezes melhor em comparação com as camadas de serving em tempo real, com tempos de resposta de apenas 10 ms em conjuntos de dados menores e desempenho abaixo de 100 ms em conjuntos maiores. Em benchmarks analíticos padrão, o Lakehouse//RT oferece latência inferior a 100 milissegundos a 12.000 consultas por segundo.

Mas é fácil escolher a dedo um único número em um único benchmark. O teste real é se essa velocidade se mantém em todos os cenários: com mais dados, consultas mais difíceis e sob uma carga mais pesada.

O Lakehouse//RT supera o desempenho em todos os benchmarks

Essa nova abordagem significa que o Lakehouse//RT pode manter uma baixa latência, mesmo com milhares de consultas por segundo, tanto em conjuntos de dados grandes quanto pequenos, onde outros data warehouses ou mecanismos especializados em tempo real podem apresentar picos de lentidão ou até mesmo falhar completamente.

Veja como isso se comporta em três dimensões:

1. Sob carga: é fácil oferecer baixa latência com uma única consulta. O desafio surge quando um dashboard ou aplicativo está enviando milhares de consultas simultâneas para o sistema. Você não quer que seus usuários finais abram seu aplicativo analítico e esperem segundos ou até minutos para que ele carregue. Testamos o Lakehouse//RT contra as principais alternativas em termos de latência de consulta à medida que aumentamos a vazão de algumas consultas por segundo para milhares. Todas as alternativas se comportam da mesma maneira. A latência se mantém por um tempo, depois sobe e, em seguida, o mecanismo para de responder completamente. O Lakehouse//RT permanece estável em toda a faixa, escalando para milhares de consultas por segundo sem sacrificar a latência da consulta.

image6.gif

2. Em escala: este teste é baseado no TPCH, um benchmark padrão de suporte à decisão. Executamos um conjunto de consultas em um esquema de vendas que combina varreduras de tabelas grandes, joins de várias tabelas e agregações, que é o formato dos relatórios de negócios diários. Nós o executamos desde pequenos conjuntos de dados até um terabyte, o caminho que todo conjunto de dados faz à medida que o uso e o histórico se acumulam. O Lakehouse//RT mantém a latência baixa conforme os dados crescem, e o gráfico mostra como o desempenho se mantém em diferentes fatores de escala. Infelizmente, em fatores de escala grandes, 2 das 3 alternativas que estávamos testando falharam. Isso destaca ainda mais a incapacidade dessas pilhas secundárias em tempo real de lidar com volumes de dados significativos.

image7.png

3. Nas consultas mais difíceis: este teste é baseado no TPCDS, um benchmark de suporte à decisão mais exigente para data warehouses. Executamos um conjunto de consultas complexas criadas a partir de joins profundos de várias tabelas, subconsultas e funções de janela em um esquema de warehouse realista, o tipo de análise que um analista escreve quando a pergunta vai muito além de uma simples busca. O Lakehouse//RT mantém a latência baixa mesmo quando as consultas ficam mais difíceis, e o gráfico mostra que a diferença só aumenta, com uma alternativa rodando até 25 vezes mais devagar. E, mais uma vez, na maior escala, essa mesma alternativa simplesmente não conseguiu concluir a execução. Mais uma prova de que as pilhas secundárias em tempo real criadas para buscas simples não conseguem lidar com as análises complexas que as empresas executam todos os dias.

image2.png

O resultado é consistente nos três cenários. Rápido sob carga, rápido em escala e rápido nas consultas mais difíceis, em um único mecanismo, em uma única cópia dos seus dados. Nossos clientes do preview viram ganhos de desempenho semelhantes com o Lakehouse//RT em cenários do mundo real, desde dashboards até aplicativos analíticos em tempo real.

Velocidade de milissegundos em escala, em uma plataforma única, unificada e bem governada

Ao unificar o desempenho em tempo real com sua plataforma de dados central, o Lakehouse//RT elimina as concessões de arquitetura para oferecer três benefícios principais: respostas em tempo real, arquitetura simplificada e governança consistente.

Respostas em tempo real

Quando é fundamental obter os insights mais rápidos e atualizados, o Lakehouse//RT resolve. Clientes em setores exigentes onde cada milissegundo conta, não importa o número de consultas simultâneas, reduzem drasticamente seu tempo para obter insights com o lakehouse em tempo real.

Veja o que alguns de nossos clientes do preview inicial constataram em termos de ganho de desempenho:

"A Meta Enterprise executa analytics para nossas próprias equipes em cadeia de suprimentos, finanças e muito mais — onde os analistas esperam respostas instantâneas, mesmo sob pesada simultaneidade em nossas maiores tabelas. Com o Lakehouse//RT, nossos resultados de consulta típicos retornam em dezenas de milissegundos com os dados no lake, sem a necessidade de um sistema separado em paralelo."

— Srikanth Sakhamuri, Líder de Engenharia de Dados na Meta

meta logo

"A SES, uma empresa de soluções espaciais, ajuda governos a proteger, empresas a crescer e pessoas a se manterem conectadas — não importa onde estejam. Com satélites multi-órbita integrados e nossa rede terrestre global, oferecemos conectividade resiliente e contínua. Nossos dashboards de operações rodam em bilhões de linhas de telemetria em tempo real e exigem respostas em milissegundos com alta simultaneidade.

O Lakehouse//RT entrega exatamente isso diretamente em nossos dados do Databricks — 20 vezes mais rápido do que nossos tempos de consulta anteriores e por uma fração do custo, pois não precisamos mais operar uma camada de serving separada para atender aos nossos requisitos de latência."

— Dennis Rossberg, Arquiteto Sênior de Nuvem de Dados na SES

ses logo

"A Enverus é a plataforma de AI e dados do setor de energia, desenvolvida com base em mais de 25 anos de inteligência proprietária, com 2,7 petabytes de dados atualizados continuamente, mais de 350 milhões de registros judiciais e mais de US$ 500 bilhões em transações anuais que cobrem toda a cadeia de valor de energia. Isso significa que nossas análises precisam continuar interativas, mesmo com o aumento do tráfego de analistas e aplicativos incorporados.

Com o Lakehouse//RT, as consultas retornam em dezenas de milissegundos para algumas consultas e são até 100 vezes mais rápidas em outras do que em nosso mecanismo especializado em tempo real. Esse desempenho significa que podemos unificar nossa pilha de análise separada em um único Lakehouse unificado."

— Paul Lamb, Diretor de Enterprise Analytics na Enverus

image5.png

Arquitetura simplificada

Em vez de copiar e mover dados e criar pipelines adicionais, as equipes podem contar com uma única plataforma ágil para obter o poder de computação de que precisam sem ferramentas proprietárias. Isso significa menos complexidade e dispersão de sistemas.

"Nossa plataforma atende a centenas de consultas por segundo para dados de desempenho em tempo real em toda a nossa base de clientes, de modo que a consistência e a latência afetam diretamente a experiência do cliente.

Com o Lakehouse//RT, estamos vendo um desempenho consistente abaixo de 200 milissegundos em nossas principais consultas de painel. Conseguir isso diretamente em dados governados do lakehouse simplifica drasticamente nosso pipeline e nossa arquitetura de entrega."

— Kayvon Raphael, Diretor Sênior de Engenharia na Magnite

magnite logo

"A busca de ameaças exige uma latência consistentemente baixa, mesmo com o aumento do uso por usuários e agentes. O que estamos vendo com o Lakehouse//RT é um desempenho de milissegundos em dados em tempo real com uma melhoria de 5x no tempo de resposta, o que cria um caminho para executar essas cargas de trabalho em nosso lakehouse em vez de manter um sistema de entrega separado."

— Chris Kopek, Head de Plataformas de Dados na Cisco

Cisco Logo

"Na Halcyon, nossas equipes monitoram dados de segurança em milhões de endpoints, correlacionando sinais distintos para identificar ameaças críticas em segundos. À medida que as necessidades de segurança de nossos clientes cresceram, o mesmo aconteceu com a carga em nossos sistemas.

O Lakehouse//RT entregou o desempenho e a simultaneidade de que precisávamos. Nossas consultas críticas agora são executadas cerca de 4x mais rápido, diretamente em nosso Lakehouse, sem um sistema de cache separado."

— Seagen Levites, Diretor Sênior de Análise Quantitativa na Halcyon AI

halcyon logo

Governança forte e consistente

Ao mesmo tempo, a governança permanece centralizada. Políticas de segurança, permissões, controles de acesso e lógica de negócios continuam definidos e aplicados de forma consistente com o Unity Catalog. Suas equipes não precisam duplicar regras ou lidar com falhas de governança. Você configura uma vez e funciona em qualquer lugar.

"O Lakehouse//RT funcionou, em média, mais de um terço mais rápido do que nosso warehouse anterior em nosso conjunto de dados de saúde, com consultas 10 vezes mais rápidas [em algumas cargas de trabalho]. Isso se traduz diretamente em um acesso mais rápido às informações e mais tempo de decisão para nossos clientes. Tínhamos considerado um sistema dedicado em tempo real para complementar nossa arquitetura de Lakehouse, mas o Lakehouse//RT eliminou essa necessidade, nos dando essa velocidade nativamente com uma governança consistente."

— Mehrshad Setayesh, SVP de Engenharia (Dados, Plataforma, AI) na PointClickCare

pointclickcare logo

"O Bally's é um dos maiores grupos globais de tecnologia de jogos e loterias do setor, com milhões de transações por dia em cerca de 60 TB no Delta Lake sob o Unity Catalog. Nossas equipes de operações precisam de respostas em segundos e, para entregar isso, vínhamos executando sistemas de entrega de baixa latência separados junto ao lakehouse. O Lakehouse//RT elimina essa compensação: desempenho 7x mais rápido e abaixo de um segundo nos mesmos dados, diretamente de nossas tabelas Delta governadas. Sem cópias, sem clusters extras, sem um segundo sistema para proteger.

Essa simplicidade é especialmente importante em um setor altamente regulamentado, onde manter os mais altos padrões de governança, segurança e privacidade de dados é fundamental para a forma como operamos."

— Mark Borg, Vice-Presidente Sênior de Dados na Bally’s

Bally’s

"A Equilibrium Energy está reimaginando como a comercialização de energia é feita: agentes de AI trabalhando ao lado de operadores humanos, com dados em tempo real extraídos de dezenas de fontes distintas, nas velocidades que o mercado realmente exige. É uma carga de trabalho que a maioria das arquiteturas em tempo real não consegue acompanhar. O Lakehouse//RT entregou uma latência mediana até 3,6x mais rápida do que o SQL Serverless em nossas consultas de portal, rápido o suficiente para que os operadores possam pensar com os dados em vez de esperar por eles – executando cenários, explorando junto com agentes de AI e tomando decisões em segundos.

Manter tudo em uma única plataforma – em vez de acoplar uma camada separada em tempo real à nossa pilha – nos permite mover nessa velocidade sem sacrificar a governança."

— Tarek Rached, Diretor de Plataforma de Dados na Equilibrium Energy

equilibrium energy logo

Parceiros

Além dos nossos clientes do Preview, alguns dos maiores parceiros globais da Databricks já compartilham nossa visão para o Lakehouse//RT. Eles reconhecem o incrível potencial que isso traz para o mercado e estão ansiosos para colaborar conosco à medida que abrimos caminho para o data warehousing em tempo real.

"A aliança da Deloitte com a Databricks continua a ganhar um impulso incrível à medida que ajudamos as organizações a transformar seus dados em ativos estratégicos prontos para AI. O lançamento do Lakehouse//RT representa um salto significativo, fornecendo os recursos em tempo real necessários para impulsionar análises avançadas e acelerar o time-to-value. Estamos entusiasmados em aprofundar nossa colaboração com a Databricks e trazer essa inovação mais recente aos nossos clientes para gerar resultados de negócios mensuráveis e impactantes."

— Thomas Zipprich, Diretor e Líder Global da Aliança Databricks na Deloitte Consulting LLP

Deloitte

"À medida que vemos um impulso acelerado em nossa parceria com a Databricks com o lançamento do nosso novo Business Group, a demanda empresarial por dados em tempo real e AI nunca foi tão clara. O lançamento do Lakehouse//RT oferece a velocidade e a arquitetura aberta de que nossos clientes precisam para impulsionar a reinvenção inteligente dos negócios. Esperamos continuar nossa jornada com a Databricks para desbloquear novas possibilidades."

— Jigyasa Singh, Líder Global do Databricks Business Group na Accenture

accenture logo

"A Sigma agora se conecta diretamente ao Lakehouse//RT, Agent Bricks, Genie Agents e Lakebase, para que os clientes em comum possam obter um desempenho de consulta abaixo de um segundo em escala, explorar bilhões de linhas por meio de uma interface de planilha familiar, criar agentes que agem com base nesses dados e gerenciar todo o fluxo de trabalho do agente – memória, estado e tudo mais – sem nunca sair do ambiente governado em que já confiam.

A parte mais difícil da AI corporativa não é criar o modelo. É fazer com que os agentes trabalhem com dados de negócios reais, sob permissões reais, em escala. É exatamente isso que a Sigma e a Databricks resolvem juntas."

— Mike Palmer, CEO da Sigma

sigma logo

Um novo mecanismo e um novo modelo de computação

Além dos benefícios de desempenho, simplicidade e governança, o Lakehouse//RT também tira o fardo das decisões de suas equipes:

Dimensionamento automático (AUTO sizing). Você não precisa mais escolher um tamanho de camiseta. A Databricks determina automaticamente a computação básica correta para sua carga de trabalho, eliminando adivinhações e ciclos de aumento de escala quando as consultas ficam lentas ou de redução para economizar custos.

Autoscaling incremental. Os warehouses tradicionais lidam com mais simultaneidade criando cópias inteiras de si mesmos, 2X, depois 3X, depois 4X. Um pequeno aumento na demanda pode duplicar sua fatura. O Lakehouse//RT escala adicionando e removendo nós individuais conforme a carga muda, para que você obtenha exatamente a capacidade de que precisa e pague exatamente por isso.

Traga suas cargas de trabalho em tempo real para casa

A Databricks há muito tempo oferece a escala e a abertura necessárias para análises modernas e AI. As organizações não precisam mais escolher entre desempenho de baixa latência e uma arquitetura de dados aberta e unificada. Você não precisa de uma pilha mais fragmentada. Você precisa de um data warehouse mais capaz.

O Lakehouse//RT já está disponível em Beta para cargas de trabalho somente leitura selecionadas, com mais recursos chegando nos próximos meses. Fale com a equipe da sua conta Databricks para começar e trazer suas cargas de trabalho em tempo real para o lakehouse. Como oferta de lançamento, o uso do Lakehouse//RT tem 30% de desconto até janeiro de 2027. Depois de entrar, basta escolher o Lakehouse//RT no seletor de warehouse e você já estará pronto para começar.

(Esta publicação no blog foi traduzida utilizando ferramentas baseadas em inteligência artificial) Publicação original

Receba os posts mais recentes na sua caixa de entrada

Assine nosso blog e receba os posts mais recentes diretamente na sua caixa de entrada.