주요 컨텐츠로 이동
회사

AI 시대를 위한 구축: VLDB 2026에서 선보이는 Lakebase, 스트리밍 및 Lakehouse 혁신

작성자: 인드라지트 로이 , Ippokratis Pandis

  • Lakebase, Structured Streaming 및 Lakehouse 최적화와 관련된 Databricks의 혁신 기술 알아보기
  • 트랜잭션 컴퓨팅을 스토리지에서 분리하는 3세대 클라우드 데이터베이스인 Lakebase가 에이전트 워크플로우에 어떻게 적합한지 이해하기
  • VLDB에서 엔지니어링 및 채용 팀 만나기

저희는 Databricks 플랫폼을 구동하는 다양한 혁신 기술을 공유하기 위해 VLDB 2026에 참석합니다.  Databricks의 공동 창립자이자 최고 아키텍트인 Reynold Xin이 오프닝 기조연설로 컨퍼런스의 포문을 열 예정입니다. Databricks는 Lakebase, Spark Structured Streaming 및 자동 Lakehouse 최적화와 관련된 4편의 논문을 채택받았습니다. Enzyme 엔진에 대한 데모 논문에서는 구체화된 뷰(materialized views)를 점진적으로 유지 관리하는 방법을 소개합니다. 아래에서 이러한 발표 내용을 미리 살펴보실 수 있습니다. 

기조연설: 데이터베이스 엔지니어링의 세 가지 황금기

Databricks 공동 창립자인 Reynold Xin은 AI 에이전트가 어떻게 데이터베이스 엔지니어링의 '세 번째 황금기'를 열고 있는지 논의할 예정입니다. 여러분 중 일부는 2012년 버클리 대학 시절 그가 확장 가능한 분석 시스템인 Shark에 대해 작업했던 초기 연구를 기억하실 것입니다. Reynold는 버클리 시절부터 Lakehouse 아키텍처의 부상, 그리고 현재 트랜잭션 및 분석 엔진의 변화하는 요구 사항에 이르기까지 수년에 걸쳐 데이터베이스 기술에 대한 자신의 관점이 어떻게 진화해 왔는지 되짚어 볼 것입니다. 그는 AI 에이전트의 요구 사항을 충족하는 데 도움이 될 두 가지 새로운 패러다임을 소개할 예정입니다. 바로 (1)  OLTP 데이터베이스에 스토리지와 컴퓨팅 분리를 적용하는 Lakebase와 (2)  트랜잭션 및 분석 처리를 통합하는 LTAP(Lake Transactional Analytical Processing)입니다. 

Lakebase: 오픈 레이크 스토리지 기반의 서버리스 Postgres

AI 에이전트 워크로드는 수백만 개의 수명이 짧고 깊게 분기된 데이터베이스와 같은 고유한 사용 패턴을 생성하고 있습니다. 기존의 OLTP 엔진은 모놀리식 구조여서 이러한 까다로운 요구 사항을 충족할 수 없습니다. Stas Kelvich가 3세대 클라우드 데이터베이스 아키텍처인 Lakebase 아키텍처를 발표할 예정입니다. Lakebase는 서버리스 PostgreSQL 컴퓨팅을 스토리지에서 분리하고, 오픈 포맷을 사용하여 클라우드 오브젝트 스토리지에 데이터와 write-ahead 로그를 직접 영구 저장함으로써 에이전트 워크플로우의 요구 사항을 충족합니다. Lakebase는 1초 미만의 콜드 스타트를 제공할 뿐만 아니라, copy-on-write 분기를 사용하여 Git과 유사한 효율적인 데이터베이스 워크플로우를 지원합니다. 또한 컴퓨팅과 스토리지가 분리되어 있어 실시간 트랜잭션 데이터에 대한 저지연 분석이 가능합니다. 그림 1은 Lakebase가 어떻게 3세대 클라우드 데이터베이스 시대를 열고 있는지 보여줍니다.

 

그림 1: Lakebase Postgres는 에이전트 시대에 적합하며 오픈 데이터 레이크를 기반으로 구축되었습니다.

Apache Spark Structured Streaming의 10년: 실제 요구 사항을 충족하기 위해 아키텍처를 진화시킨 방법

Structured Streaming은 Databricks에서 매주 수백만 개의 작업을 구동합니다. 이는 다른 설계에 비해 확장성, 결함 허용성(fault tolerance), 정확히 한 번(exactly-once) 시맨틱 등의 장점을 가진 고유한 마이크로 배치 처리 아키텍처를 사용합니다. 그러나 Structured Streaming이 실제 고객의 요구 사항을 충족하고 오늘날의 규모에 도달하기 위해서는 많은 새로운 혁신이 필요했습니다. Siying Dong이 스트리밍 아키텍처가 수년에 걸쳐 어떻게 진화해 왔는지 발표할 예정입니다. 마이크로 배치 파이프라이닝을 통해 처리량을 최대 3배까지 향상시켰고, 새로운 상태 저장(stateful) API를 통해 복잡한 비즈니스 로직을 쉽게 표현할 수 있게 되었으며, 이제 시스템에서 세분화된 액세스 제어를 지원합니다.

AutoLiquid: Databricks Lakehouse를 위한 자율적 데이터 레이아웃 최적화

키별로 테이블을 클러스터링하면 쿼리 성능을 크게 향상시킬 수 있습니다. 그러나 수백만 개의 Lakehouse 테이블에서 최적의 클러스터링 키를 수동으로 선택하는 것은 확장성이 떨어집니다. Yunjia Zhang이 AutoLiquid가 간단한 CLUSTER BY AUTO 프리미티브를 통해 이 라이프사이클을 어떻게 자동화하는지 설명할 예정입니다. AutoLiquid는 키 선택을 위한 휴리스틱과 효율적인 섀도우 검증(shadow verification)의 조합을 사용하여 수백만 개의 테이블을 클러스터링합니다. 이러한 기술을 사용하여 AutoLiquid는 평가된 워크로드의 95% 이상에서 고객이 직접 선택한 키보다 우수한 성능을 발휘할 수 있습니다.

Ultron: Databricks의 이력 기반 쿼리 최적화

옵티마이저가 데이터에 대해 거의 완벽한 지식을 가지고 있다면 Lakehouse 쿼리의 지연 시간을 크게 개선할 수 있습니다. Ultron은 분석 워크로드의 반복적인 특성을 활용하여 조인 연산자 유형 선택과 같은 옵티마이저의 선택을 개선하는 이력 기반 쿼리 최적화 프레임워크입니다. Eric Liang이 이력을 효율적으로 저장하고 실행된 쿼리의 로그를 관리하는 방법을 포함하여 Ultron의 아키텍처를 설명할 예정입니다. Ultron은 중앙값 조인 지연 시간을 25% 개선하는 등 프로덕션 워크로드의 성능을 크게 향상시켰습니다.

이 네 편의 논문 외에도, 데이터 엔지니어링 워크로드를 위한 점진적 뷰 유지 관리 엔진인 Enzyme을 시연하는 Yuhong Chen의 세션에 참여해 보세요.

에이전트 네이티브 데이터 인프라: LakehouseRT, Lakebase, 및 LTAP (후원사 세션)
Databricks는 VLDB 2026의 골드 후원사입니다. Ippokratis Pandis가 Databricks 후원사 세션을 진행하며, 자율적인 에이전트 루프를 수용하기 위해 Databricks가 시스템 아키텍처를 어떻게 발전시키고 있는지 설명할 예정입니다. 이를 염두에 두고 저희는 LakehouseRT를 소개하고자 합니다. LakehouseRT는 새로운 Reyden 엔진으로 구동되며, 오픈 레이크 스토리지에서 직접 실시간 저지연 분석을 수행할 수 있도록 설계되었습니다. Lakebase와 LakehouseRT의 결합은 최초의 진정한 LTAP(Lake Transactional Analytical Processing) 시스템을 제공하는 기반이 됩니다.

VLDB 2026에서 팀 만나기

Databricks 부스에 들러 엔지니어링 및 연구 팀과 소통하고, 논문에 대해 토론하고, 채용 담당자와 이야기를 나누어 보세요.

(이 글은 AI의 도움을 받아 번역되었습니다. 원문이 궁금하시다면 여기를 클릭해 주세요)

최신 게시물을 이메일로 받아보세요

블로그를 구독하고 최신 게시물을 이메일로 받아보세요.