주요 컨텐츠로 이동

Databricks 랩

Databricks Labs는 필드에서 생성한 프로젝트로, 
고객이 자신의 사용 사례를 더욱 빠르게 프로덕션에 배포하도록 돕습니다!

Node

dqx

DQX

스트리밍 및 표준 DataFrame의 PySpark 워크로드를 위한 간소화된 대규모 데이터 품질 확인.

GitHub 소스 →

문서 →

카살

sdp-meta

Lakeflow Spark 선언적 파이프라인을 위한 메타데이터 기반 프레임워크. JSON 또는 YAML 온보딩 파일에서 브론즈 및 실버 파이프라인을 정의하세요. 단일 제네릭 파이프라인이 런타임에 결과 사양을 읽고 전체 처리 그래프를 구축하므로, 데이터 엔지니어 한 명이 새로운 파이프라인 코드를 작성하지 않고도 수천 개의 테이블을 관리할 수 있습니다. 번들, CLI, 브라우저 기반 앱 및 AI 지원 설정을 위한 MCP 서버를 통해 사용할 수 있습니다.

GitHub 소스 →

문서 →

저자와의 인터뷰 →

Lakebridge

GeoBrix

GeoBrix는 Databricks 기본 공간 기능인 GEOMETRY/GEOGRAPHY 유형, ST_* 함수 및 H3를 보완하는 고성능 공간 처리를 제공합니다. 이는 고급 래스터 처리, 벡터 및 래스터 타일 생성, 향상된 지오메트리 도구, 그리고 Quadbin 및 영국 국립 그리드와 같은 추가 이산 글로벌 그리드로 Lakehouse를 확장합니다. 경량 계층은 Databricks Serverless 및 Lakeflow 파이프라인에서 원활하게 실행되며, 특화된 리더 및 라이터 제품군은 일반적인 지리 공간 파일 유형에 대한 형식별 처리 기능을 추가합니다.

GitHub 소스 →

문서 →

블로그 →

기타 프로젝트

Kasal

Kasal은 Databricks 플랫폼에서 AI 에이전트를 빌드하고 배포하는 대화형 로우코드 방식입니다.

Github 소스 →
문서 →

Lakebridge

Lakebridge는 레거시 데이터 웨어하우스 및 ETL 시스템을 현대화하기 위해 기업에 포괄적인 엔드투엔드 솔루션을 제공하도록 설계된 Databricks의 마이그레이션 플랫폼입니다. Lakebridge는 Teradata, Oracle, Snowflake, SQL Server, DataStage 등을 포함한 광범위한 소스 플랫폼을 지원하며, 검색 및 평가부터 코드 변환, 데이터 이동, 검증에 이르기까지 마이그레이션 프로세스의 모든 단계를 자동화하여 데이터 자산에서 혁신과 효율성을 실현하려는 조직을 위해 빠르고 위험이 낮은 전환을 보장합니다.

GitHub 소스 →
문서 →
블로그 →

Impulse

Impulse는 대규모 시계열 측정 데이터 처리를 위해 설계된 Python 기반 분석 라이브러리입니다. Apache Spark 및 Delta Lake를 기반으로 구축되어 자동차 테스트, 산업용 IoT 및 기타 측정 집약적인 도메인의 페타바이트 규모 센서 데이터에 대한 분산 처리를 지원합니다.

Github 소스 →
문서 →

OntoBricks

OntoBricks는 Databricks 테이블을 구체화된 그래프 뷰어로 변환하는 웹 애플리케이션입니다. 이 애플리케이션을 사용하면 온톨로지(OWL)를 설계하고, R2RML을 통해 Unity Catalog 테이블에 매핑하며, 트리플을 Delta 기반 트리플 스토어와 Lakebase Postgres 그래프 엔진으로 구체화하고, 그래프(OWL 2 RL, SWRL, SHACL)에 대해 추론하며, 자동 생성된 GraphQL API를 통해 쿼리할 수 있습니다. LLM 기반 자동화를 사용하여 메타데이터 가져오기부터 쿼리 가능한 그래프 뷰어까지 전체 파이프라인을 네 번의 클릭으로 실행할 수 있습니다.

Github 소스 →
문서 →

coda

브라우저에서 Claude Code, Codex, Gemini CLI, Hermes Agent, OpenCode를 실행하세요. 별도의 설정 없이 Databricks 작업 공간에 연결됩니다.

Github 소스 →
문서 →

바이브스케일러

팀과 협업하여 우수한 에이전트 행동의 기준을 정의한 후, 이를 대규모로 실행되는 자동 채점기로 전환하세요.

GitHub 소스 →
문서 →

Lakemeter

검토, 공유 및 내보내기가 가능한 투명한 가정을 기반으로 몇 분 안에 Databricks 워크로드 비용을 예측합니다.

Github 소스 →
문서 →

Ontos

Ontos는 Data Mesh 원칙과 ODCS (Open Data Contract Standard) 및 ODPS (Open Data Product Specification)와 같은 업계 표준에 따라 고품질 데이터 제품을 구성, 관리 및 제공하는 도구를 엔터프라이즈 팀에 제공합니다.

GitHub 소스 →
설명서 →
마켓플레이스 →

Databricks MCP

AI 에이전트가 Databricks에서 엔터프라이즈 데이터를 가져오고 일반적인 개발자 작업을 자동화하는 데 도움이 되는 MCP 서버 모음입니다.

GitHub 소스 →

대화형 에이전트 앱

Databricks Genie Conversation API로 구동되는 채팅 인터페이스가 특징이며, Databricks 앱으로 실행되도록 특별히 빌드된 애플리케이션입니다.

GitHub 소스 →

지식 어시스턴트 챗봇 애플리케이션

예시 Databricks 지식 어시스턴트 챗봇 애플리케이션입니다.

GitHub 소스 →

기능 레지스트리 애플리케이션

이 앱은 Unity Catalog의 기존 기능을 탐색할 수 있는 사용자 친화적인 인터페이스를 제공합니다. 또한 사용자는 머신 러닝 모델을 훈련시키기 위한 피처 스펙과 훈련 세트를 만드는 코드를 생성할 수 있으며, 피처를 Feature Serving Endpoint로 배포할 수도 있습니다.

GitHub 소스 →

Smolder

Smolder는 HL7v2 메시지 형식에서 EHR 데이터를 로드하기 위한 Apache Spark™ SQL 데이터 소스를 제공합니다. 또한, Smolder는 Spark SQL DataFrame에서 HL7 메시지 텍스트를 파싱하고, 세그먼트, 필드, 하위 필드를 메시지에서 추출할 수 있는 도우미 함수를 제공합니다.

Github 소스 →
자세히 알아보기 →

데이터 생성기

프로젝트와 관련이 있는 데이터를 빠르게 생성합니다. Databricks 데이터 생성기를 사용하여 테스트, PoC 등의 용도로 대규모 시뮬레이션/합성 데이터 세트 생성

GitHub 소스 →
자세히 알아보기 →

DeltaOMS

레이크하우스에서 메타데이터 및 운영 지표를 분석하기 위한 중앙 집중형 Delta 트랜잭션 로그 컬렉션입니다.

Github 소스 →
자세히 알아보기 →

Splunk 통합

Add-on for Splunk는 Splunk Enterprise 및 Splunk Cloud 사용자가 Databricks에서 쿼리와 액션(예: 노트북과 작업 실행)을 실행할 수 있는 앱입니다.

Github 소스 →
자세히 알아보기 →

DiscoverX

DiscoverX는 수많은 Lakehouse 자산을 검사하거나 이에 대한 운영을 적용해야 하는 관리 작업을 자동화합니다.

GitHub 소스 →

brickster

{brickster}는 Databricks용 R 툴킷이며, 다음을 포함합니다.

  • Databricks API용 래퍼(예: db_cluster_list, db_volume_read)
  • RStudio 연결 창을 통해 워크스페이스 자산 탐색(open_workspace())
  • {reticulate}(문서)를 통해 databricks-sql-connector를 노출합니다.
  • 대화형 Databricks REPL

Github 소스 →
문서 →
블로그 →

Tempo

이 프로젝트의 목적은 Apache Spark에서 시계열을 조작하기 위한 API를 제공하는 것입니다. 지연된 시간 값, 구간 통계(예: mean, avg, sum, count, etc), AS OF 조인, 다운샘플링 및 보간을 사용한 특징화 기능 등이 있습니다. 이는 테라바이트 규모의 과거 데이터에 테스트하였습니다.

GitHub 소스 →
문서 →
웨비나 →

PyLint 플러그인

이 플러그인은 PyLint를 확장하여 특히 Databricks 환경의 Python 코드에서 발생하는 일반적인 실수와 문제에 대한 검사를 추가합니다.

Github 소스 →
문서 →

PyTester

PyTester는 Python에서 테스트 설정 및 해제를 관리하는 강력한 방법입니다. 이 라이브러리는 Databricks의 통합 테스트 작성을 돕는 픽스처 세트를 제공합니다.

Github 소스 →
문서 →

Delta Sharing Java 커넥터

Java 커넥터는 Delta Sharing 프로토콜에 따라 Delta Sharing 서버에서 공유 테이블을 읽습니다. 데이터 공급자 측의 송신 비용을 줄이고 제한하기 위해 불필요한 읽기를 제거하는 영구 캐시를 구현했습니다.

GitHub 소스 →
문서 →

UCX

UCX는 Databricks 작업 공간에서 Unity Catalog(UC)를 활성화하기 위한 툴킷입니다. UCX는 테이블과 뷰를 UC로 마이그레이션하기 위한 명령어와 워크플로를 제공합니다. UCX를 사용하면 대시보드, 작업, 노트북을 다시 작성하여 UC로 마이그레이션된 데이터 자산을 사용할 수 있습니다. 그리고 더 많은 기능이 있습니다.

GitHub 소스 →
문서 →
블로그 →

migrate-ip-acls

단일 집중 CLI를 통해 Databricks 작업 공간의 기존 IP 액세스 목록을 컨텍스트 기반 인그레스(CBI) 정책으로 다시 생성합니다.

GitHub 소스 →

Firefly

여러 인증 전략과 내장된 Databricks 앱을 갖추고 Databricks를 위한 맞춤형 프런트엔드를 제공하는 Next.js 애플리케이션입니다.

Github 소스 →
문서 →

http://github.com/databrickslabs 계정에 있는 모든 프로젝트는 참고 용도로만 제공하며, Databricks의 서비스 수준 계약(SLA)에서 공식적으로 지원하지 않습니다. 이들은 있는 그대로 제공되고 Databricks에서는 어떤 종류의 보증도 하지 않습니다.  이 프로젝트를 사용하면서 발견한 모든 문제는 Repo에서 GitHub 이슈로 신고해야 합니다. 시간 여유가 있을 때 검토는 하지만, 지원을 위한 공식 SLA는 없습니다.