주요 컨텐츠로 이동

제조 및 산업 분야를 위한 레이크하우스 비즈니스 데이터 모델

산업별로 하나씩 제공되며 Databricks 레이크하우스의 분석 기반으로서 Unity Catalog에 직접 배포되는 프로덕션 지원 실버 레이어 비즈니스 데이터 모델 라이브러리입니다. 도입 첫날부터 완벽하고 거버넌스가 적용되며 내부 일관성을 유지합니다.

Lakehouse medallion layers with the Silver business data model

Databricks Lakehouse 비즈니스 데이터 모델

위치 및 역할

Lakehouse 비즈니스 데이터 모델은 Silver 레이어에 해당합니다. Bronze는 원시 데이터 수집(Lakeflow, Auto Loader)을 처리합니다. Silver는 모든 분석가, BI 도구, ML 워크로드가 읽는 일관되고 정규화된 분석 모델입니다. Gold는 Silver를 기반으로 계산된 인사이트(KPI 테이블, 피처 테이블, 집계)에서 파생됩니다.

Databricks Lakehouse 비즈니스 데이터 모델 위치 및 역할

각 모델과 함께 제공되는 요소

각 모델은 완전한 번들 형태로 제공됩니다.

`model.json`은 모든 도메인, 서브도메인, 제품, 속성, 외래 키, 분류 태그, 메트릭 뷰 정의를 캡처하는 논리적 모델입니다. 이는 기본 단위 역할을 합니다. git에 커밋하고, 버전 간 차이를 비교하고, 여러 환경에 공유할 수 있습니다.

Unity Catalog 배포에는 스키마, Delta 테이블, 기본 키 제약 조건, 외래 키 제약 조건(정보용), 분류 태그가 포함됩니다. 정확한 카탈로그 및 스키마 이름은 설치 중에 선택한 카탈로그 스타일에 따라 달라집니다.

메트릭 뷰는 물리적 테이블 위에 설치되는 재사용 가능한 KPI 정의로, AI/BI 대시보드 및 AI/BI Genie에서 바로 사용할 수 있습니다.

RDFS 지식 그래프(ontology/)는 시맨틱 도구 통합 및 AI 에이전트 그라운딩을 위해 동일한 모델을 시맨틱 그래프로 표현합니다.

DBML 다이어그램(diagram/)은 dbdiagram.io 또는 모든 DBML 호환 뷰어에서 시각적으로 탐색할 수 있도록 지원합니다.

SQL DDL(schemas/)은 스키마별로 정리된 전체 배포용 스크립트입니다.

Excel 및 Markdown 문서가 모델과 함께 생성되었습니다.

선택 사항인 합성 샘플 데이터입니다. 풀(Pool) 기반 행은 모든 외래 키, 정규식 제약 조건 및 분류 태그를 준수합니다.

계층 구조

조직 계층 구조

모든 모델은 동일한 계층 구조를 따릅니다. 조직(organization)은 비즈니스 전체를 의미합니다. 조직은 운영(Operations, 비즈니스가 물리적으로 수행하는 작업), 비즈니스(Business, 서비스 대상 및 수익 창출 방식), 기업 지원(Corporate, 지원 백오피스)의 세 가지 부문으로 구성됩니다. 각 부문은 하나 이상의 도메인(domains)(소문자 단수형 한 단어로 된 제한된 컨텍스트)을 포함합니다. 각 도메인은 두 개 이상의 서브도메인(subdomains)(두 단어로 된 시맨틱 그룹화)을 포함합니다. 각 서브도메인은 제품(products)(Delta 테이블)을 포함합니다. 각 제품은 데이터 유형과 분류 태그가 미리 할당된 속성(attributes)(열)을 포함합니다.

운영과 비즈니스를 합친 영역이 항상 도메인의 최소 80%를 차지하며, 기업 지원은 최대 20%로 제한됩니다. 이 비율을 통해 모든 모델이 관리 백오피스보다는 비즈니스를 실제로 운영하는 핵심 영역에 집중되도록 유지합니다.

또한 모든 모델은 구조적으로 방향성 비순환 그래프(Directed Acyclic Graph)를 형성합니다. 외래 키는 항상 자식에서 부모를 가리키며(order.customer_id, customer.latest_order_id는 절대 없음), 순환(cycle)은 게시 전에 제거됩니다. 모든 도메인은 외래 키를 통해 최소 하나 이상의 다른 도메인과 연결되므로 교차 도메인 분석이 언제나 가능합니다.

두 가지 범위: MVM 및 ECM

두 가지 범위: MVM 및 ECM

MVM(Minimum Viable Model)은 ECM 테이블 수의 30~50%를 차지하며 필수적인 비즈니스 기능만 포함합니다. SMB 프로젝트, 파일럿 및 개발/테스트 환경에 적합한 규모입니다.

ECM(Expanded Coverage Model)은 지원 기업 도메인을 포함하여 전체 기업을 아우르는 광범위한 모델로, Fortune 100 기업 배포에 적합한 규모입니다. 속성의 깊이는 두 범위 모두에서 동일합니다. MVM은 뼈대만 있는 모델이 아니라 단지 대상 영역이 더 작을 뿐입니다.

MVM과 ECM을 더 자세히 비교해 보겠습니다.

일대일 비교 표

제조 및 산업 분야에서 사용할 수 있는 모델

시작 단계로, 현재 MVM 또는 ECM으로 제공되는 6개의 모델이 있습니다. 해당 모델은 다음과 같습니다.

산업ECM 도메인ECM 제품MVM 도메인MVM 제품
제조업2041312129
화학 제조업1940514202
반도체1938514211
자동차1954814209
건설1836515189
농업1840814177

자동차 분야 예시

리포지토리를 살펴보면 MVM 및 ECM 모델 유형의 비교를 확인할 수 있어 관심 있는 모델 범위에 대해 올바른 결정을 내릴 수 있습니다.

모델 메트릭 비교

여기에는 사용 가능한 도메인 및 제품에 대한 자세한 검토가 포함됩니다.

도메인 및 제품 비교

선택한 모델 범위에 포함된 내용에 대한 자세한 정보를 얻을 수 있습니다. 여기에는 지침, 샘플, 문서 및 릴리스 노트가 포함됩니다.

출력 폴더 구조

사용자 환경에 모델을 배포할 준비가 되었다면, 메인 리포지토리의 readme를 확인하여 단계를 진행하세요. 상위 수준에서 필요한 것은 관심 있는 산업 및 모델 범위를 가리키는 설치 프로그램 노트북을 실행하는 것뿐입니다.

시작하기

이 라이브러리는 Industry Solutions 리포지토리에 있습니다: https://github.com/databricks-industry-solutions/lakehouse-industry-data-models/tree/main. 모델, 범위(MVM 또는 ECM), 카탈로그 스타일, 배포 카탈로그를 선택하고 설치 노트북을 실행하세요. 일반적인 MVM 설치는 수십 분 내에 완료되는 반면, Databricks Serverless는 2시간 미만이 소요됩니다. 두 방법 모두 AI/BI 대시보드 및 AI/BI Genie를 위한 메트릭 뷰가 준비된, 완전히 배포된 Unity Catalog의 Silver 레이어를 생성합니다.

모든 모델은 시작점입니다. 조직에 맞게 모델을 조정해야 하는 고객(도메인 이름 변경, 제품 병합 또는 분할, 누락된 도메인 추가, 명명 규칙 변경)은 자연어 지시어를 통해 모델을 반복하는 Modeling Agent를 사용하여 조정할 수 있습니다.

관련 리소스

자세한 내용은 데이터 모델링 블로그 출시의 첫 번째 파트인 Databricks Industry Data Models로 데이터 모델링 시작하기를 확인해 보세요.