Direkt zum Hauptinhalt

Lakehouse-Geschäftsdatenmodelle für Einzelhandel & Konsumgüter

Produktionsreife, kontrollierte Geschäftsdatenmodelle auf Silver-Schicht für Einzelhandel und Konsumgüter, die direkt in Unity Catalog als analytische Grundlage eines Databricks Lakehouse bereitgestellt werden – konsistent vom ersten Tag an.

Lakehouse medallion layers with the Silver business data model

Lakehouse-Geschäftsdatenmodelle für Databricks

40 produktionsreife Business-Datenmodelle für die Silver-Schicht – eines für jede Branche. Sie lassen sich direkt in Unity Catalog bereitstellen und bilden das analytische Fundament Ihres Databricks-Lakehouse.

Jedes Modell ist vom ersten Tag an vollständig, gesteuert und in sich konsistent. Jede Domäne, jede Tabelle, jede Spalte, jeder Fremd-Key, jedes Klassifizierungs-Tag und jede Metrikansicht ist bereits definiert. Generische Branchen-Templates sind auf den Durchschnitt eines Sektors ausgelegt, was für Kunden monatelange Anpassungsarbeit bedeutet. Ein Lakehouse Business Data Model bildet nicht eine Branche im Allgemeinen ab, sondern ein konkretes Unternehmen darin – mit dessen Terminologie und dessen Geschäftsbereichen.

Jedes Modell kommt in zwei Ausbaustufen: MVM (Minimum Viable Model) und ECM (Expanded Coverage Model). Es unterstützt drei Unity Catalog-Layouts (Katalogisierungsvarianten) und enthält in jeder Variante denselben vollständigen Artefakt-Satz.

Einordnung

Ein Lakehouse-Geschäftsdatenmodell ist die Silver-Schicht. Bronze ist für die Rohdatenaufnahme (Lakeflow, Auto Loader) zuständig. Silver ist das konforme und normalisierte analytische Modell, auf das alle Analysten, BI-Tools und ML-Workloads zugreifen. Gold umfasst Erkenntnisse – KPI-Tabellen, Feature-Tabellen und Aggregate –, die auf Basis von Silver berechnet werden.
A Lakehouse Business Data Model is the Silver layer. Bronze handles raw ingestion (Lakeflow, Auto Loader). Silver is the conformed, normalized analytical model that every analyst, BI tool, and ML workload reads from. Gold is derived insight—KPI tables, feature tables, and aggregates—computed on top of Silver.

Was in den Modellen enthalten ist

Jedes Modell wird als vollständiges Paket veröffentlicht.

`model.json` ist das logische Modell, das jede Domäne, Subdomäne, jedes Produkt, Attribut, jeden Fremdschlüssel, jedes Klassifizierungs-Tag und jede Definition der Metrikansicht erfasst. Es ist die zentrale Einheit. Checken Sie es in Git ein, vergleichen Sie Versionen und teilen Sie es umgebungsübergreifend.

Eine Unity Catalog-Bereitstellung von Schemata, Delta-Tabellen, Primärschlüssel-Einschränkungen, Fremdschlüssel-Einschränkungen (informativ) und Klassifizierungs-Tags. Die genauen Katalog- und Schemanamen hängen vom bei der Installation gewählten Katalogisierungsstil ab.

Metrikansichten sind wiederverwendbare KPI-Definitionen, die auf den physischen Tabellen installiert sind und für AI/BI-Dashboards sowie den AI/BI Genie bereitstehen.

Ein RDFS-Knowledge Graph (ontology/) bildet dasselbe Modell als semantischen Graphen für die Integration semantischer Tools und das Grounding von KI-Agenten ab.

Ein DBML-Diagramm (diagram/) zur visuellen Erkundung in dbdiagram.io oder einem beliebigen DBML-kompatiblen Viewer.

SQL DDL (schemas/) für das gesamte Deployment, nach Schema geordnet.

Excel- und Markdown-Dokumentationen wurde parallel zum Modell generiert.

Optionale synthetische Beispieldaten. Pool-basierte Zeilen berücksichtigen alle Fremdschlüssel, Regex-Einschränkungen und Klassifizierungs-Tags. 

Hierarchie

Organisationshierarchie

Jedes Modell folgt derselben Hierarchie. Die Organisation ist das gesamte Unternehmen. Sie enthält drei Bereiche: Betrieb (was das Unternehmen physisch tut), Business (wen es bedient und wie es Einnahmen erzielt) und Corporate (das unterstützende Backoffice). Jeder Bereich enthält eine oder mehrere Domänen (einwortige, kleingeschriebene, singuläre Bounded Contexts). Jede Domäne enthält zwei oder mehr Subdomänen (zweiwortige semantische Gruppierungen). Jede Subdomäne enthält Produkte (die Delta-Tabellen). Jedes Produkt enthält Attribute (die Spalten), deren Datentypen und Klassifizierungs-Tags im Voraus zugewiesen werden.

Betrieb und Business umfassen zusammen immer mindestens 80 % der Domains; Corporate ist auf 20 % begrenzt. Dieses Verhältnis stellt sicher, dass jedes Modell auf das ausgerichtet ist, was das Geschäft tatsächlich ausmacht, und nicht auf das administrative Backoffice.

Jedes Modell ist konstruktionsbedingt auch ein gerichteter azyklischer Graph. Fremdschlüssel verweisen immer vom untergeordneten auf das übergeordnete Element (order.customer_id, niemals customer.latest_order_id); Zyklen werden vor der Veröffentlichung aufgebrochen; jede Domäne ist über Fremdschlüssel mit mindestens einer anderen verbunden, sodass domänenübergreifende Analysen immer möglich sind.

Zwei Geltungsbereiche: MVM und ECM

Zwei Geltungsbereiche: MVM und ECM

Das MVM (Minimum Viable Model) umfasst 30 bis 50 % der ECM-Tabellen und deckt nur die wesentlichen Geschäftsfunktionen ab. Zugeschnitten ist es auf KMU-Projekte, Pilotierungen sowie Dev- und Test-Umgebungen.

Das ECM (Expanded Coverage Model) ist ein Modell mit voller Unternehmensbreite, das Corporate-Domänen unterstützt und für Implementierungen bei Fortune-100-Unternehmen ausgelegt ist. Die Attributtiefe ist in beiden Bereichen identisch. Das MVM ist kein Skelett, sondern hat nur eine kleinere Oberfläche.

Vergleichen wir MVM und ECM genauer.

Was ist für Einzelhandel & Konsumgüter verfügbar

Als Ausgangspunkt haben wir derzeit 4 Modelle als MVM oder ECM verfügbar. Diese Modelle sind:

BrancheECM-DomainsECM-ProdukteMVM-DomänenMVM-Produkte
Einzelhandel1940115154
Lebensmittel1937414175
E-Commerce1836914148
Konsumgüter1940314184
[Branchenname][??]40012163
Essen & Getränke1937614157
Restaurants1429213153

Lebensmittel ~ ein Beispiel

Im Repo für die Bergbauindustrie finden Sie einen Vergleich der MVM- und ECM-Modelltypen, der Ihnen bei der Wahl des passenden Modellumfangs hilft.

Vergleich der Modellmetriken

Dazu gehört auch eine detaillierte Übersicht der verfügbaren Domänen und Produkte.

Hier erfahren Sie, was im ausgewählten Modell enthalten ist.  Dazu gehören Anleitungen, Beispiele, Dokumentation und Release Notes.

Wenn Sie bereit sind, das Modell in Ihrer Umgebung bereitzustellen, sehen Sie sich die Readme-Datei im Haupt-Repo an, um die Schritte durchzugehen. Im Großen und Ganzen müssen Sie nur das Installer-Notebook ausführen, das auf die gewünschte Branche und den gewünschten Modellumfang abgestimmt ist.

Erste Schritte

Die Bibliothek befindet sich im Industry Solutions-Repo. Wählen Sie ein Modell, einen Bereich (MVM oder ECM), einen Katalogisierungsstil und einen Bereitstellungskatalog aus und führen Sie das Installations-Notebook aus. Eine typische MVM-Installation ist innerhalb von 20 bis 30 Minuten abgeschlossen, während Databricks Serverless weniger als zwei Stunden benötigt. Beide erstellen eine vollständig bereitgestellte Silver-Schicht in Unity Catalog mit Metrikansichten, die für AI/BI-Dashboards und AI/BI Genie bereit sind.

Jedes Modell ist ein Ausgangspunkt. Kunden, die ein Modell an ihre Organisation anpassen müssen (Domänen umbenennen, Produkte zusammenführen oder aufteilen, eine fehlende Domäne hinzufügen, Namenskonventionen ändern), können dies mit dem Modeling Agent tun, der das Modell durch Anweisungen in natürlicher Sprache iteriert.

Zugehörige Ressourcen

Weitere Informationen finden Sie im ersten Teil unserer Blogreihe zur Datenmodellierung: Jumpstart your Data Modeling with Databricks Industry Data Models