Direkt zum Hauptinhalt

Lakehouse-Geschäftsdatenmodelle für Energie & Ressourcen

Produktionsreife Geschäftsdatenmodelle auf Silver-Ebene – eines je Branche –, die direkt in Unity Catalog als analytische Grundlage für Databricks Lakehouses bereitgestellt werden: vollständig, reguliert und intern konsistent.

Lakehouse medallion layers with the Silver business data model

Lakehouse-Geschäftsdatenmodelle für Databricks

Einordnung

Ein Lakehouse-Geschäftsdatenmodell ist die Silver-Schicht. Bronze ist für die Rohdatenerfassung (Lakeflow, Auto Loader). Silver ist das harmonisierte, normalisierte Analysemodell, aus dem Analysten, BI-Tools und ML-Workloads lesen. Gold wird aus Erkenntnissen (KPI-Tabellen, Feature-Tabellen, Aggregate) abgeleitet, die auf Silver berechnet werden.

Databricks Lakehouse-Geschäftsdatenmodelle: Einordnung

Was in den Modellen enthalten ist

Jedes Modell wird als vollständiges Paket veröffentlicht.

`model.json` ist das logische Modell, das sämtliche Domänen, Subdomänen, Produkte, Attribute, Fremdschlüssel, Klassifizierungs-Tags und Definitionen von Metrikansichten umfasst. Es ist die zentrale Einheit. Es kann in Git eingecheckt, über Versionen hinweg verglichen und über Umgebungen hinweg geteilt werden.

Ein Unity Catalog-Deployment von Schemata, Delta-Tabellen, Primärschlüsseleinschränkungen, Fremdschlüsseleinschränkungen (informationell) und Klassifizierungs-Tags. Die konkreten Katalog- und Schemanamen hängen vom bei der Installation gewählten Katalogisierungsstil ab.

Metrikansichten sind wiederverwendbare KPI-Definitionen, die auf den physischen Tabellen aufbauen und für AI/BI-Dashboards sowie AI/BI Genie bereitstehen.

Ein RDFS-Knowledge Graph (ontology/) drückt dasselbe Modell wie ein semantischer Graph zur Integration von semantischem Tooling und zum Grounding von KI-Agenten aus.

Ein DBML-Diagramm (diagram/) zur visuellen Erkundung in dbdiagram.io oder einem beliebigen DBML-kompatiblen Viewer.

SQL DDL (schemas/) für die gesamte Bereitstellung, nach Schema geordnet.

Die Excel- und Markdown-Dokumentation wurde zusammen mit dem Modell generiert.

Optionale synthetische Beispieldaten. Pool-basierte Zeilen berücksichtigen alle Fremdschlüssel, Regex-Einschränkungen und Klassifizierungs-Tags.

Hierarchie

Organisationshierarchie

Jedes Modell folgt derselben Hierarchie. Die Organisation ist das gesamte Unternehmen. Es umfasst drei Bereiche: Operations (was das Unternehmen operativ leistet), Business (wen es bedient und wie es Umsätze erzielt) und Corporate (unterstützende Backoffice-Funktionen). Jeder Bereich enthält eine oder mehrere Domänen (einwortige, kleingeschriebene, singuläre begrenzte Kontexte). Jede Domäne enthält zwei oder mehr Unterdomänen (semantische Gruppierungen aus zwei Wörtern). Jede Unterdomäne enthält Produkte (die Delta-Tabellen). Jedes Produkt enthält Attribute (die Spalten), denen im Voraus Datentypen und Klassifizierungs-Tags zugewiesen werden.

Betrieb und Business umfassen zusammen immer mindestens 80 % der Domains; Corporate ist auf 20 % begrenzt. Dieses Verhältnis stellt sicher, dass jedes Modell auf das ausgerichtet ist, was das Geschäft tatsächlich ausmacht, und nicht auf das administrative Backoffice.

Jedes Modell ist konstruktionsbedingt auch ein gerichteter azyklischer Graph (Directed Acyclic Graph, DAG). Fremdschlüssel verweisen immer von untergeordneten zu übergeordneten Elementen (order.customer_id), niemals customer.latest_order_id); Zyklen werden vor der Veröffentlichung aufgelöst; jede Domain ist über Fremdschlüssel mit mindestens einer weiteren Domäne verbunden, sodass domainübergreifende Analysen immer möglich sind.

Zwei Geltungsbereiche: MVM und ECM

Zwei Geltungsbereiche: MVM und ECM

MVM (Minimum Viable Model) macht 30 bis 50 Prozent der Tabellenanzahl des ECM aus und deckt nur die wesentlichen Geschäftsfunktionen ab; es ist für SMB-Implementierungen, Pilotprojekte sowie Entwicklungs- und Testumgebungen ausgelegt.

ECM (Expanded Coverage Model) bietet eine vollständige Unternehmensabdeckung einschließlich der unterstützenden Corporate-Domains und ist für Fortune-100-Deployments ausgelegt. Die Attributtiefe ist in beiden Bereichen identisch. MVM ist kein Grundgerüst, sondern hat nur eine kleinere Oberfläche.

Vergleichen wir MVM und ECM genauer.

Direktvergleichstabelle

Verfügbare Modelle für Energie & Resources

Als Ausgangspunkt haben wir derzeit 4 Modelle als MVM oder ECM verfügbar. Diese Modelle sind:

Bergbau ~ ein Beispiel

Im Repo für die Bergbauindustrie finden Sie einen Vergleich der MVM- und ECM-Modelltypen, der Ihnen bei der Wahl des passenden Modellumfangs hilft.

Vergleich der Modellmetriken

Dazu gehört auch eine detaillierte Übersicht der verfügbaren Domänen und Produkte.

Community

Hier erfahren Sie, was im ausgewählten Modell enthalten ist. Dazu gehören Anleitungen, Beispiele, Dokumentation und Release Notes.

Struktur des Ausgabeordners

Wenn Sie bereit sind, das Modell in Ihrer Umgebung bereitzustellen, sehen Sie sich die Readme-Datei im Haupt-Repo an, um die Schritte durchzugehen. Im Großen und Ganzen müssen Sie nur das Installer-Notebook ausführen, das auf die gewünschte Branche und den gewünschten Modellumfang abgestimmt ist.

Erste Schritte

Die Bibliothek befindet sich im Repository „Industry Solutions“: https://github.com/databricks-industry-solutions/lakehouse-industry-data-models/tree/main. Wählen Sie ein Modell, einen Bereich (MVM oder ECM), einen Katalogisierungsstil und einen Bereitstellungskatalog aus und führen Sie das Installations-Notebook aus. Eine typische MVM-Installation ist innerhalb von 20 bis 30 Minuten abgeschlossen, während Databricks Serverless weniger als zwei Stunden benötigt. Beide erstellen eine vollständig bereitgestellte Silver-Ebene in Unity Catalog mit Metrikansichten, die für AI/BI-Dashboards und AI/BI Genie bereit sind.

Jedes Modell ist ein Ausgangspunkt. Kunden, die ein Modell an ihre Organisation anpassen müssen (Domänen umbenennen, Produkte zusammenführen oder aufteilen, eine fehlende Domäne hinzufügen, Namenskonventionen ändern), können dies mit dem Modeling Agent tun, der das Modell durch Anweisungen in natürlicher Sprache iteriert.

Zugehörige Ressourcen

Weitere Informationen finden Sie im ersten Teil unserer Blogreihe zur Datenmodellierung: Jumpstart your Data Modeling with Databricks Industry Data Models