Direkt zum Hauptinhalt

Lakehouse-Geschäftsdatenmodelle für Fertigung und Industrie

Eine Bibliothek einsatzbereiter Silver-Layer-Geschäftsdatenmodelle – je eines pro Branche –, direkt in Unity Catalog integrierbar als analytische Basis eines Databricks Lakehouse: vollständig, governed und ab dem ersten Tag intern konsistent.

Lakehouse medallion layers with the Silver business data model

Databricks Lakehouse Business Data Models

Einordnung

Ein Lakehouse Business Data Model ist der Silver-Layer. Bronze übernimmt die Rohdatenerfassung (Lakeflow, Auto Loader). Silver ist das angepasste, normalisierte Analysemodell, aus dem alle Analysten, BI-Tools und ML-Workloads lesen. Gold wird aus Erkenntnissen (KPI-Tabellen, Feature-Tabellen, Aggregaten) abgeleitet, die auf Basis von Silver berechnet werden.

Databricks Lakehouse Business Data Models – Einordnung

Lieferumfang des Modells

Jedes Modell wird als vollständiges Paket veröffentlicht.

`model.json` ist das logische Modell, das alle Domänen, Subdomänen, Produkte, Attribute, Fremdschlüssel, Klassifizierungs-Tags und Metrik-View-Definitionen erfasst. Es ist die zentrale Einheit. Checken Sie es in Git ein, vergleichen Sie Versionen (Diff) und teilen Sie es über verschiedene Umgebungen hinweg.

Eine Unity Catalog-Bereitstellung von Schemata, Delta-Tabellen, Primärschlüssel-Constraints, Fremdschlüssel-Constraints (informativ) und Klassifizierungs-Tags. Die genauen Katalog- und Schemanamen hängen von dem bei der Installation ausgewählten Katalogisierungsstil ab.

Metrik-Views sind wiederverwendbare KPI-Definitionen, die auf den physischen Tabellen installiert werden und für AI/BI-Dashboards und AI/BI Genie bereitstehen.

Ein RDFS-Wissensgraph (ontology/) stellt dasselbe Modell als semantischen Graphen für die Integration semantischer Tools und die Verankerung von KI-Agenten dar.

Ein DBML-Diagramm (diagram/) zur visuellen Erkundung in dbdiagram.io oder einem beliebigen DBML-kompatiblen Viewer.

SQL-DDL (schemas/) für die gesamte Bereitstellung, organisiert nach Schema.

Excel- und Markdown-Dokumentation, die zusammen mit dem Modell generiert wurde.

Optionale synthetische Beispieldaten. Pool-basierte Zeilen berücksichtigen alle Fremdschlüssel, Regex-Constraints und Klassifizierungs-Tags.

Hierarchie

Organisationshierarchie

Jedes Modell folgt derselben Hierarchie. Die Organisation repräsentiert das gesamte Unternehmen. Sie umfasst drei Bereiche: Operations (was das Unternehmen physisch tut), Business (wen es bedient und wie es Geld verdient) und Corporate (das unterstützende Backoffice). Jeder Bereich enthält eine oder mehrere Domänen (einwortige, kleingeschriebene, im Singular stehende Bounded Contexts). Jede Domäne enthält zwei oder mehr Subdomänen (zweiwortige semantische Gruppierungen). Jede Subdomäne enthält Produkte (die Delta-Tabellen). Jedes Produkt enthält Attribute (die Spalten), denen im Vorfeld Datentypen und Klassifizierungs-Tags zugewiesen wurden.

Operations und Business zusammen machen immer mindestens 80 % der Domänen aus; Corporate ist auf 20 % begrenzt. Dieses Verhältnis sorgt dafür, dass sich jedes Modell auf das konzentriert, was das Unternehmen tatsächlich antreibt, und nicht auf das administrative Backoffice.

Jedes Modell ist konstruktionsbedingt auch ein gerichteter azyklischer Graph (DAG). Fremdschlüssel zeigen immer von Child zu Parent (order.customer_id, niemals customer.latest_order_id); Zyklen werden vor der Veröffentlichung aufgelöst; jede Domäne ist über Fremdschlüssel mit mindestens einer anderen verbunden, sodass domänenübergreifende Analysen immer möglich sind.

Zwei Umfänge: MVM und ECM

Zwei Umfänge: MVM und ECM

MVM (Minimum Viable Model) macht 30 bis 50 Prozent der ECM-Tabellenanzahl aus und deckt nur wesentliche Geschäftsfunktionen ab – dimensioniert für KMU-Projekte, Piloten und Entwicklungs-/Testumgebungen.

ECM (Expanded Coverage Model) bietet die volle Unternehmensbreite, einschließlich unterstützender Corporate-Domänen, dimensioniert für Fortune-100-Bereitstellungen. Die Attributtiefe ist in beiden Umfängen identisch. Das MVM ist kein bloßes Gerüst, sondern hat lediglich einen kleineren Umfang.

Vergleichen wir MVM und ECM im Detail.

Direkter Vergleich

Verfügbarkeit für Fertigung und Industrie

Für den Einstieg stehen derzeit 6 Modelle als MVM oder ECM zur Verfügung. Diese Modelle sind:

BrancheECM-DomänenECM-ProdukteMVM-DomänenMVM-Produkte
Fertigung2041312129
Chemische Industrie1940514202
Halbleiter1938514211
Automobilindustrie1954814209
Bauwesen1836515189
Landwirtschaft1840814177

Automobilindustrie – ein Beispiel

Wenn Sie sich das Repository ansehen, finden Sie dort einen Vergleich der Modelltypen MVM und ECM, damit Sie eine fundierte Entscheidung darüber treffen können, welcher Modellbereich für Sie von Interesse ist.

Vergleich der Modellmetriken

Dies umfasst eine detaillierte Übersicht über die verfügbaren Domänen und Produkte.

Vergleich von Domänen und Produkten

Sie erhalten Details darüber, was Teil des ausgewählten Modellbereichs ist. Dies umfasst Anleitungen, Beispiele, Dokumentationen und Versionshinweise.

Struktur des Ausgabeordners

Wenn Sie bereit sind, das Modell in Ihrer Umgebung bereitzustellen, lesen Sie die Readme-Datei im Haupt-Repository, um die einzelnen Schritte durchzugehen. Im Wesentlichen müssen Sie nur das Installations-Notebook ausführen, das auf die Branche und den Modellbereich verweist, an denen Sie interessiert sind.

Erste Schritte

Die Bibliothek befindet sich im Industry Solutions-Repository: https://github.com/databricks-industry-solutions/lakehouse-industry-data-models/tree/main. Wählen Sie ein Modell, einen Bereich (MVM oder ECM), einen Katalogisierungsstil sowie einen Bereitstellungskatalog aus und führen Sie das Installations-Notebook aus. Eine typische MVM-Installation ist in wenigen Minuten abgeschlossen, im Vergleich zu Databricks Serverless, was weniger als zwei Stunden dauert. Beide erzeugen eine vollständig bereitgestellte Silver-Ebene in Unity Catalog mit Metrikansichten, die für AI/BI-Dashboards und AI/BI Genie bereit sind.

Jedes Modell ist ein Ausgangspunkt. Kunden, die ein Modell an ihr Unternehmen anpassen müssen (Domänen umbenennen, Produkte zusammenführen oder aufteilen, eine fehlende Domäne hinzufügen, Namenskonventionen ändern), können dies mithilfe des Modeling Agent tun, der das Modell durch Anweisungen in natürlicher Sprache iteriert.

Zugehörige Ressourcen

Weitere Informationen finden Sie im ersten Teil unserer Blog-Veröffentlichung zur Datenmodellierung ~ Jumpstart your Data Modeling with Databricks Industry Data Models