Lakehouse-Geschäftsdatenmodelle für Reise & Logistik
Eine Bibliothek produktionsreifer Geschäftsdatenmodelle der Silver-Schicht – eines pro Branche – für Unity Catalog als analytische Grundlage eines Databricks-Lakehouse: vollständig, verwaltet und konsistent ab Tag eins.

Databricks Lakehouse-Geschäftsdatenmodelle
Wo es sich befindet
Ein Lakehouse-Geschäftsdatenmodell ist die Silber-Schicht. Bronze verarbeitet die Rohdatenerfassung (Lakeflow, Auto Loader). Silber ist das konforme, normalisierte analytische Modell, aus dem jeder Analyst, jedes BI-Tool und jeder ML-Workload liest. Gold wird aus Erkenntnissen (KPI-Tabellen, Feature-Tabellen, Aggregate) abgeleitet, die auf Silber berechnet werden.

Was ist in jedem Modell enthalten
Jedes Modell wird als komplettes Paket veröffentlicht.
`model.json` ist das logische Modell, das jede Domänen-, Subdomänen-, Produkt-, Attribut-, Fremdschlüssel-, Klassifizierungs-Tag- und Metrikansichtsdefinition erfasst. Es ist die Währung. Checken Sie es in Git ein, vergleichen Sie Versionen und teilen Sie es über Umgebungen hinweg.
Eine Unity Catalog-Bereitstellung von Schemas, Delta-Tabellen, Primärschlüsseleinschränkungen, Fremdschlüsseleinschränkungen (informativ) und Klassifizierungs-Tags. Die genauen Katalog- und Schemanamen hängen vom bei der Installation gewählten Katalogisierungsstil ab.
Metrikansichten sind wiederverwendbare KPI-Definitionen, die auf den physischen Tabellen installiert sind und für AI/BI-Dashboards und AI/BI Genie bereitstehen.
Ein RDFS-Knowledge Graph (ontology/) drückt dasselbe Modell aus wie ein semantischer Graph für die Integration von semantischen Tools und das Grounding von KI-Agenten.
Ein DBML-Diagramm (diagram/) zur visuellen Erkundung in dbdiagram.io oder einem beliebigen DBML-kompatiblen Viewer.
SQL DDL (schemas/) für die gesamte Bereitstellung, nach Schema organisiert.
Excel- und Markdown-Dokumentation wurde zusammen mit dem Modell generiert.
Optionale synthetische Beispieldaten. Pool-basierte Zeilen berücksichtigen alle Fremdschlüssel, Regex-Einschränkungen und Klassifizierungs-Tags.
Hierarchie

Jedes Modell folgt derselben Hierarchie. Die Organisation ist das gesamte Unternehmen. Es umfasst drei Bereiche: Operations (der Betrieb), Business (wer die Kunden sind und wie das Unternehmen Einnahmen erzielt) und Corporate (das unterstützende Backoffice). Jede Division enthält eine oder mehrere Domänen (begrenzte Kontexte, die aus einem einzigen Wort in Kleinschreibung bestehen). Jede Domäne enthält zwei oder mehr Subdomänen (semantische Gruppierungen aus zwei Wörtern). Jede Subdomäne enthält Produkte (die Delta-Tabellen). Jedes Produkt enthält Attribute (die Spalten), mit Datentypen und Klassifizierungs-Tags, die im Voraus zugewiesen werden.
Betrieb und Business belegen zusammen immer mindestens 80 % der Domänen; Corporate ist auf 20 % begrenzt. Dieses Verhältnis sorgt dafür, dass jedes Modell auf das ausgerichtet bleibt, was das Geschäft tatsächlich am Laufen hält, und nicht auf sein administratives Backoffice.
Jedes Modell ist konstruktionsbedingt auch ein gerichteter azyklischer Graph. Fremdschlüssel verweisen immer von Kind zu Elternteil (order.customer_id, nie customer.latest_order_id); Zyklen werden vor der Veröffentlichung unterbrochen. Jede Domain ist über Fremdschlüssel mit mindestens einer anderen verbunden, sodass domainübergreifende Analysen immer möglich sind.
Zwei Bereiche: MVM und ECM

MVM (Minimum Viable Model) macht 30 bis 50 Prozent der ECM-Tabellenanzahl aus, deckt nur wesentliche Geschäftsfunktionen ab und ist für KMU-Projekte, Pilotprojekte und Entwicklungs-/Testumgebungen ausgelegt.
ECM (Expanded Coverage Model) bietet eine umfassende unternehmensweite Abdeckung, einschließlich der Unterstützung von Unternehmensdomänen, und ist für den Einsatz in Fortune-100-Unternehmen konzipiert. Die Attributtiefe ist in beiden Bereichen identisch. MVM ist kein Grundgerüst, sondern hat nur einen kleineren Umfang.
Vergleichen wir MVM und ECM genauer.

Was für die Reise- und Logistikbranche verfügbar ist
Als Ausgangspunkt haben wir derzeit 4 Modelle als MVM oder ECM verfügbar. Diese Modelle sind:
| Branche | ECM-Domänen | ECM-Produkte | MVM-Domänen | MVM-Produkte |
|---|---|---|---|---|
| Fluggesellschaften | 19 | 424 | 15 | 205 |
| Reisen & Gastgewerbe | 17 | 356 | 14 | 188 |
| Transport & Versand | 19 | 514 | 14 | 210 |
| Seehäfen | 19 | 395 | 14 | 186 |
Reise und Gastgewerbe ~ ein Beispiel
Im Repos sehen Sie einen Vergleich der MVM- und ECM-Modelltypen, sodass Sie eine gute Entscheidung darüber treffen können, welcher Modellumfang für Sie von Interesse ist.

Dies umfasst eine detaillierte Überprüfung der verfügbaren Domänen und Produkte.

Sie erhalten Details dazu, was zum ausgewählten Modellumfang gehört. Dies umfasst Anleitungen, Beispiele, Dokumentation und Versionshinweise.

Wenn Sie bereit sind, das Modell in Ihrer Umgebung bereitzustellen, lesen Sie die Readme-Datei im Haupt-Repo, um die einzelnen Schritte durchzugehen. Grob gesagt müssen Sie nur das Installer-Notebook für die gewünschte Branche und den gewünschten Modellumfang ausführen.
Erste Schritte
Die Bibliothek befindet sich im Industry Solutions-Repo: https://github.com/databricks-industry-solutions/lakehouse-industry-data-models/tree/main. Wählen Sie ein Modell, einen Bereich (MVM oder ECM), einen Katalogisierungsstil, einen Deployment-Katalog aus und führen Sie das Installations-Notebook aus. Eine typische MVM-Installation dauert nur einige zehn Minuten, während Databricks Serverless weniger als zwei Stunden benötigt. Beide erzeugen eine vollständig bereitgestellte Silver-Layer in Unity Catalog mit Metrikansichten, die für AI/BI-Dashboards und AI/BI Genie bereit sind.
Jedes Modell ist ein Ausgangspunkt. Kunden, die ein Modell an ihre Organisation anpassen müssen (Domänen umbenennen, Produkte zusammenführen oder aufteilen, eine fehlende Domäne hinzufügen, Namenskonventionen ändern), können dies mit dem Modeling Agent tun, der das Modell durch Anweisungen in natürlicher Sprache iteriert.
Zugehörige Ressourcen
Weitere Informationen finden Sie im ersten Teil unserer Blog-Veröffentlichung zur Datenmodellierung ~ Jumpstart your Data Modeling with Databricks Industry Data Models
Holen Sie sich Databricks Lakehouse Industry Data Models auf GitHub ~ Lakehouse Industry Data Models auf GitHub
