Lakehouse-Geschäftsdatenmodelle für Gesundheits- und Lebenswissenschaften
Produktionsreife, verwaltete Geschäftsdatenmodelle der Silver-Schicht für das Gesundheitswesen und die Life Sciences, die direkt in Unity Catalog als analytische Grundlage eines Databricks Lakehouse bereitgestellt werden – von Anfang an konsistent.

Databricks Lakehouse-Geschäftsdatenmodelle
Einordnung
Ein Lakehouse-Geschäftsdatenmodell ist die Silver-Schicht. Bronze ist für die Rohdatenerfassung zuständig (Lakeflow, Auto Loader). Silver ist das angepasste, normalisierte analytische Modell, aus dem jeder Analyst, jedes BI-Tool und jeder ML-Workload liest. Gold wird aus Erkenntnissen (KPI-Tabellen, Feature-Tabellen, Aggregate) abgeleitet, die auf Silver berechnet werden.

Was in jedem Modell enthalten ist
Jedes Modell wird als vollständiges Paket veröffentlicht.
`model.json` ist das logische Modell, das jede Domain-, Subdomain-, Produkt-, Attribut-, Fremdschlüssel-, Klassifizierungs-Tag- und Metrikansichtsdefinition erfasst. Es ist die zentrale Einheit. Es kann in Git eingecheckt, über Versionen hinweg verglichen und über Umgebungen hinweg geteilt werden.
Eine Unity-Katalog-Bereitstellung von Schemata, Delta-Tabellen, Primärschlüssel-Constraints, Fremdschlüssel-Constraints (informativ) und Klassifikationstags. Die genauen Katalog- und Schemanamen hängen vom bei der Installation gewählten Katalogisierungsstil ab.
Metrikansichten sind wiederverwendbare KPI-Definitionen, die auf den physischen Tabellen installiert und für AI/BI-Dashboards und AI/BI Genie bereit sind.
Ein RDFS-Knowledge Graph (ontology/) drückt dasselbe Modell wie ein semantischer Graph zur Integration von semantischem Tooling und zum Grounding von KI-Agenten aus.
Ein DBML-Diagramm (diagram/) zur visuellen Erkundung in dbdiagram.io oder einem beliebigen DBML-kompatiblen Viewer.
SQL DDL (schemas/) für die gesamte Bereitstellung, nach Schema geordnet.
Die Excel- und Markdown-Dokumentation wurde zusammen mit dem Modell generiert.
Optionale synthetische Beispieldaten. Pool-based Zeilen berücksichtigen alle Fremdschlüssel, Regex-Einschränkungen und Klassifizierungs-Tags.
Hierarchie

Jedes Modell folgt derselben Hierarchie. Die Organisation ist das gesamte Unternehmen. Sie enthält drei Bereiche: Betrieb (was das Unternehmen physisch tut), Business (wen es bedient und wie es Einnahmen erzielt) und Corporate (das unterstützende Backoffice). Jeder Bereich enthält eine oder mehrere Domänen (einwortige, kleingeschriebene, singuläre begrenzte Kontexte). Jede Domäne enthält zwei oder mehr Subdomänen (semantische Gruppierungen aus zwei Wörtern). Jede Subdomäne enthält Produkte (die Delta-Tabellen). Jedes Produkt enthält Attribute (die Spalten), denen im Voraus Datentypen und Klassifizierungs-Tags zugewiesen werden.
Betrieb und Business umfassen zusammen immer mindestens 80 % der Domains; Corporate ist auf 20 % begrenzt. Dieses Verhältnis stellt sicher, dass jedes Modell auf das ausgerichtet ist, was das Geschäft tatsächlich ausmacht, und nicht auf das administrative Backoffice.
Jedes Modell ist konstruktionsbedingt auch ein gerichteter azyklischer Graph. Fremdschlüssel verweisen immer von untergeordneten zu übergeordneten Elementen (order.customer_id), niemals customer.latest_order_id); Zyklen werden vor der Veröffentlichung aufgelöst; jede Domain ist über Fremdschlüssel mit mindestens einer anderen verbunden, sodass domainübergreifende Analysen immer möglich sind.
Zwei Geltungsbereiche: MVM und ECM

MVM (Minimum Viable Model) macht 30 bis 50 Prozent der Tabellenanzahl des ECM aus und deckt nur wesentliche Geschäftsfunktionen ab, ausgelegt für SMB-Engagements, Pilotprojekte und Entwicklungs-/Testumgebungen.
ECM (Expanded Coverage Model) bietet eine vollständige Unternehmensabdeckung, einschließlich unterstützender Corporate-Domains, und ist für Bereitstellungen bei Fortune-100-Unternehmen ausgelegt. Die Attributtiefe ist in beiden Bereichen identisch. MVM ist kein Grundgerüst, sondern hat nur eine kleinere Oberfläche.
Vergleichen wir MVM und ECM genauer.

Was steht der Gesundheits- und Lebenswissenschaftsbranche zur Verfügung
Als Ausgangspunkt haben wir derzeit 4 Modelle als MVM oder ECM verfügbar. Diese Modelle sind:
| Branche | ECM-Domains | ECM-Produkte | MVM-Domains | MVM-Produkte |
|---|---|---|---|---|
| Gesundheitswesen | 22 | 541 | 16 | 189 |
| Pharmazeutika | 19 | 441 | 15 | 213 |
| Genomik & Biotech | 19 | 403 | 15 | 182 |
| Klinische Studien | 19 | 379 | 13 | 193 |
Gesundheitswesen – ein Beispiel
Wenn Sie sich das Repo ansehen, sehen Sie einen Vergleich der MVM- und ECM-Modelltypen, sodass Sie eine gute Entscheidung treffen können, für welchen Modell-Geltungsbereich Sie sich interessieren.

Dies beinhaltet eine detaillierte Übersicht der verfügbaren Domains und Produkte.

Hier erfahren Sie, was im ausgewählten Modell enthalten ist. Dazu gehören Anleitungen, Beispiele, Dokumentation und Versionshinweise.

Wenn du bereit bist, das Modell in deiner Umgebung zu deployen, schau dir die Readme im Haupt-Repos an, um die Schritte durchzugehen. Auf hoher Ebene musst du nur das Installer-Notebook ausführen, das auf die Branche und den Modellumfang zeigt, für den du dich interessierst.
Erste Schritte
Die Bibliothek befindet sich im Industry Lösungen Repo: https://github.com/databricks-industry-solutions/lakehouse-industry-data-models/tree/main. Wählen Sie ein Modell, einen Bereich (MVM oder ECM), einen Katalogisierungsstil und einen Bereitstellungskatalog aus und führen Sie das Installations-Notebook aus. Eine typische MVM-Installation ist in einigen zehn Minuten abgeschlossen, während Databricks Serverless weniger als zwei Stunden benötigt. Beide erstellen eine vollständig bereitgestellte Silver-Schicht in Unity Catalog mit Metrikansichten, die für AI/BI-Dashboards und AI/BI Genie bereit sind.
Jedes Modell ist ein Ausgangspunkt. Kunden, die ein Modell an ihre Organisation anpassen müssen (Domänen umbenennen, Produkte zusammenführen oder aufteilen, eine fehlende Domäne hinzufügen, Namenskonventionen ändern), können dies mit dem Modeling Agent tun, der das Modell durch Anweisungen in natürlicher Sprache iteriert.
Zugehörige Ressourcen
Weitere Informationen finden Sie im ersten Teil unserer Blog-Veröffentlichung zur Datenmodellierung: Jumpstart your Data Modeling with Databricks Industry Data Models
Holen Sie sich Databricks Lakehouse Industry Data Models auf GitHub ~ Lakehouse Industry Data Models auf GitHub
