Modèles de données métier Lakehouse pour la santé et les sciences de la vie
Modèles de données métier gouvernés (couche Silver, Santé & Sciences de la vie), déployables dans Unity Catalog comme fondation analytique d'un lakehouse Databricks — cohérents dès le premier jour.

Modèles de données métier Databricks Lakehouse
Où il se trouve
Un modèle de données d'entreprise Lakehouse est la couche Silver. La couche Bronze gère l'ingestion brute (Lakeflow, Auto Loader). La couche Silver est le modèle analytique conformé et normalisé que lit chaque analyste, outil de BI et charge de travail de ML. La couche Gold est dérivée des insights (tables de KPI, tables de caractéristiques, agrégats) calculés sur la couche Silver.

Contenu de chaque modèle
Chaque modèle est publié sous la forme d'un ensemble complet.
`model.json` est le modèle logique qui capture chaque domaine, sous-domaine, produit, attribut, clé étrangère, étiquette de classification et définition de vue de métrique. C'est l'unité de référence. Enregistrez-le dans Git, comparez les versions et partagez-le entre les environnements.
Un déploiement Unity Catalog de schémas, de tables Delta, de contraintes de clé primaire, de contraintes de clé étrangère (informationnelles) et de tags de classification. Les noms exacts du catalogue et du schéma dépendent du style de catalogage choisi lors de l'installation.
Les vues de métriques sont des définitions de KPI réutilisables basées sur les tables physiques, prêtes pour les tableaux de bord AI/BI et AI/BI Genie.
Un graphe de connaissances RDFS (ontology/) exprime le même modèle sous la forme d'un graphe sémantique pour l'intégration d'outils sémantiques et l'ancrage d'agents d'IA.
Un diagramme DBML (diagram/) pour l'exploration visuelle dans dbdiagram.io ou tout autre visualiseur compatible avec DBML.
DDL SQL (schemas/) pour l'ensemble du déploiement, organisé par schéma.
La documentation Excel et Markdown a été générée en même temps que le modèle.
Données d'échantillon synthétiques facultatives. Les lignes basées sur des pools respectent toutes les clés étrangères, les contraintes regex et les balises de classification.
Hiérarchie

Chaque modèle suit la même hiérarchie. L'organisation est l'ensemble de l'entreprise. Elle contient trois divisions : Opérations (ce que l'entreprise fait physiquement), Activité (qui elle sert et comment elle génère des revenus) et Fonctions support (le back-office de soutien). Chaque division contient un ou plusieurs domaines (contextes délimités par un seul mot, en minuscules et au singulier). Chaque domaine contient deux ou plusieurs sous-domaines (regroupements sémantiques de deux mots). Chaque sous-domaine contient des produits (les tables Delta). Chaque produit contient des attributs (les colonnes), avec des types de données et des balises de classification assignés au préalable.
Les secteurs Opérations et Métier représentent ensemble au moins 80 % des domaines ; le secteur Entreprise est plafonné à 20 %. Ce ratio garantit que chaque modèle est centré sur ce qui fait réellement tourner l'entreprise plutôt que sur son back-office administratif.
Chaque modèle est également un graphe orienté acyclique par construction. Les clés étrangères pointent toujours de l'enfant vers le parent (order.customer_id, jamais customer.latest_order_id) ; les cycles sont rompus avant la publication ; chaque domaine se connecte à au moins un autre via des clés étrangères, de sorte que l'analytique inter-domaines est toujours possible.
Deux périmètres : MVM et ECM

MVM (Modèle Viable Minimum) représente de 30 à 50 % du nombre de tables ECM et ne couvre que les fonctions métier essentielles. Il est dimensionné pour les projets PME, les pilotes et les environnements de développement/test.
ECM (Expanded Coverage Model) est une large étendue d’entreprise, incluant le support des domaines d’entreprise, dimensionnés pour les déploiements du Fortune 100. La profondeur des attributs est identique dans les deux domaines. MVM n’est pas un squelette, juste une surface plus petite.
Comparons plus en détail le MVM et l'ECM.

Contenu disponible pour les Secteurs d'activité de la santé et des sciences de la vie
Pour commencer, nous proposons actuellement 4 modèles disponibles en tant que MVM ou ECM. Ces modèles sont les suivants :
| Secteur | Domaines ECM | Produits ECM | Domaines MVM | Produits MVM |
|---|---|---|---|---|
| Santé | 22 | 541 | 16 | 189 |
| Produits pharmaceutiques | 19 | 441 | 15 | 213 |
| Génomique & Biotechnologie | 19 | 403 | 15 | 182 |
| Essais cliniques | 19 | 379 | 13 | 193 |
Secteur de la santé : un exemple
En consultant le dépôt, vous pouvez voir une comparaison des types de modèles MVM et ECM, ce qui vous aidera à choisir le périmètre de modèle qui vous intéresse.

Cela inclut un examen détaillé des Domaines et Produits disponibles.

Vous pouvez obtenir des détails sur ce qui fait partie de la portée du modèle sélectionné. Ceci inclut des instructions, des exemples, de la documentation et des notes de version.

Si vous êtes prêt à déployer le modèle dans votre environnement, consultez le fichier readme dans le dépôt principal pour suivre les étapes. De manière générale, il vous suffit d'exécuter le notebook d'installation ciblant le secteur et la portée du modèle qui vous intéressent.
Démarrer
La bibliothèque se trouve dans le dépôt Industry Solutions : https://github.com/databricks-industry-solutions/lakehouse-industry-data-models/tree/main. Choisissez un modèle, un périmètre (MVM ou ECM), un style de catalogage, un catalogue de déploiement, et exécutez le notebook d'installation. Une installation MVM typique s'effectue en quelques dizaines de minutes, par rapport à Databricks Serverless, qui prend moins de deux heures. Les deux produisent une couche Silver entièrement déployée dans Unity Catalog avec des vues de métriques prêtes pour les tableaux de bord d'AI/BI et AI/BI Genie.
Chaque modèle est un point de départ. Les clients qui ont besoin d'adapter un modèle à leur organisation (renommer des domaines, Merge ou scinder des produits, ajouter un domaine manquant, modifier les conventions de nommage) peuvent le faire à l'aide de l'Agent de modélisation, qui itère sur le modèle par le biais de directives en langage naturel.
Ressources connexes
Pour en savoir plus, consultez la première partie de notre série d'articles de blog sur la modélisation des données ~ Jumpstart your Data Modeling with Databricks Industry Data Models
Obtenez les modèles de données sectoriels du Lakehouse Databricks sur GitHub : Modèles de données sectoriels du Lakehouse sur GitHub
