Revenir au contenu principal

Modèles de données métier Lakehouse pour la santé et les sciences de la vie

Modèles de données métier gouvernés (couche Silver, Santé & Sciences de la vie), déployables dans Unity Catalog comme fondation analytique d'un lakehouse Databricks — cohérents dès le premier jour.

Lakehouse medallion layers with the Silver business data model

Modèles de données métier Databricks Lakehouse

Où il se trouve

Un modèle de données d'entreprise Lakehouse est la couche Silver. La couche Bronze gère l'ingestion brute (Lakeflow, Auto Loader). La couche Silver est le modèle analytique conformé et normalisé que lit chaque analyste, outil de BI et charge de travail de ML. La couche Gold est dérivée des insights (tables de KPI, tables de caractéristiques, agrégats) calculés sur la couche Silver.

Modèles de données métier Databricks Lakehouse : leur positionnement

Contenu de chaque modèle

Chaque modèle est publié sous la forme d'un ensemble complet.

`model.json` est le modèle logique qui capture chaque domaine, sous-domaine, produit, attribut, clé étrangère, étiquette de classification et définition de vue de métrique. C'est l'unité de référence. Enregistrez-le dans Git, comparez les versions et partagez-le entre les environnements.

Un déploiement Unity Catalog de schémas, de tables Delta, de contraintes de clé primaire, de contraintes de clé étrangère (informationnelles) et de tags de classification. Les noms exacts du catalogue et du schéma dépendent du style de catalogage choisi lors de l'installation.

Les vues de métriques sont des définitions de KPI réutilisables basées sur les tables physiques, prêtes pour les tableaux de bord AI/BI et AI/BI Genie.

Un graphe de connaissances RDFS (ontology/) exprime le même modèle sous la forme d'un graphe sémantique pour l'intégration d'outils sémantiques et l'ancrage d'agents d'IA.

Un diagramme DBML (diagram/) pour l'exploration visuelle dans dbdiagram.io ou tout autre visualiseur compatible avec DBML.

DDL SQL (schemas/) pour l'ensemble du déploiement, organisé par schéma.

La documentation Excel et Markdown a été générée en même temps que le modèle.

Données d'échantillon synthétiques facultatives. Les lignes basées sur des pools respectent toutes les clés étrangères, les contraintes regex et les balises de classification.

Hiérarchie

Hiérarchie organisationnelle

Chaque modèle suit la même hiérarchie. L'organisation est l'ensemble de l'entreprise. Elle contient trois divisions : Opérations (ce que l'entreprise fait physiquement), Activité (qui elle sert et comment elle génère des revenus) et Fonctions support (le back-office de soutien). Chaque division contient un ou plusieurs domaines (contextes délimités par un seul mot, en minuscules et au singulier). Chaque domaine contient deux ou plusieurs sous-domaines (regroupements sémantiques de deux mots). Chaque sous-domaine contient des produits (les tables Delta). Chaque produit contient des attributs (les colonnes), avec des types de données et des balises de classification assignés au préalable.

Les secteurs Opérations et Métier représentent ensemble au moins 80 % des domaines ; le secteur Entreprise est plafonné à 20 %. Ce ratio garantit que chaque modèle est centré sur ce qui fait réellement tourner l'entreprise plutôt que sur son back-office administratif.

Chaque modèle est également un graphe orienté acyclique par construction. Les clés étrangères pointent toujours de l'enfant vers le parent (order.customer_id, jamais customer.latest_order_id) ; les cycles sont rompus avant la publication ; chaque domaine se connecte à au moins un autre via des clés étrangères, de sorte que l'analytique inter-domaines est toujours possible.

Deux périmètres : MVM et ECM

Deux périmètres : MVM et ECM

MVM (Modèle Viable Minimum) représente de 30 à 50 % du nombre de tables ECM et ne couvre que les fonctions métier essentielles. Il est dimensionné pour les projets PME, les pilotes et les environnements de développement/test.

ECM (Expanded Coverage Model) est une large étendue d’entreprise, incluant le support des domaines d’entreprise, dimensionnés pour les déploiements du Fortune 100. La profondeur des attributs est identique dans les deux domaines. MVM n’est pas un squelette, juste une surface plus petite.

Comparons plus en détail le MVM et l'ECM.

Tableau comparatif direct

Contenu disponible pour les Secteurs d'activité de la santé et des sciences de la vie

Pour commencer, nous proposons actuellement 4 modèles disponibles en tant que MVM ou ECM. Ces modèles sont les suivants :

SecteurDomaines ECMProduits ECMDomaines MVMProduits MVM
Santé2254116189
Produits pharmaceutiques1944115213
Génomique & Biotechnologie1940315182
Essais cliniques1937913193

Secteur de la santé : un exemple

En consultant le dépôt, vous pouvez voir une comparaison des types de modèles MVM et ECM, ce qui vous aidera à choisir le périmètre de modèle qui vous intéresse.

Comparaison des métriques du modèle

Cela inclut un examen détaillé des Domaines et Produits disponibles.

table de facturation

Vous pouvez obtenir des détails sur ce qui fait partie de la portée du modèle sélectionné. Ceci inclut des instructions, des exemples, de la documentation et des notes de version.

Structure du dossier de sortie

Si vous êtes prêt à déployer le modèle dans votre environnement, consultez le fichier readme dans le dépôt principal pour suivre les étapes. De manière générale, il vous suffit d'exécuter le notebook d'installation ciblant le secteur et la portée du modèle qui vous intéressent.

Démarrer

La bibliothèque se trouve dans le dépôt Industry Solutions : https://github.com/databricks-industry-solutions/lakehouse-industry-data-models/tree/main. Choisissez un modèle, un périmètre (MVM ou ECM), un style de catalogage, un catalogue de déploiement, et exécutez le notebook d'installation. Une installation MVM typique s'effectue en quelques dizaines de minutes, par rapport à Databricks Serverless, qui prend moins de deux heures. Les deux produisent une couche Silver entièrement déployée dans Unity Catalog avec des vues de métriques prêtes pour les tableaux de bord d'AI/BI et AI/BI Genie.

Chaque modèle est un point de départ. Les clients qui ont besoin d'adapter un modèle à leur organisation (renommer des domaines, Merge ou scinder des produits, ajouter un domaine manquant, modifier les conventions de nommage) peuvent le faire à l'aide de l'Agent de modélisation, qui itère sur le modèle par le biais de directives en langage naturel.

Ressources connexes

Pour en savoir plus, consultez la première partie de notre série d'articles de blog sur la modélisation des données ~ Jumpstart your Data Modeling with Databricks Industry Data Models

Obtenez les modèles de données sectoriels du Lakehouse Databricks sur GitHub : Modèles de données sectoriels du Lakehouse sur GitHub