Modèles de données métier Lakehouse pour les communications, les médias et le divertissement
Modèles de données de la couche Silver, gouvernés et prêts pour la production pour les communications, médias et divertissement, se déployant dans Unity Catalog comme socle analytique d'un lakehouse Databricks, cohérents dès le premier jour.

Modèles de données métier Databricks Lakehouse
Une bibliothèque de quarante modèles de données métier prêts pour la production au niveau de la couche Silver, un par secteur d'activité, qui se déploient directement dans Unity Catalog pour servir de base analytique à un lakehouse Databricks.
Chaque modèle est complet, gouverné et cohérent en interne dès le premier jour. Chaque domaine, table, colonne, clé étrangère, étiquette de classification et vue de métriques est déjà défini. Les modèles sectoriels génériques font la moyenne de toutes les entreprises d'un secteur, ce qui impose aux clients des mois de travail d'ajustement. Un modèle de données métier Lakehouse est conçu à l'image d'une organisation unique dans son secteur, avec la terminologie et les divisions qu'elle utilise réellement.
Chaque modèle est disponible en deux portées, MVM (Minimum Viable Model) et ECM (Expanded Coverage Model), prend en charge trois configurations Unity Catalog (styles de catalogage) et inclut le même ensemble complet d'artefacts.
Positionnement

Un modèle de données métier Lakehouse constitue la couche Silver. La couche Bronze gère l'ingestion brute (Lakeflow, Auto Loader). La couche Silver est le modèle analytique conforme et normalisé à partir duquel chaque analyste, outil de BI et charge de travail de ML effectue ses lectures. La couche Gold est dérivée des analyses (tables de KPI, tables de caractéristiques, agrégats) calculées par-dessus la couche Silver.
Contenu inclus avec chaque modèle
Chaque modèle est publié sous la forme d'un ensemble complet.
`model.json` est le modèle logique qui capture chaque domaine, sous-domaine, produit, attribut, clé étrangère, étiquette de classification et définition de vue de métriques. C'est l'unité de référence. Enregistrez-le dans git, comparez les versions (diff) et partagez-le entre différents environnements.
Un déploiement Unity Catalog de schémas, de tables Delta, de contraintes de clé primaire, de contraintes de clé étrangère (informatives) et d'étiquettes de classification. Les noms exacts des catalogues et des schémas dépendent du style de catalogage choisi lors de l'installation.
Les vues de métriques sont des définitions de KPI réutilisables installées par-dessus les tables physiques, prêtes pour les tableaux de bord AI/BI et AI/BI Genie.
Un graphe de connaissances RDFS (ontology/) exprime le même modèle sous forme de graphe sémantique pour l'intégration d'outils sémantiques et l'ancrage d'agents d'IA.
Un diagramme DBML (diagram/) pour une exploration visuelle dans dbdiagram.io ou tout autre visualiseur compatible avec le format DBML.
SQL DDL (schemas/) pour l'ensemble du déploiement, organisé par schéma.
La documentation Excel et Markdown générée en parallèle du modèle.
Données d'échantillon synthétiques facultatives. Les lignes basées sur des pools respectent toutes les clés étrangères, les contraintes regex et les étiquettes de classification.
Hiérarchie

Chaque modèle suit la même hiérarchie. L'organisation représente l'ensemble de l'entreprise. Elle comprend trois divisions : Operations (ce que l'entreprise fait physiquement), Business (qui elle sert et comment elle génère des revenus) et Corporate (les fonctions de support). Chaque division contient un ou plusieurs domaines (contextes délimités en un seul mot, en minuscules et au singulier). Chaque domaine contient deux sous-domaines ou plus subdomains (groupements sémantiques de deux mots). Chaque sous-domaine contient des produits (les tables Delta). Chaque produit contient des attributs (les colonnes), avec des types de données et des étiquettes de classification attribués dès le départ.
Les divisions Operations et Business combinées regroupent toujours au moins 80 % des domaines ; la division Corporate est limitée à 20 %. Ce ratio permet de maintenir chaque modèle centré sur l'activité réelle de l'entreprise plutôt que sur ses fonctions administratives.
Chaque modèle est également un graphe orienté acyclique (DAG) par construction. Les clés étrangères pointent toujours de l'enfant vers le parent (order.customer_id, jamais customer.latest_order_id) ; les cycles sont éliminés avant la publication ; chaque domaine est connecté à au moins un autre par des clés étrangères, de sorte que les analyses inter-domaines sont toujours possibles.
Deux portées : MVM et ECM

MVM (Minimum Viable Model) représente 30 à 50 % du nombre de tables de l'ECM et ne couvre que les fonctions métier essentielles, dimensionné pour les projets de PME, les pilotes et les environnements de développement/test.
ECM (Expanded Coverage Model) offre une couverture d'entreprise complète, y compris les domaines de support Corporate, dimensionné pour les déploiements Fortune 100. La profondeur des attributs est identique pour les deux portées. Le MVM n'est pas un squelette, mais simplement une surface d'exposition plus restreinte.
Comparons le MVM et l'ECM plus en détail.

Modèles disponibles pour les secteurs des communications, des médias et du divertissement
Pour commencer, nous proposons actuellement 4 modèles disponibles en version MVM ou ECM. Ces modèles sont :
| Secteur | Domaines ECM | Produits ECM | Domaines MVM | Produits MVM |
|---|---|---|---|---|
| Télécommunications | 20 | 451 | 15 | 167 |
| Médias et diffusion | 17 | 421 | 14 | 186 |
| Sports et divertissement | 19 | 473 | 14 | 200 |
| Jeux vidéo | 17 | 396 | 14 | 176 |
| Publicité | 13 | 262 | 10 | 95 |
Publicité ~ un exemple
En consultant le dépôt, vous pouvez voir une comparaison des types de modèles MVM et ECM afin de prendre la bonne décision concernant le périmètre de modèle qui vous intéresse.

Cela inclut un examen détaillé des domaines et des produits disponibles.

Vous pouvez obtenir des détails sur ce qui fait partie du périmètre du modèle sélectionné. Cela comprend des instructions, des exemples, de la documentation et des notes de version.

Si vous êtes prêt à déployer le modèle dans votre environnement, consultez le fichier readme du dépôt principal pour suivre les étapes. Globalement, il vous suffit d'exécuter le notebook d'installation orienté vers le secteur et le périmètre de modèle qui vous intéressent.
Démarrer
La bibliothèque se trouve dans le dépôt Industry Solutions : https://github.com/databricks-industry-solutions/lakehouse-industry-data-models/tree/main. Choisissez un modèle, un périmètre (MVM ou ECM), un style de catalogage, un catalogue de déploiement, et exécutez le notebook d'installation. Une installation MVM classique se termine en quelques dizaines de minutes, contre moins de deux heures pour Databricks Serverless. Les deux produisent une couche Silver entièrement déployée dans Unity Catalog avec des vues de métriques prêtes pour les tableaux de bord AI/BI et AI/BI Genie.
Chaque modèle est un point de départ. Les clients qui ont besoin d'adapter un modèle à leur organisation (renommer des domaines, fusionner ou diviser des produits, ajouter un domaine manquant, modifier les conventions de nommage) peuvent le faire à l'aide de Modeling Agent, qui fait évoluer le modèle via des directives en langage naturel.
Ressources associées
Pour plus d'informations, consultez la première partie de notre article de blog sur la modélisation des données ~ Démarrez rapidement votre modélisation de données avec Databricks Industry Data Models
https://www.databricks.com/blog/jumpstart-your-data-modeling-databricks-industry-data-models
