Modelli di dati aziendali Lakehouse per comunicazioni, media e intrattenimento
Modelli di dati aziendali Silver-layer governati e pronti per la produzione per comunicazioni, media e intrattenimento, distribuibili direttamente in Unity Catalog come base analitica di un lakehouse Databricks, coerenti fin dal primo giorno.

Modelli di dati aziendali Databricks Lakehouse
Una libreria di quaranta modelli di dati aziendali di livello Silver pronti per la produzione, uno per settore, che si distribuiscono direttamente in Unity Catalog come base analitica di un lakehouse Databricks.
Ogni modello è completo, governato e internamente coerente fin dal primo giorno. Ogni dominio, tabella, colonna, chiave esterna, tag di classificazione e vista metrica è già definito. I modelli di settore generici fanno una media di ogni attività in un settore, risparmiando ai clienti mesi di lavoro di rifinitura. Un modello di dati aziendali Lakehouse è strutturato come una singola organizzazione nel suo settore, con la terminologia e le divisioni che utilizza effettivamente.
Ogni modello viene fornito in due ambiti, MVM (Minimum Viable Model) e ECM (Expanded Coverage Model), supporta tre layout di Unity Catalog (stili di catalogazione) e include lo stesso pacchetto completo di artefatti.
Collocazione

Un modello di dati aziendali Lakehouse rappresenta il livello Silver. Il livello Bronze gestisce l'ingestione dei dati grezzi (Lakeflow, Auto Loader). Il livello Silver è il modello analitico standardizzato e normalizzato da cui leggono tutti gli analisti, gli strumenti di BI e i carichi di lavoro di ML. Il livello Gold deriva dagli insight (tabelle KPI, tabelle delle feature, aggregati) calcolati sul livello Silver.
Cosa include ogni modello
Ogni modello viene pubblicato come pacchetto completo.
`model.json` è il modello logico che acquisisce ogni definizione di dominio, sottodominio, prodotto, attributo, chiave esterna, tag di classificazione e vista metrica. È l'unità fondamentale. Esegui il commit in git, confronta le differenze tra le versioni e condividilo tra i vari ambienti.
Una distribuzione di Unity Catalog di schemi, tabelle Delta, vincoli di chiave primaria, vincoli di chiave esterna (informativi) e tag di classificazione. I nomi esatti del catalogo e dello schema dipendono dallo stile di catalogazione scelto durante l'installazione.
Le viste metriche sono definizioni di KPI riutilizzabili installate sopra le tabelle fisiche, pronte per le dashboard AI/BI e AI/BI Genie.
Un knowledge graph RDFS (ontology/) esprime lo stesso modello come grafo semantico per l'integrazione di strumenti semantici e il grounding degli agenti AI.
Un diagramma DBML (diagram/) per l'esplorazione visiva in dbdiagram.io o qualsiasi visualizzatore compatibile con DBML.
SQL DDL (schemas/) per l'intera distribuzione, organizzato per schema.
La documentazione Excel e Markdown generata insieme al modello.
Dati di esempio sintetici opzionali. Le righe basate su pool rispettano tutte le chiavi esterne, i vincoli regex e i tag di classificazione.
Gerarchia

Ogni modello segue la stessa gerarchia. L'organizzazione rappresenta l'intera azienda. Contiene tre divisioni: Operations (ciò che l'azienda fa fisicamente), Business (chi serve e come guadagna) e Corporate (il back office di supporto). Ogni divisione contiene uno o più domini (contesti delimitati a parola singola, minuscoli e singolari). Ogni dominio contiene due o più sottodomini (raggruppamenti semantici di due parole). Ogni sottodominio contiene prodotti (le tabelle Delta). Ogni prodotto contiene attributi (le colonne), con tipi di dati e tag di classificazione assegnati in anticipo.
Operations e Business combinati contengono sempre almeno l'80% dei domini; Corporate è limitato al 20%. Questo rapporto mantiene ogni modello incentrato su ciò che effettivamente gestisce l'attività, piuttosto che sul suo back office amministrativo.
Ogni modello è anche un grafo aciclico diretto per costruzione. Le chiavi esterne puntano sempre da figlio a genitore (order.customer_id, mai customer.latest_order_id); i cicli vengono interrotti prima della pubblicazione; ogni dominio si collega ad almeno un altro tramite chiavi esterne, in modo che l'analisi tra domini diversi sia sempre possibile.
Due ambiti: MVM e ECM

MVM (Minimum Viable Model) rappresenta dal 30 al 50 percento del numero di tabelle ECM e copre solo le funzioni aziendali essenziali, dimensionato per progetti SMB, progetti pilota e ambienti di sviluppo/test.
ECM (Expanded Coverage Model) offre un'ampiezza aziendale completa, inclusi i domini Corporate di supporto, dimensionato per implementazioni Fortune 100. La profondità degli attributi è identica in entrambi gli ambiti. MVM non è uno scheletro, ma solo un'area di superficie più ridotta.
Confrontiamo MVM ed ECM in modo più dettagliato.

Cosa è disponibile per i settori delle comunicazioni, dei media e dell'intrattenimento
Come punto di partenza, attualmente abbiamo 4 modelli disponibili come MVM o ECM. Questi modelli sono:
| Settore | Domini ECM | Prodotti ECM | Domini MVM | Prodotti MVM |
|---|---|---|---|---|
| Telecomunicazioni | 20 | 451 | 15 | 167 |
| Media & Broadcasting | 17 | 421 | 14 | 186 |
| Sport & intrattenimento | 19 | 473 | 14 | 200 |
| Gaming | 17 | 396 | 14 | 176 |
| Pubblicità | 13 | 262 | 10 | 95 |
Pubblicità ~ Un esempio
Esplorando il repository, puoi vedere un confronto tra i tipi di modello MVM ed ECM, così da poter scegliere con facilità l'ambito del modello che ti interessa.

Questo include una panoramica dettagliata dei domini e dei prodotti disponibili.

Puoi ottenere dettagli su ciò che fa parte dell'ambito del modello selezionato. Questo include istruzioni, esempi, documentazione e note di rilascio.

Se vuoi distribuire il modello nel tuo ambiente, consulta il file readme nel repository principale per seguire i passaggi. In sintesi, ti basta eseguire il notebook di installazione indirizzato al settore e all'ambito del modello di tuo interesse.
Per iniziare
La libreria si trova nel repository Industry Solutions: https://github.com/databricks-industry-solutions/lakehouse-industry-data-models/tree/main. Scegli un modello, un ambito (MVM o ECM), uno stile di catalogazione, un catalogo di distribuzione ed esegui il notebook di installazione. In genere, un'installazione MVM richiede poche decine di minuti, mentre con Databricks Serverless ci vogliono meno di due ore. Entrambe le opzioni creano un livello Silver completamente distribuito in Unity Catalog con viste metriche pronte per i dashboard AI/BI e AI/BI Genie.
Ogni modello è un punto di partenza. I clienti che hanno l'esigenza di adattare un modello alla propria organizzazione (rinominare domini, unire o dividere prodotti, aggiungere un dominio mancante, modificare le convenzioni di denominazione) possono farlo utilizzando il Modeling Agent, che aggiorna il modello tramite istruzioni in linguaggio naturale.
Risorse correlate
Per ulteriori informazioni, consulta la prima parte del nostro blog post sulla modellazione dei dati ~ Dai slancio alla tua modellazione dei dati con i Databricks Industry Data Models
https://www.databricks.com/blog/jumpstart-your-data-modeling-databricks-industry-data-models
