Modelli di dati di business Lakehouse per il settore pubblico e i servizi
Modelli di dati aziendali di livello Silver pronti per la produzione e governati per il settore pubblico e i servizi che vengono implementati direttamente in Unity Catalog come base analitica di una lakehouse Databricks—coerenti fin dal primo giorno.

Modelli di dati aziendali di Databricks Lakehouse
Una libreria di quaranta modelli di dati aziendali Silver-layer pronti per la produzione, uno per settori industriali, distribuibili direttamente in Unity Catalog come base analitica di una lakehouse Databricks.
Ogni modello è completo, governato e internamente coerente fin dal primo giorno. Ogni dominio, tabella, colonna, chiave esterna, tag di classificazione e vista delle metriche è già definito. I Template di settori industriali generici si basano su una media di tutte le aziende di un settore, lasciando ai clienti mesi di lavoro di adattamento. Un modello di dati aziendali Lakehouse è modellato come un'unica organizzazione nel suo settore, con la terminologia e le divisioni che utilizza effettivamente.
Ogni modello viene fornito in due ambiti, MVM (Minimum Viable Model) ed ECM (Expanded Coverage Model), supporta tre layout di Unity Catalog (stili di catalogazione) e include lo stesso pacchetto completo di artefatti.
Dove si colloca

Un modello di dati aziendali Lakehouse è il livello Silver. Il livello Bronze gestisce l'ingestione dei dati grezzi (Lakeflow, Auto Loader). Il livello Silver è il modello analitico standardizzato e normalizzato da cui leggono tutti gli analisti, gli strumenti di BI e i carichi di lavoro ML. Il livello Gold deriva da insight (tabelle KPI, tabelle delle feature, aggregati) calcolati a partire dal livello Silver.
Cosa include ciascun modello
Ogni modello viene pubblicato come un pacchetto completo.
`model.json` è il modello logico che acquisisce ogni definizione di dominio, sottodominio, prodotto, attributo, chiave esterna, tag di classificazione e vista metrica. È l'elemento cardine. Esegui il commit su Git, confronta le differenze tra le versioni e condividilo tra i vari ambienti.
Un'implementazione in Unity Catalog di schemi, tabelle Delta, vincoli di chiave primaria, vincoli di chiave esterna (informativi) e tag di classificazione. I nomi esatti del catalogo e dello schema dipendono dallo stile di catalogazione scelto durante l'installazione.
Le viste metriche sono definizioni di KPI riutilizzabili installate sopra le tabelle fisiche, pronte per le dashboard di AI/BI e per AI/BI Genie.
Un grafo di conoscenza RDFS (ontology/) esprime lo stesso modello sotto forma di grafo semantico per l'integrazione di strumenti semantici e il grounding degli agenti AI.
Un diagramma DBML (diagram/) per l'esplorazione visiva in dbdiagram.io o in qualsiasi visualizzatore compatibile con DBML.
SQL DDL (schemas/) per l'intera implementazione, organizzato per schema.
La documentazione in formato Excel e Markdown viene generata insieme al modello.
Dati di esempio sintetici facoltativi. Le righe basate su pool rispettano tutte le chiavi esterne, i vincoli regex e i tag di classificazione.
Gerarchia

Ogni modello segue la stessa gerarchia. L'organizzazione rappresenta l'intera azienda. Contiene tre divisioni: Operations (ciò che l'azienda fa fisicamente), Business (a chi si rivolge e come guadagna) e Corporate (il back office di supporto). Ogni divisione contiene uno o più domini (contesti delimitati espressi con una sola parola, in minuscolo e al singolare). Ogni dominio contiene due o più sottodomini (raggruppamenti semantici di due parole). Ogni sottodominio contiene prodotti (le tabelle Delta). Ogni prodotto contiene attributi (le colonne), con tipi di dati e tag di classificazione assegnati in anticipo.
Insieme, Operations e Business contengono sempre almeno l'80% dei domini, mentre Corporate è limitato al 20%. Questo rapporto fa sì che ogni modello rimanga incentrato sulle attività che fanno effettivamente funzionare l'azienda, piuttosto che sul suo back office amministrativo.
Inoltre, ogni modello è per costruzione un grafo aciclico diretto. Le chiavi esterne puntano sempre da figlio a genitore (order.customer_id, mai customer.latest_order_id); i cicli vengono interrotti prima della pubblicazione; ogni dominio si collega ad almeno un altro tramite chiavi esterne, rendendo sempre possibile l'analisi cross-domain.
Due ambiti: MVM ed ECM

MVM (Minimum Viable Model) rappresenta dal 30 al 50 percento del numero di tabelle dell'ECM e copre solo le funzioni aziendali essenziali, con dimensioni pensate per progetti SMB, progetti pilota e ambienti di sviluppo/test.
L'ECM (Expanded Coverage Model) offre una copertura aziendale completa, inclusi i domini Corporate di supporto, con dimensioni pensate per implementazioni in aziende Fortune 100. La profondità degli attributi è identica in entrambi gli ambiti. L'MVM non è una struttura ridotta all'osso, ha semplicemente un'area di copertura inferiore.
Confrontiamo più in dettaglio MVM ed ECM.

Cosa è disponibile per il settore pubblico e i settori industriali dei servizi
Come punto di partenza, al momento abbiamo 4 modelli disponibili come MVM o ECM. Questi modelli sono:
| INDUSTRIA | Domini ECM | Prodotti ECM | Domini MVM | Prodotti MVM |
|---|---|---|---|---|
| Istruzione | 17 | 446 | 14 | 203 |
| ONG | 15 | 302 | 12 | 141 |
| Legale | 15 | 314 | 12 | 153 |
| Gestione dei rifiuti | 17 | 471 | 12 | 194 |
| Personale e risorse umane | 16 | 302 | 12 | 153 |
| Immobiliare | 16 | 344 | 14 | 177 |
Istruzione ~ un esempio
Esaminando il repository per il settore minerario, puoi vedere un confronto tra i tipi di modello MVM ed ECM, in modo da poter prendere una decisione informata sull'ambito del modello a cui sei interessato.

Questo include una panoramica dettagliata dei domini e dei prodotti disponibili.

Puoi ottenere dettagli su ciò che fa parte dell'ambito del modello selezionato. Questo include istruzioni, esempi, documentazione e note di rilascio.

Se sei pronto a distribuire il modello nel tuo ambiente, consulta il file readme nel repository principale per seguire i passaggi descritti. A grandi linee, tutto ciò che devi fare è eseguire il notebook di installazione puntato sul settore e sull'ambito del modello di tuo interesse.
Comincia
La libreria si trova nel repository Industry Solutions: https://github.com/databricks-industry-solutions/lakehouse-industry-data-models/tree/main. Scegli un modello, un ambito (MVM o ECM), uno stile di catalogazione, un catalogo di distribuzione ed esegui il notebook di installazione. Una tipica installazione MVM si completa in decine di minuti, rispetto a Databricks Serverless, che richiede meno di due ore. Entrambi producono un livello Silver completamente distribuito in Unity Catalog con viste metriche pronte per le dashboard AI/BI e AI/BI Genie.
Ogni modello è un punto di partenza. I clienti che hanno l'esigenza di adattare un modello alla propria organizzazione (rinominare domini, unire o dividere prodotti, aggiungere un dominio mancante, modificare le convenzioni di denominazione) possono farlo utilizzando il Modeling Agent, che itera il modello attraverso direttive in linguaggio naturale.
Risorse correlate
Per maggiori informazioni, consulta la prima parte della nostra serie di post sulla modellazione dei dati ~ Jumpstart your Data Modeling with Databricks Industry Data Models
https://www.databricks.com/blog/jumpstart-your-data-modeling-databricks-industry-data-models