Passa al contenuto principale

Modelli di dati di business Lakehouse per il settore pubblico e i servizi

Modelli di dati aziendali di livello Silver pronti per la produzione e governati per il settore pubblico e i servizi che vengono implementati direttamente in Unity Catalog come base analitica di una lakehouse Databricks—coerenti fin dal primo giorno.

Lakehouse medallion layers with the Silver business data model

Modelli di dati aziendali di Databricks Lakehouse

Una libreria di quaranta modelli di dati aziendali Silver-layer pronti per la produzione, uno per settori industriali, distribuibili direttamente in Unity Catalog come base analitica di una lakehouse Databricks.

Ogni modello è completo, governato e internamente coerente fin dal primo giorno. Ogni dominio, tabella, colonna, chiave esterna, tag di classificazione e vista delle metriche è già definito. I Template di settori industriali generici si basano su una media di tutte le aziende di un settore, lasciando ai clienti mesi di lavoro di adattamento. Un modello di dati aziendali Lakehouse è modellato come un'unica organizzazione nel suo settore, con la terminologia e le divisioni che utilizza effettivamente.

Ogni modello viene fornito in due ambiti, MVM (Minimum Viable Model) ed ECM (Expanded Coverage Model), supporta tre layout di Unity Catalog (stili di catalogazione) e include lo stesso pacchetto completo di artefatti.

Dove si colloca

Modelli di dati aziendali di Databricks Lakehouse e dove si collocano

Un modello di dati aziendali Lakehouse è il livello Silver. Il livello Bronze gestisce l'ingestione dei dati grezzi (Lakeflow, Auto Loader). Il livello Silver è il modello analitico standardizzato e normalizzato da cui leggono tutti gli analisti, gli strumenti di BI e i carichi di lavoro ML. Il livello Gold deriva da insight (tabelle KPI, tabelle delle feature, aggregati) calcolati a partire dal livello Silver.

Cosa include ciascun modello

Ogni modello viene pubblicato come un pacchetto completo.

`model.json` è il modello logico che acquisisce ogni definizione di dominio, sottodominio, prodotto, attributo, chiave esterna, tag di classificazione e vista metrica. È l'elemento cardine. Esegui il commit su Git, confronta le differenze tra le versioni e condividilo tra i vari ambienti.

Un'implementazione in Unity Catalog di schemi, tabelle Delta, vincoli di chiave primaria, vincoli di chiave esterna (informativi) e tag di classificazione. I nomi esatti del catalogo e dello schema dipendono dallo stile di catalogazione scelto durante l'installazione.

Le viste metriche sono definizioni di KPI riutilizzabili installate sopra le tabelle fisiche, pronte per le dashboard di AI/BI e per AI/BI Genie.

Un grafo di conoscenza RDFS (ontology/) esprime lo stesso modello sotto forma di grafo semantico per l'integrazione di strumenti semantici e il grounding degli agenti AI.

Un diagramma DBML (diagram/) per l'esplorazione visiva in dbdiagram.io o in qualsiasi visualizzatore compatibile con DBML.

SQL DDL (schemas/) per l'intera implementazione, organizzato per schema.

La documentazione in formato Excel e Markdown viene generata insieme al modello.

Dati di esempio sintetici facoltativi. Le righe basate su pool rispettano tutte le chiavi esterne, i vincoli regex e i tag di classificazione.

Gerarchia

Gerarchia organizzativa

Ogni modello segue la stessa gerarchia. L'organizzazione rappresenta l'intera azienda. Contiene tre divisioni: Operations (ciò che l'azienda fa fisicamente), Business (a chi si rivolge e come guadagna) e Corporate (il back office di supporto). Ogni divisione contiene uno o più domini (contesti delimitati espressi con una sola parola, in minuscolo e al singolare). Ogni dominio contiene due o più sottodomini (raggruppamenti semantici di due parole). Ogni sottodominio contiene prodotti (le tabelle Delta). Ogni prodotto contiene attributi (le colonne), con tipi di dati e tag di classificazione assegnati in anticipo.

Insieme, Operations e Business contengono sempre almeno l'80% dei domini, mentre Corporate è limitato al 20%. Questo rapporto fa sì che ogni modello rimanga incentrato sulle attività che fanno effettivamente funzionare l'azienda, piuttosto che sul suo back office amministrativo.

Inoltre, ogni modello è per costruzione un grafo aciclico diretto. Le chiavi esterne puntano sempre da figlio a genitore (order.customer_id, mai customer.latest_order_id); i cicli vengono interrotti prima della pubblicazione; ogni dominio si collega ad almeno un altro tramite chiavi esterne, rendendo sempre possibile l'analisi cross-domain.

Due ambiti: MVM ed ECM

Due ambiti: MVM ed ECM

MVM (Minimum Viable Model) rappresenta dal 30 al 50 percento del numero di tabelle dell'ECM e copre solo le funzioni aziendali essenziali, con dimensioni pensate per progetti SMB, progetti pilota e ambienti di sviluppo/test.

L'ECM (Expanded Coverage Model) offre una copertura aziendale completa, inclusi i domini Corporate di supporto, con dimensioni pensate per implementazioni in aziende Fortune 100. La profondità degli attributi è identica in entrambi gli ambiti. L'MVM non è una struttura ridotta all'osso, ha semplicemente un'area di copertura inferiore.

Confrontiamo più in dettaglio MVM ed ECM.

Tabella di confronto diretto

Cosa è disponibile per il settore pubblico e i settori industriali dei servizi

Come punto di partenza, al momento abbiamo 4 modelli disponibili come MVM o ECM. Questi modelli sono:

INDUSTRIADomini ECMProdotti ECMDomini MVMProdotti MVM
Istruzione1744614203
ONG1530212141
Legale1531412153
Gestione dei rifiuti1747112194
Personale e risorse umane1630212153
Immobiliare1634414177

Istruzione ~ un esempio

Esaminando il repository per il settore minerario, puoi vedere un confronto tra i tipi di modello MVM ed ECM, in modo da poter prendere una decisione informata sull'ambito del modello a cui sei interessato.

Confronto delle metriche del modello per l'istruzione

Questo include una panoramica dettagliata dei domini e dei prodotti disponibili.

Confronto tra il dominio dei servizi del settore pubblico e i prodotti

Puoi ottenere dettagli su ciò che fa parte dell'ambito del modello selezionato. Questo include istruzioni, esempi, documentazione e note di rilascio.

Struttura della cartella di output

Se sei pronto a distribuire il modello nel tuo ambiente, consulta il file readme nel repository principale per seguire i passaggi descritti. A grandi linee, tutto ciò che devi fare è eseguire il notebook di installazione puntato sul settore e sull'ambito del modello di tuo interesse.

Comincia

La libreria si trova nel repository Industry Solutions: https://github.com/databricks-industry-solutions/lakehouse-industry-data-models/tree/main. Scegli un modello, un ambito (MVM o ECM), uno stile di catalogazione, un catalogo di distribuzione ed esegui il notebook di installazione. Una tipica installazione MVM si completa in decine di minuti, rispetto a Databricks Serverless, che richiede meno di due ore. Entrambi producono un livello Silver completamente distribuito in Unity Catalog con viste metriche pronte per le dashboard AI/BI e AI/BI Genie.

Ogni modello è un punto di partenza. I clienti che hanno l'esigenza di adattare un modello alla propria organizzazione (rinominare domini, unire o dividere prodotti, aggiungere un dominio mancante, modificare le convenzioni di denominazione) possono farlo utilizzando il Modeling Agent, che itera il modello attraverso direttive in linguaggio naturale.

Risorse correlate

Per maggiori informazioni, consulta la prima parte della nostra serie di post sulla modellazione dei dati ~ Jumpstart your Data Modeling with Databricks Industry Data Models
https://www.databricks.com/blog/jumpstart-your-data-modeling-databricks-industry-data-models