Passa al contenuto principale

Modelli di dati aziendali Lakehouse per il settore energia e risorse

Una libreria di modelli di dati aziendali di livello Silver pronti per la produzione, uno per settore, distribuiti in Unity Catalog come base analitica di un lakehouse Databricks: completi, governati e internamente coerenti fin dal primo giorno.

Lakehouse medallion layers with the Silver business data model

Modelli di dati aziendali di Databricks Lakehouse

Dove si colloca

Un modello di dati aziendali Lakehouse è il livello Silver. Il livello Bronze gestisce l'ingestione dei dati grezzi (Lakeflow, Auto Loader). Il livello Silver è il modello analitico standardizzato e normalizzato da cui leggono tutti gli analisti, gli strumenti di BI e i carichi di lavoro ML. Il livello Gold deriva da insight (tabelle KPI, tabelle delle feature, aggregati) calcolati a partire dal livello Silver.

Modelli di dati aziendali di Databricks Lakehouse e dove si collocano

Cosa include ciascun modello

Ogni modello viene pubblicato come un pacchetto completo.

`model.json` è il modello logico che acquisisce ogni definizione di dominio, sottodominio, prodotto, attributo, chiave esterna, tag di classificazione e vista metrica. È l'elemento cardine. Esegui il commit su Git, confronta le differenze tra le versioni e condividilo tra i vari ambienti.

Un'implementazione in Unity Catalog di schemi, tabelle Delta, vincoli di chiave primaria, vincoli di chiave esterna (informativi) e tag di classificazione. I nomi esatti del catalogo e dello schema dipendono dallo stile di catalogazione scelto durante l'installazione.

Le viste metriche sono definizioni di KPI riutilizzabili installate sopra le tabelle fisiche, pronte per le dashboard di AI/BI e per AI/BI Genie.

Un grafo di conoscenza RDFS (ontology/) esprime lo stesso modello sotto forma di grafo semantico per l'integrazione di strumenti semantici e il grounding degli agenti AI.

Un diagramma DBML (diagram/) per l'esplorazione visiva in dbdiagram.io o in qualsiasi visualizzatore compatibile con DBML.

SQL DDL (schemas/) per l'intera implementazione, organizzato per schema.

La documentazione in formato Excel e Markdown viene generata insieme al modello.

Dati di esempio sintetici facoltativi. Le righe basate su pool rispettano tutte le chiavi esterne, i vincoli regex e i tag di classificazione.

Gerarchia

Gerarchia organizzativa

Ogni modello segue la stessa gerarchia. L'organizzazione rappresenta l'intera azienda. Contiene tre divisioni: Operations (ciò che l'azienda fa fisicamente), Business (a chi si rivolge e come guadagna) e Corporate (il back office di supporto). Ogni divisione contiene uno o più domini (contesti delimitati espressi con una sola parola, in minuscolo e al singolare). Ogni dominio contiene due o più sottodomini (raggruppamenti semantici di due parole). Ogni sottodominio contiene prodotti (le tabelle Delta). Ogni prodotto contiene attributi (le colonne), con tipi di dati e tag di classificazione assegnati in anticipo.

Insieme, Operations e Business contengono sempre almeno l'80% dei domini, mentre Corporate è limitato al 20%. Questo rapporto fa sì che ogni modello rimanga incentrato sulle attività che fanno effettivamente funzionare l'azienda, piuttosto che sul suo back office amministrativo.

Inoltre, ogni modello è per costruzione un grafo aciclico diretto. Le chiavi esterne puntano sempre da figlio a genitore (order.customer_id, mai customer.latest_order_id); i cicli vengono interrotti prima della pubblicazione; ogni dominio si collega ad almeno un altro tramite chiavi esterne, rendendo sempre possibile l'analisi cross-domain.

Due ambiti: MVM ed ECM

Due ambiti: MVM ed ECM

MVM (Minimum Viable Model) rappresenta dal 30 al 50 percento del numero di tabelle dell'ECM e copre solo le funzioni aziendali essenziali, con dimensioni pensate per progetti SMB, progetti pilota e ambienti di sviluppo/test.

L'ECM (Expanded Coverage Model) offre una copertura aziendale completa, inclusi i domini Corporate di supporto, con dimensioni pensate per implementazioni in aziende Fortune 100. La profondità degli attributi è identica in entrambi gli ambiti. L'MVM non è una struttura ridotta all'osso, ha semplicemente un'area di copertura inferiore.

Confrontiamo più in dettaglio MVM ed ECM.

Tabella di confronto diretto

Cosa è disponibile per il settore energia e risorse

Come punto di partenza, al momento abbiamo 4 modelli disponibili come MVM o ECM. Questi modelli sono:

Estrazione mineraria: un esempio

Esaminando il repository per il settore minerario, puoi vedere un confronto tra i tipi di modello MVM ed ECM, in modo da poter prendere una decisione informata sull'ambito del modello a cui sei interessato.

Confronto delle metriche del modello

Questo include una panoramica dettagliata dei domini e dei prodotti disponibili.

Community

Puoi ottenere dettagli su ciò che fa parte dell'ambito del modello selezionato. Questo include istruzioni, esempi, documentazione e note di rilascio.

Struttura della cartella di output

Se sei pronto a distribuire il modello nel tuo ambiente, consulta il file readme nel repository principale per seguire i passaggi descritti. A grandi linee, tutto ciò che devi fare è eseguire il notebook di installazione puntato sul settore e sull'ambito del modello di tuo interesse.

Comincia

La libreria si trova nel repository Industry Solutions: https://github.com/databricks-industry-solutions/lakehouse-industry-data-models/tree/main. Scegli un modello, un ambito (MVM o ECM), uno stile di catalogazione, un catalogo di distribuzione ed esegui il notebook di installazione. Una tipica installazione MVM si completa in decine di minuti, rispetto a Databricks Serverless, che richiede meno di due ore. Entrambi producono un livello Silver completamente distribuito in Unity Catalog con viste metriche pronte per le dashboard AI/BI e AI/BI Genie.

Ogni modello è un punto di partenza. I clienti che hanno l'esigenza di adattare un modello alla propria organizzazione (rinominare domini, unire o dividere prodotti, aggiungere un dominio mancante, modificare le convenzioni di denominazione) possono farlo utilizzando il Modeling Agent, che itera il modello attraverso direttive in linguaggio naturale.

Risorse correlate

Per maggiori informazioni, consulta la prima parte del nostro post del blog Avvia rapidamente la modellazione dei dati con Databricks Industry Data Models.