Modelli di dati aziendali Lakehouse per il settore sanitario e delle scienze della vita
Modelli di dati aziendali governati (livello Silver, Sanità & Scienze della vita), pronti per la produzione e distribuibili in Unity Catalog come base analitica di un lakehouse Databricks — coerenti fin dal primo giorno.

Modelli di dati aziendali di Databricks Lakehouse
Posizionamento
Un modello di dati aziendali Lakehouse è il livello Silver. Bronze gestisce l'acquisizione dei dati grezzi (Lakeflow, Auto Loader). Silver è il modello analitico conformato e normalizzato da cui leggono tutti gli analisti, gli strumenti di BI e i carichi di lavoro di ML. Gold è derivato da insight (tabelle KPI, tabelle delle feature, aggregati) calcolati sul livello Silver.

Cosa include ogni modello
Ogni modello viene pubblicato come un pacchetto completo.
`model.json` è il modello logico che raccoglie ogni definizione di dominio, sottodominio, prodotto, attributo, chiave esterna, tag di classificazione e vista delle metriche. È l'unità di riferimento. Esegui il check-in in Git, fai il diff tra le versioni e condividi tra ambienti.
Un'implementazione di Unity Catalog di schemi, tabelle Delta, vincoli di chiave primaria, vincoli di chiave esterna (informativi) e tag di classificazione. I nomi esatti del catalogo e dello schema dipendono dallo stile di catalogazione scelto durante l'installazione.
Le viste delle metriche sono definizioni di KPI riutilizzabili installate sopra le tabelle fisiche, pronte per le dashboard di AI/BI e per AI/BI Genie.
Un grafo di conoscenza RDFS (ontology/) esprime lo stesso modello di un grafo semantico per l'integrazione di strumenti semantici e il grounding degli agenti AI.
Un diagramma DBML (diagram/) per l'esplorazione visiva in dbdiagram.io o qualsiasi visualizzatore compatibile con DBML.
SQL DDL (schemas/) per l'intera implementazione, organizzato per schema.
La documentazione Excel e Markdown è stata generata insieme al modello.
Dati di esempio sintetici facoltativi. Le righe basate su pool rispettano tutte le chiavi esterne, i vincoli regex e i tag di classificazione.
Gerarchia

Ogni modello segue la stessa gerarchia. L'organizzazione è l'intera azienda. Contiene tre divisioni: attività operative (ciò che l'azienda fa fisicamente), Business (a chi si rivolge e come guadagna) e Corporate (il back office di supporto). Ogni divisione contiene uno o più domini (contesti delimitati da una sola parola, in minuscolo, al singolare). Ogni dominio contiene due o più sottodomini (raggruppamenti semantici di due parole). Ogni sottodominio contiene prodotti (le tabelle Delta). Ogni prodotto contiene attributi (le colonne), con tipi di dati e tag di classificazione assegnati in anticipo.
Le attività operative e il business combinati detengono sempre almeno l'80% dei domini, mentre l'ambito Corporate è limitato al 20%. Questo rapporto fa sì che ogni modello sia incentrato su ciò che fa funzionare effettivamente l'azienda, piuttosto che sul suo back office amministrativo.
Ogni modello è anche un Grafo Aciclico Diretto per costruzione. Le chiavi esterne puntano sempre dal figlio al genitore (order.customer_id, mai customer.latest_order_id); i cicli vengono interrotti prima della pubblicazione; ogni dominio si collega ad almeno un altro tramite chiavi esterne, quindi le analitiche tra domini sono sempre possibili.
Due ambiti: MVM e ECM

MVM (Minimum Viable Model) rappresenta dal 30 al 50 percento del conteggio delle tabelle ECM e copre solo le funzioni aziendali essenziali, dimensionate per progetti SMB, pilota e ambienti di sviluppo/test.
L'ECM (Expanded Coverage Model) offre una copertura aziendale completa, che include il supporto per i domini Corporate, ed è dimensionato per le implementazioni Fortune 100. La profondità degli attributi è identica in entrambi gli ambiti. L'MVM non è uno scheletro, ma solo una superficie più ridotta.
Confrontiamo più in dettaglio MVM ed ECM.

Cosa è disponibile per i settori industriali della sanità e delle scienze della vita
Come punto di partenza, al momento abbiamo 4 modelli disponibili come MVM o ECM. Questi modelli sono:
| INDUSTRIA | Domini ECM | Prodotti ECM | Domini MVM | Prodotti MVM |
|---|---|---|---|---|
| Sanità | 22 | 541 | 16 | 189 |
| Farmaceutico | 19 | 441 | 15 | 213 |
| Genomica e biotecnologia | 19 | 403 | 15 | 182 |
| Sperimentazioni cliniche | 19 | 379 | 13 | 193 |
Sanità ~ Un esempio
Consultando il repository, è possibile vedere un confronto tra i tipi di modello MVM ed ECM, in modo da poter prendere una decisione informata sull'ambito del modello di proprio interesse.

Questo include una revisione dettagliata dei Domini e dei Prodotti disponibili.

È possibile ottenere dettagli sugli elementi inclusi nell'ambito del modello selezionato. Sono incluse istruzioni, esempi, documentazione e note di rilascio.

Se sei pronto a implementare il modello nel tuo ambiente, consulta il file readme nel repository principale per seguire la procedura dettagliata. A livello generale, è sufficiente eseguire il Notebook del programma di installazione puntando al settore industriale e all'ambito del modello che ti interessa.
Comincia
La libreria si trova nel repo Industry Solutions: https://github.com/databricks-industry-solutions/lakehouse-industry-data-models/tree/main. Scegli un modello, un ambito (MVM o ECM), uno stile di catalogazione, un catalogo di deployment e avvia il notebook di installazione. Un'installazione MVM tipica viene completata in decine di minuti, rispetto a Databricks Serverless, che richiede meno di due ore. Entrambi producono un layer Silver completamente implementato in Unity Catalog con viste delle metriche pronte per le dashboard AI/BI e AI/BI Genie.
Ogni modello è un punto di partenza. I clienti che devono adattare un modello alla propria organizzazione (rinominare domini, Merge o dividere prodotti, aggiungere un dominio mancante, modificare le convenzioni di denominazione) possono farlo utilizzando il Modeling Agent, che itera il modello tramite direttive in linguaggio naturale.
Risorse correlate
Per ulteriori informazioni, consulta la prima parte della nostra serie di blog sulla modellazione dei dati ~ Jumpstart your Data Modeling with Databricks Industry Data Models
Ottieni i Databricks Lakehouse Industry Data Models su GitHub ~ Lakehouse Industry Data Models on GitHub
