Modelos de datos empresariales de Lakehouse para Salud y Ciencias de la Vida
Modelos de datos empresariales gobernados (capa Silver, Salud y Ciencias de la vida), listos para producción e implementables en Unity Catalog como base analítica de un lakehouse de Databricks — coherentes desde el primer día.

Modelos de datos empresariales de Databricks Lakehouse
Dónde se encuentra
Un modelo de datos de negocio del Lakehouse es la capa Silver. La capa Bronze se encarga de la ingesta de datos sin procesar (Lakeflow, Auto Loader). La capa Silver es el modelo analítico conformado y normalizado del que leen todos los analistas, las herramientas de BI y las cargas de trabajo de ML. La capa Gold se deriva de las conclusiones (tablas de KPI, tablas de características, agregados) calculadas sobre la capa Silver.

Qué incluye cada modelo
Cada modelo se publica como un paquete completo.
`model.json` es el modelo lógico que captura cada dominio, subdominio, producto, atributo, clave foránea, etiqueta de clasificación y definición de vista de métrica. Es la unidad de cambio. Regístralo en Git, compara las diferencias entre versiones y compártelo entre entornos.
Una implementación de Unity Catalog de esquemas, tablas Delta, restricciones de clave principal, restricciones de clave externa (informativas) y etiquetas de clasificación. Los nombres exactos del catálogo y del esquema dependen del estilo de catalogación elegido durante la instalación.
Las vistas de métricas son definiciones de KPI reutilizables instaladas sobre las tablas físicas, listas para los dashboards de IA/BI y para AI/BI Genie.
Un grafo de conocimiento RDFS (ontology/) expresa el mismo modelo que un grafo semántico para la integración de herramientas semánticas y el anclaje de agentes de IA.
Un diagrama DBML (diagram/) para la exploración visual en dbdiagram.io o cualquier visor compatible con DBML.
SQL DDL (schemas/) para toda la implementación, organizado por esquema.
La documentación de Excel y Markdown se generó junto con el modelo.
Datos de muestra sintéticos opcionales. Las filas basadas en el pool respetan todas las claves foráneas, las restricciones de regex y las etiquetas de clasificación.
Jerarquía

Cada modelo sigue la misma jerarquía. La organización es toda la empresa. Contiene tres divisiones: Operaciones (lo que la empresa hace físicamente), Negocios (a quién sirve y cómo obtiene ganancias) y Corporativo (el back office de soporte). Cada división contiene uno o más dominios (contextos delimitados en singular, de una palabra y en minúsculas). Cada dominio contiene dos o más subdominios (agrupaciones semánticas de dos palabras). Cada subdominio contiene productos (las tablas Delta). Cada producto contiene atributos (las columnas), con tipos de datos y etiquetas de clasificación asignados por adelantado.
Las áreas de Operaciones y Negocios combinadas siempre tienen al menos el 80 % de los dominios; el área Corporativa tiene un tope del 20 %. Esta proporción hace que cada modelo se centre en lo que realmente dirige el negocio, en lugar de en su trastienda administrativa.
Cada modelo es también un Grafo Acíclico Dirigido por construcción. Las claves foráneas siempre apuntan de hijo a padre (order.customer_id, nunca customer.latest_order_id); los ciclos se rompen antes de la publicación; cada dominio se conecta con al menos otro a través de claves foráneas, por lo que el análisis entre dominios siempre es posible.
Dos alcances: MVM y ECM

MVM (Modelo Mínimo Viable) representa del 30 al 50 por ciento del recuento de tablas de ECM y cubre solo las funciones empresariales esenciales. Está diseñado para proyectos con pymes, proyectos piloto y entornos de desarrollo y prueba.
ECM (Modelo de cobertura ampliada) es un modelo de alcance empresarial completo, que incluye soporte para dominios corporativos, dimensionado para implementaciones de Fortune 100. La profundidad de los atributos es idéntica en ambos alcances. MVM no es un esqueleto, solo un alcance más reducido.
Comparemos el MVM y el ECM con más detalle.

¿Qué está disponible para las industrias de la salud y las ciencias biológicas?
Como punto de partida, actualmente tenemos 4 modelos disponibles como MVM o ECM. Estos modelos son:
| Industria | Dominios de ECM | Productos ECM | Dominios de MVM | Productos MVM |
|---|---|---|---|---|
| Asistencia médica | 22 | 541 | 16 | 189 |
| Productos farmacéuticos | 19 | 441 | 15 | 213 |
| Genómica & Biotecnología | 19 | 403 | 15 | 182 |
| Ensayos clínicos | 19 | 379 | 13 | 193 |
Atención médica ~ un ejemplo
Al observar el repositorio, puede ver una comparación de los tipos de modelo MVM y ECM para que pueda tomar una buena decisión sobre el alcance del modelo que le interesa.

Esto incluye una revisión detallada de los dominios y productos disponibles.

Puedes obtener detalles sobre qué forma parte del alcance del modelo seleccionado. Esto incluye instrucciones, muestras, documentación y notas de la versión.

Si estás listo para desplegar el modelo en tu entorno, consulta el readme en el repositorio principal para seguir los pasos. A grandes rasgos, todo lo que necesitas es ejecutar el notebook de instalación dirigido a la industria y al alcance del modelo que te interesan.
Empieza ahora
La biblioteca se encuentra en el repositorio de Soluciones para la Industria: https://github.com/databricks-industry-solutions/lakehouse-industry-data-models/tree/main. Elige un modelo, un alcance (MVM o ECM), un estilo de catalogación, un catálogo de implementación y ejecuta el notebook de instalación. Una instalación típica de MVM se completa en decenas de minutos, en comparación con Databricks Serverless, que tarda menos de dos horas. Ambos producen una capa Silver completamente implementada en Unity Catalog con vistas de métricas listas para los dashboards de IA/BI y AI/BI Genie.
Cada modelo es un punto de partida. Los clientes que necesitan adaptar un modelo a su organización (cambiar el nombre de los dominios, fusionar o dividir productos, agregar un dominio faltante, cambiar las convenciones de nomenclatura) pueden hacerlo mediante el Agente de modelado, que itera el modelo a través de directivas de lenguaje natural.
Recursos relacionados
Para obtener más información, consulta la primera parte de nuestra publicación de blog sobre modelado de datos: Impulsa tu modelado de datos con los modelos de datos de la industria de Databricks
Obtén los modelos de datos de la industria de Databricks Lakehouse en GitHub ~ Modelos de datos de la industria de Lakehouse en GitHub
