Modelos de datos empresariales Lakehouse para energía y recursos
Una biblioteca de modelos de datos empresariales de capa de plata listos para producción, uno por industria, que se implementan en Unity Catalog como la base analítica de un lakehouse de Databricks: completa, gobernada y consistente desde el primer día.

Modelos de datos empresariales Databricks Lakehouse
Dónde se ubica
El modelo de datos empresariales Lakehouse es la capa de plata. La capa de bronce gestiona la ingesta de datos sin procesar (Lakeflow, Auto Loader). La capa de plata es el modelo analítico normalizado y conforme del que leen todos los analistas, herramientas de BI y cargas de trabajo de ML. La capa de oro se deriva de la información (tablas de KPI, tablas de características, agregados) calculada sobre la capa de plata.

Qué incluye cada modelo
Cada modelo se publica como un paquete completo.
`model.json` es el modelo lógico que captura cada dominio, subdominio, producto, atributo, clave externa, etiqueta de clasificación y definición de vista de métrica. Es la moneda de cambio. Regístralo en git, compara las diferencias entre versiones y compártelo en todos los entornos.
Una implementación de Unity Catalog de esquemas, tablas Delta, restricciones de clave primaria, restricciones de clave extranjera (informativas) y etiquetas de clasificación. Los nombres exactos del catálogo y del esquema dependen del estilo de catalogación elegido durante la instalación.
Las vistas de métricas son definiciones reutilizables de KPI instaladas sobre las tablas físicas, listas para los paneles de AI/BI y AI/BI Genie.
Un gráfico de conocimiento RDFS (ontología/) expresa el mismo modelo que un gráfico semántico para la integración de herramientas semánticas y la fundamentación de agentes de IA.
Un diagrama DBML (diagram/) para la exploración visual en dbdiagram.io o cualquier visor compatible con DBML.
SQL DDL (esquemas/) para toda la implementación, organizado por esquema.
La documentación de Excel y Markdown se generó junto con el modelo.
Datos de muestra sintéticos opcionales. Las filas basadas en grupos respetan todas las claves externas, las restricciones de regex y las etiquetas de clasificación.
Jerarquía

Cada modelo sigue la misma jerarquía. La organización es todo el negocio. Contiene tres divisiones: operaciones (lo que hace físicamente el negocio), negocio (a quién sirve y cómo obtiene ingresos) y corporativo (el back office de soporte). Cada división contiene uno o más dominios (contextos delimitados en singular, en minúsculas y de una sola palabra). Cada dominio contiene dos o más subdominios (agrupaciones semánticas de dos palabras). Cada subdominio contiene productos (las tablas Delta). Cada producto contiene atributos (las columnas), con tipos de datos y etiquetas de clasificación asignados de antemano.
Las operaciones y el negocio combinados siempre ocupan al menos el 80 % de los dominios; el área corporativa tiene un límite del 20 %. Esta proporción mantiene a cada modelo centrado en lo que realmente dirige el negocio en lugar de en su back office administrativo.
Cada modelo es también un gráfico acíclico dirigido por construcción. Las claves externas siempre apuntan de elemento secundario a elemento principal (order.customer_id, nunca customer.latest_order_id); los ciclos se rompen antes de la publicación; cada dominio se conecta al menos con otro a través de claves externas, por lo que el análisis entre dominios siempre es posible.
Dos alcances: MVM y ECM

MVM (modelo viable mínimo) representa del 30 al 50 % del recuento de tablas de ECM y cubre solo las funciones empresariales esenciales, dimensionadas para compromisos de pymes, pilotos y entornos de desarrollo/pruebas.
ECM (modelo de cobertura ampliada) ofrece una cobertura completa para toda la empresa, incluida la compatibilidad con dominios corporativos, y está dimensionado para implementaciones de Fortune 100. La profundidad de los atributos es idéntica en ambos ámbitos de aplicación. MVM no es un esqueleto, solo tiene un ámbito de aplicación más reducido.
Veamos con más detalle el MVM y el ECM.

¿Qué hay disponible para Energía y Recursos?
Como punto de partida, actualmente tenemos 4 modelos disponibles como MVM o ECM. Estos modelos son:
| Industria | Dominios ECM | Productos ECM | Dominios MVM | Productos MVM |
|---|---|---|---|---|
| Petróleo y gas | 19 | 568 | 17 | 246 |
| Energía y servicios públicos | 18 | 451 | 15 | 236 |
| Extracción | 18 | 416 | 15 | 219 |
| Empresas de servicios de agua | 15 | 377 | 13 | 189 |
Extracción ~ un ejemplo
Al revisar el repositorio de la industria de extracción, puedes ver una comparación de los tipos de modelo MVM y ECM para que puedas tomar una buena decisión sobre qué alcance de modelo te interesa.

Esto incluye una revisión detallada de los dominios y productos disponibles.

Puedes obtener detalles sobre qué es parte del alcance del modelo seleccionado. Esto incluye instrucciones, muestras, documentación y notas de la versión.

Si estás listo para desplegar el modelo en tu entorno, consulta el archivo readme en el repositorio principal para seguir los pasos. A nivel general, todo lo que necesitas es ejecutar el notebook del instalador que apunta a la industria y al alcance del modelo que te interesan.
Empieza ahora
La biblioteca se encuentra en el repositorio de Soluciones de la industria: https://github.com/databricks-industry-solutions/lakehouse-industry-data-models/tree/main. Elige un modelo, un alcance (MVM o ECM), un estilo de catalogación, un catálogo de implementación y ejecuta el notebook de instalación. Una instalación típica de MVM se completa en decenas de minutos, en comparación con Databricks Serverless, que tarda menos de dos horas. Ambos producen una capa de plata totalmente implementada en Unity Catalog con vistas de métricas listas para los paneles de AI/BI y AI/BI Genie.
Cada modelo es un punto de partida. Los clientes que necesiten adaptar un modelo a su organización (cambiar el nombre de dominios, fusionar o dividir productos, añadir un dominio faltante, cambiar convenciones de nomenclatura) pueden hacerlo mediante el Modeling Agent, que itera el modelo a través de directivas en lenguaje natural.
Recursos relacionados
Para obtener más información, consulta la primera parte de nuestra publicación del blog sobre modelado de datos ~ Inicia tu modelado de datos con los modelos de datos industriales de Databricks
