Ir al contenido principal

Modelos de datos empresariales Lakehouse para energía y recursos

Una biblioteca de modelos de datos empresariales de capa de plata listos para producción, uno por industria, que se implementan en Unity Catalog como la base analítica de un lakehouse de Databricks: completa, gobernada y consistente desde el primer día.

Lakehouse medallion layers with the Silver business data model

Modelos de datos empresariales Databricks Lakehouse

Dónde se ubica

El modelo de datos empresariales Lakehouse es la capa de plata. La capa de bronce gestiona la ingesta de datos sin procesar (Lakeflow, Auto Loader). La capa de plata es el modelo analítico normalizado y conforme del que leen todos los analistas, herramientas de BI y cargas de trabajo de ML. La capa de oro se deriva de la información (tablas de KPI, tablas de características, agregados) calculada sobre la capa de plata.

Modelos de datos empresariales de Databricks Lakehouse: donde se encuentren

Qué incluye cada modelo

Cada modelo se publica como un paquete completo.

`model.json` es el modelo lógico que captura cada dominio, subdominio, producto, atributo, clave externa, etiqueta de clasificación y definición de vista de métrica. Es la moneda de cambio. Regístralo en git, compara las diferencias entre versiones y compártelo en todos los entornos.

Una implementación de Unity Catalog de esquemas, tablas Delta, restricciones de clave primaria, restricciones de clave extranjera (informativas) y etiquetas de clasificación. Los nombres exactos del catálogo y del esquema dependen del estilo de catalogación elegido durante la instalación.

Las vistas de métricas son definiciones reutilizables de KPI instaladas sobre las tablas físicas, listas para los paneles de AI/BI y AI/BI Genie.

Un gráfico de conocimiento RDFS (ontología/) expresa el mismo modelo que un gráfico semántico para la integración de herramientas semánticas y la fundamentación de agentes de IA.

Un diagrama DBML (diagram/) para la exploración visual en dbdiagram.io o cualquier visor compatible con DBML.

SQL DDL (esquemas/) para toda la implementación, organizado por esquema.

La documentación de Excel y Markdown se generó junto con el modelo.

Datos de muestra sintéticos opcionales. Las filas basadas en grupos respetan todas las claves externas, las restricciones de regex y las etiquetas de clasificación.

Jerarquía

Jerarquía organizacional

Cada modelo sigue la misma jerarquía. La organización es todo el negocio. Contiene tres divisiones: operaciones (lo que hace físicamente el negocio), negocio (a quién sirve y cómo obtiene ingresos) y corporativo (el back office de soporte). Cada división contiene uno o más dominios (contextos delimitados en singular, en minúsculas y de una sola palabra). Cada dominio contiene dos o más subdominios (agrupaciones semánticas de dos palabras). Cada subdominio contiene productos (las tablas Delta). Cada producto contiene atributos (las columnas), con tipos de datos y etiquetas de clasificación asignados de antemano.

Las operaciones y el negocio combinados siempre ocupan al menos el 80 % de los dominios; el área corporativa tiene un límite del 20 %. Esta proporción mantiene a cada modelo centrado en lo que realmente dirige el negocio en lugar de en su back office administrativo.

Cada modelo es también un gráfico acíclico dirigido por construcción. Las claves externas siempre apuntan de elemento secundario a elemento principal (order.customer_id, nunca customer.latest_order_id); los ciclos se rompen antes de la publicación; cada dominio se conecta al menos con otro a través de claves externas, por lo que el análisis entre dominios siempre es posible.

Dos alcances: MVM y ECM

Dos alcances: MVM y ECM

MVM (modelo viable mínimo) representa del 30 al 50 % del recuento de tablas de ECM y cubre solo las funciones empresariales esenciales, dimensionadas para compromisos de pymes, pilotos y entornos de desarrollo/pruebas.

ECM (modelo de cobertura ampliada) ofrece una cobertura completa para toda la empresa, incluida la compatibilidad con dominios corporativos, y está dimensionado para implementaciones de Fortune 100. La profundidad de los atributos es idéntica en ambos ámbitos de aplicación. MVM no es un esqueleto, solo tiene un ámbito de aplicación más reducido.

Veamos con más detalle el MVM y el ECM.

Tabla de comparación directa

¿Qué hay disponible para Energía y Recursos?

Como punto de partida, actualmente tenemos 4 modelos disponibles como MVM o ECM. Estos modelos son:

IndustriaDominios ECMProductos ECMDominios MVMProductos MVM
Petróleo y gas1956817246
Energía y servicios públicos1845115236
Extracción1841615219
Empresas de servicios de agua1537713189

Extracción ~ un ejemplo

Al revisar el repositorio de la industria de extracción, puedes ver una comparación de los tipos de modelo MVM y ECM para que puedas tomar una buena decisión sobre qué alcance de modelo te interesa.

Comparación de métricas de modelos

Esto incluye una revisión detallada de los dominios y productos disponibles.

Comunidad

Puedes obtener detalles sobre qué es parte del alcance del modelo seleccionado. Esto incluye instrucciones, muestras, documentación y notas de la versión.

Estructura de la carpeta de salida

Si estás listo para desplegar el modelo en tu entorno, consulta el archivo readme en el repositorio principal para seguir los pasos. A nivel general, todo lo que necesitas es ejecutar el notebook del instalador que apunta a la industria y al alcance del modelo que te interesan.

Empieza ahora

La biblioteca se encuentra en el repositorio de Soluciones de la industria: https://github.com/databricks-industry-solutions/lakehouse-industry-data-models/tree/main. Elige un modelo, un alcance (MVM o ECM), un estilo de catalogación, un catálogo de implementación y ejecuta el notebook de instalación. Una instalación típica de MVM se completa en decenas de minutos, en comparación con Databricks Serverless, que tarda menos de dos horas. Ambos producen una capa de plata totalmente implementada en Unity Catalog con vistas de métricas listas para los paneles de AI/BI y AI/BI Genie.

Cada modelo es un punto de partida. Los clientes que necesiten adaptar un modelo a su organización (cambiar el nombre de dominios, fusionar o dividir productos, añadir un dominio faltante, cambiar convenciones de nomenclatura) pueden hacerlo mediante el Modeling Agent, que itera el modelo a través de directivas en lenguaje natural.

Recursos relacionados

Para obtener más información, consulta la primera parte de nuestra publicación del blog sobre modelado de datos ~ Inicia tu modelado de datos con los modelos de datos industriales de Databricks