Ir al contenido principal

Modelos de datos empresariales de Lakehouse para manufactura y el sector industrial

Biblioteca de modelos de datos de capa Silver listos para producción (uno por sector) que se implementan en Unity Catalog como base analítica de un lakehouse de Databricks: completos, gobernados y coherentes desde el primer día.

Lakehouse medallion layers with the Silver business data model

Modelos de datos empresariales de Databricks Lakehouse

Dónde se ubica

Un modelo de datos empresarial de Lakehouse es la capa Silver. Bronze se encarga de la ingesta de datos brutos (Lakeflow, Auto Loader). Silver es el modelo analítico adaptado y normalizado del que leen todos los analistas, herramientas de BI y cargas de trabajo de ML. Gold se deriva de la información (tablas de KPI, tablas de características, agregados) calculada sobre Silver.

Modelos de datos empresariales de Databricks Lakehouse: Dónde se ubica

Qué se incluye con cada modelo

Cada modelo se publica como un paquete completo.

`model.json` es el modelo lógico que captura cada dominio, subdominio, producto, atributo, clave externa, etiqueta de clasificación y definición de vista métrica. Es la unidad de valor de referencia. Regístrelo en git, compare diferencias entre versiones y compártalo entre entornos.

Un despliegue de Unity Catalog de esquemas, tablas Delta, restricciones de clave primaria, restricciones de clave externa (informativas) y etiquetas de clasificación. Los nombres exactos de catálogo y esquema dependen del estilo de catalogación elegido durante la instalación.

Vistas métricas son definiciones de KPI reutilizables instaladas sobre las tablas físicas, listas para los paneles de AI/BI y AI/BI Genie.

Un grafo de conocimiento RDFS (ontology/) expresa el mismo modelo como un grafo semántico para la integración de herramientas semánticas y la fundamentación de agentes de IA.

Un diagrama DBML (diagram/) para la exploración visual en dbdiagram.io o cualquier visor compatible con DBML.

SQL DDL (schemas/) para todo el despliegue, organizado por esquema.

La documentación en Excel y Markdown se generó junto con el modelo.

Datos de muestra sintéticos opcionales. Las filas basadas en grupos respetan todas las claves externas, restricciones de expresiones regulares (regex) y etiquetas de clasificación.

Jerarquía

Jerarquía organizativa

Cada modelo sigue la misma jerarquía. La organización representa a toda la empresa. Contiene tres divisiones: Operaciones (lo que la empresa hace físicamente), Negocio (a quién sirve y cómo genera ingresos) y Corporativo (el soporte administrativo o back office). Cada división contiene uno o más dominios (contextos delimitados de una sola palabra, en minúsculas y en singular). Cada dominio contiene dos o más subdominios (agrupaciones semánticas de dos palabras). Cada subdominio contiene productos (las tablas Delta). Cada producto contiene atributos (las columnas), con tipos de datos y etiquetas de clasificación asignados de antemano.

Operaciones y Negocio combinados siempre representan al menos el 80% de los dominios; Corporativo está limitado al 20%. Esta proporción mantiene cada modelo centrado en lo que realmente hace funcionar al negocio, en lugar de en su administración interna.

Cada modelo es también un Grafo Acíclico Dirigido por diseño. Las claves externas siempre apuntan de hijo a padre (order.customer_id, nunca customer.latest_order_id); los ciclos se resuelven antes de la publicación; cada dominio se conecta al menos con otro a través de claves externas, por lo que el análisis entre dominios siempre es posible.

Dos alcances: MVM y ECM

Dos alcances: MVM y ECM

MVM (Modelo Mínimo Viable) representa del 30 al 50 por ciento del recuento de tablas de ECM y cubre solo las funciones comerciales esenciales, dimensionado para proyectos de SMB, pilotos y entornos de desarrollo y prueba.

ECM (Modelo de Cobertura Ampliada) abarca toda la empresa, incluidos los dominios corporativos de soporte, dimensionado para despliegues de Fortune 100. La profundidad de los atributos es idéntica en ambos alcances. MVM no es un esqueleto, sino simplemente un área de superficie más pequeña.

Comparemos el MVM y el ECM con más detalle.

Tabla de comparación directa

Qué está disponible para las industrias manufacturera e industrial

Como punto de partida, actualmente tenemos 6 modelos disponibles como MVM o ECM. Estos modelos son:

SectorDominios de ECMProductos de ECMDominios de MVMProductos de MVM
Manufactura2041312129
Fabricación de productos químicos1940514202
Semiconductores1938514211
Automotriz1954814209
Construcción1836515189
Agricultura1840814177

Automotriz: un ejemplo

Al mirar el repositorio, puede ver una comparación de los tipos de modelo MVM y ECM para que pueda tomar una buena decisión sobre el alcance del modelo que le interesa.

Comparación de métricas del modelo

Esto incluye una revisión detallada de los dominios y productos disponibles.

Comparación de dominios y productos

Puede obtener detalles sobre lo que forma parte del alcance del modelo seleccionado. Esto incluye instrucciones, ejemplos, documentación y notas de la versión.

Estructura de carpetas de salida

Si está listo para implementar el modelo en su entorno, consulte el archivo readme en el repositorio principal para seguir los pasos. A grandes rasgos, todo lo que necesita es ejecutar el notebook de instalación dirigido al sector y al alcance del modelo que le interesen.

Primeros pasos

La biblioteca se encuentra en el repositorio de Industry Solutions: https://github.com/databricks-industry-solutions/lakehouse-industry-data-models/tree/main. Elija un modelo, un alcance (MVM o ECM), un estilo de catalogación, un catálogo de implementación y ejecute el notebook de instalación. Una instalación típica de MVM se completa en decenas de minutos, en comparación con Databricks Serverless, que tarda menos de dos horas. Ambos producen una capa Silver completamente implementada en Unity Catalog con vistas de métricas listas para paneles de AI/BI y AI/BI Genie.

Cada modelo es un punto de partida. Los clientes que necesiten adaptar un modelo a su organización (renombrar dominios, fusionar o dividir productos, agregar un dominio faltante, cambiar las convenciones de nomenclatura) pueden hacerlo utilizando el Modeling Agent, que itera el modelo a través de directivas de lenguaje natural.

Recursos relacionados

Para obtener más información, consulte la primera parte de nuestra publicación de blog sobre modelado de datos ~ Acelere su modelado de datos con Databricks Industry Data Models