Ir para o conteúdo principal

Modelos de Dados de Negócios Lakehouse para Manufatura e Indústria

Biblioteca de modelos de dados de negócios prontos para produção da camada Silver (um por setor) implantados diretamente no Unity Catalog como base analítica de um lakehouse Databricks: completos, governados e consistentes desde o primeiro dia.

Lakehouse medallion layers with the Silver business data model

Modelos de dados de negócios do Databricks Lakehouse

Onde ele se posiciona

Um modelo de dados de negócios do Lakehouse é a camada Silver. A Bronze lida com a ingestão bruta (Lakeflow, Auto Loader). A Silver é o modelo analítico padronizado e normalizado de onde cada analista, ferramenta de BI e carga de trabalho de ML lê os dados. A Gold é derivada de insights (tabelas de KPI, tabelas de features, agregações) computados sobre a Silver.

Modelos de dados de negócios do Databricks Lakehouse Onde ele se posiciona

O que vem incluído em cada modelo

Cada modelo é publicado como um pacote completo.

`model.json` é o modelo lógico que captura cada domínio, subdomínio, produto, atributo, chave estrangeira, tag de classificação e definição de visualização de métrica. É a unidade padrão. Faça o commit no git, compare as diferenças (diff) entre versões e compartilhe entre ambientes.

Uma implantação do Unity Catalog de esquemas, tabelas Delta, restrições de chave primária, restrições de chave estrangeira (informativas) e tags de classificação. Os nomes exatos de catálogo e esquema dependem do estilo de catalogação escolhido durante a instalação.

Visualizações de métricas são definições de KPI reutilizáveis instaladas sobre as tabelas físicas, prontas para dashboards de AI/BI e para o AI/BI Genie.

Um grafo de conhecimento RDFS (ontology/) expressa o mesmo modelo como um grafo semântico para integração de ferramentas semânticas e fundamentação de agentes de IA.

Um diagrama DBML (diagram/) para exploração visual no dbdiagram.io ou em qualquer visualizador compatível com DBML.

SQL DDL (schemas/) para toda a implantação, organizada por esquema.

Documentação em Excel e Markdown gerada junto com o modelo.

Dados de amostra sintéticos opcionais. As linhas baseadas em pool respeitam todas as chaves estrangeiras, restrições de regex e tags de classificação.

Hierarquia

Hierarquia organizacional

Cada modelo segue a mesma hierarquia. A organização representa todo o negócio. Ela contém três divisões: Operações (o que a empresa faz fisicamente), Negócios (a quem ela atende e como gera receita) e Corporativo (o back office de suporte). Cada divisão contém um ou mais domínios (contextos delimitados de uma única palavra, em letras minúsculas e no singular). Cada domínio contém dois ou mais subdomínios (agrupamentos semânticos de duas palavras). Cada subdomínio contém produtos (as tabelas Delta). Cada produto contém atributos (as colunas), com tipos de dados e tags de classificação atribuídos antecipadamente.

Operações e Negócios combinados sempre contêm pelo menos 80% do total de domínios; o Corporativo é limitado a 20%. Essa proporção mantém cada modelo focado no que realmente move o negócio, em vez de focar em seu back office administrativo.

Cada modelo também é um Grafo Acíclico Direcionado por construção. As chaves estrangeiras sempre apontam de filho para pai (order.customer_id, nunca customer.latest_order_id); os ciclos são desfeitos antes da publicação; cada domínio se conecta a pelo menos um outro por meio de chaves estrangeiras, de modo que a análise cruzada de domínios é sempre possível.

Dois escopos: MVM e ECM

Dois escopos: MVM e ECM

MVM (Minimum Viable Model) representa de 30 a 50 por cento da contagem de tabelas do ECM e cobre apenas funções de negócios essenciais, dimensionado para projetos de SMB, pilotos e ambientes de desenvolvimento/teste.

ECM (Expanded Coverage Model) é uma cobertura empresarial completa, incluindo domínios corporativos de suporte, dimensionado para implantações da Fortune 100. A profundidade dos atributos é idêntica em ambos os escopos. O MVM não é um esqueleto, apenas uma área de superfície menor.

Vamos comparar o MVM e o ECM em mais detalhes.

Tabela de comparação direta

O que está disponível para os setores de Manufatura e Industrial

Como ponto de partida, atualmente temos 6 modelos disponíveis como MVM ou ECM. Esses modelos são:

SetorDomínios ECMProdutos ECMDomínios MVMProdutos MVM
Manufatura2041312129
Indústria Química1940514202
Semicondutores1938514211
Automotivo1954814209
Construção1836515189
Agricultura1840814177

Automotivo ~ um Exemplo

Ao analisar o repositório, você verá uma comparação dos tipos de modelo MVM e ECM para poder tomar uma boa decisão sobre qual escopo de modelo é do seu interesse.

Comparação de métricas do modelo

Isso inclui uma análise detalhada dos domínios e produtos disponíveis.

Comparação de domínios e produtos

Você pode obter detalhes sobre o que faz parte do escopo do modelo selecionado. Isso inclui instruções, exemplos, documentação e notas de lançamento.

Estrutura de pastas de saída

Se você estiver pronto para implantar o modelo em seu ambiente, confira o arquivo readme no repositório principal para seguir o passo a passo. Em linhas gerais, tudo o que você precisa fazer é executar o notebook do instalador direcionado ao setor e ao escopo do modelo de seu interesse.

Primeiros passos

A biblioteca está localizada no repositório Industry Solutions: https://github.com/databricks-industry-solutions/lakehouse-industry-data-models/tree/main. Escolha um modelo, um escopo (MVM ou ECM), um estilo de catalogação, um catálogo de implantação e execute o notebook de instalação. Uma instalação típica do MVM é concluída em dezenas de minutos, em comparação com o Databricks Serverless, que leva menos de duas horas. Ambos geram uma camada Silver totalmente implantada no Unity Catalog com visualizações de métricas prontas para painéis de AI/BI e para o AI/BI Genie.

Cada modelo é um ponto de partida. Os clientes que precisam adaptar um modelo à sua organização (renomear domínios, mesclar ou dividir produtos, adicionar um domínio ausente, alterar convenções de nomenclatura) podem fazer isso usando o Modeling Agent, que itera o modelo por meio de diretrizes em linguagem natural.

Recursos relacionados

Para obter mais informações, confira a primeira parte do lançamento do nosso blog de Modelagem de Dados ~ Acelere sua modelagem de dados com os Databricks Industry Data Models