Ir para o conteúdo principal

Modelos de dados de negócios do Lakehouse para varejo e bens de consumo

Modelos de dados de negócios da camada Silver, governados e prontos para produção, para Varejo e Bens de Consumo, implantados diretamente no Unity Catalog como base analítica de um lakehouse Databricks, e consistentes desde o primeiro dia.

Lakehouse medallion layers with the Silver business data model

Modelos de Dados de Negócios do Databricks Lakehouse

Uma biblioteca de quarenta modelos de dados de negócios prontos para produção, da camada Silver, um por indústria, implantados diretamente no Unity Catalog como base analítica de um lakehouse Databricks.

Cada modelo é completo, governado e internamente consistente desde o primeiro dia. Cada domínio, tabela, coluna, chave estrangeira, tag de classificação e view de métricas já está definido. Padrões genéricos de indústrias calculam a média de todas as empresas de um setor, deixando meses de trabalho de ajuste para os clientes. Um modelo de dados de negócios do Lakehouse é estruturado como uma única organização em sua indústria, com a terminologia e as divisões que ela realmente utiliza.

Cada modelo é fornecido em dois escopos, MVM (Modelo Mínimo Viável) e ECM (Modelo de Cobertura Expandida), oferece suporte a três disposições do Unity Catalog (estilos de catalogação) e inclui o mesmo pacote completo de artefatos.

Onde se enquadram

Um modelo de dados de negócios do Lakehouse é a camada Silver. A camada Bronze gerencia a ingestão de dados brutos (Lakeflow, Auto Loader). A camada Silver é o modelo analítico normalizado e em conformidade do qual todo analista, ferramenta de BI e carga de trabalho de ML faz a leitura. A camada Gold é derivada de percepções, como tabelas de KPI, tabelas de recursos e agregados, computadas sobre a camada Silver.
A Lakehouse Business Data Model is the Silver layer. Bronze handles raw ingestion (Lakeflow, Auto Loader). Silver is the conformed, normalized analytical model that every analyst, BI tool, and ML workload reads from. Gold is derived insight—KPI tables, feature tables, and aggregates—computed on top of Silver.

O que acompanha cada modelo

Cada modelo é publicado como um pacote completo.

`model.json` é o modelo lógico que captura cada domínio, subdomínio, produto, atributo, chave estrangeira, tag de classificação e definição de view de métricas. É a unidade de moeda. Registre no Git, compare as diferenças entre versões e compartilhe entre os ambientes.

Uma implantação do Unity Catalog de esquemas, tabelas Delta, restrições de chave primária, restrições de chave estrangeira (informativas) e tags de classificação. Os nomes exatos do catálogo e do esquema dependem do estilo de catalogação escolhido durante a instalação.

Views de métricas são definições de KPI reutilizáveis instaladas sobre as tabelas físicas, prontas para painéis AI/BI e AI/BI Genie.

Um gráfico de conhecimento RDFS (ontology/) expressa o mesmo modelo que um gráfico semântico para integração de ferramentas semânticas e fundamentação de agentes de AI.

Um diagrama DBML (diagram/) para exploração visual no dbdiagram.io ou em qualquer visualizador compatível com DBML.

DDL SQL (schemas/) para toda a implantação, organizado por esquema.

A documentação de Excel e Markdown foi gerada juntamente com o modelo.

Dados de exemplo sintéticos opcionais. As linhas baseadas em pool respeitam todas as chaves estrangeiras, restrições de regex e tags de classificação.
 

Hierarquia

Hierarquia organizacional

Cada modelo segue a mesma hierarquia. A organização é o negócio como um todo. Ela contém três divisões: Operações (o que o negócio faz fisicamente), Negócios (a quem serve e como lucra) e Corporativo (o back office de suporte). Cada divisão contém um ou mais domínios (contextos delimitados por palavra única, em minúsculo e no singular). Cada domínio contém dois ou mais subdomínios (agrupamentos semânticos de duas palavras). Cada subdomínio contém produtos (as tabelas Delta). Cada produto contém atributos (as colunas), com tipos de dados e tags de classificação atribuídos antecipadamente.

As operações e os negócios combinados sempre detêm pelo menos 80% dos domínios; o corporativo é limitado a 20%. Essa proporção mantém cada modelo centrado no que realmente executa o negócio, em vez de seu back office administrativo.

Todo modelo também é um Gráfico Acíclico Dirigido por construção. Chaves estrangeiras sempre apontam de filho para pai (order.customer_id, nunca customer.latest_order_id); ciclos são quebrados antes da publicação; cada domínio se conecta a pelo menos um outro por meio de chaves estrangeiras, portanto, a analítica entre domínios é sempre possível.

Dois escopos: MVM e ECM

Dois escopos: MVM e ECM

Modelo Mínimo Viável (MVM) responde por 30 a 50 por cento do total de tabelas do ECM e engloba apenas funções de negócios essenciais, sendo dimensionado para PMEs, projetos-piloto e ambientes de desenvolvimento e teste.

O Modelo de Cobertura Expandida (ECM) possui alcance empresarial total, englobando domínios corporativos de apoio, projetado para implementações em empresas da Fortune 100. A profundidade de atributos é idêntica em ambos os escopos. O MVM não é um esqueleto, apenas uma área de superfície menor.

Vamos comparar o MVM e o ECM em mais detalhes.

O que está disponível para Varejo & Bens de Consumo

Como ponto de partida, atualmente temos 7 modelos disponíveis como MVM ou ECM. Esses modelos são:

SETORDomínios ECMProdutos ECMDomínios MVMProdutos MVM
Varejo1940115154
Mercearia1937414175
Ecommerce1836914148
Bens de consumo1940314184
[nome da indústria][??]40012163
Alimentos & Bebidas1937614157
Restaurantes1429213153

Mercearia ~ um Exemplo

Ao analisar o repo, é possível ver uma comparação dos tipos de modelo MVM e ECM, para que você possa tomar uma decisão fundamentada sobre qual escopo de modelo é de seu interesse.

Comparação de métricas do modelo

Isso inclui uma análise detalhada dos domínios e produtos disponíveis.

Você pode obter detalhes sobre o que faz parte do escopo do modelo selecionado.  Isso inclui instruções, amostras, documentação e notas sobre a versão.

Se estiver pronto para implantar o modelo em seu ambiente, consulte o arquivo readme no repo principal para seguir os passos. Em linhas gerais, basta executar o notebook de instalação apontando para a indústria e o escopo do modelo do seu interesse.

Comece agora

A biblioteca reside no repo de Soluções da indústria. Escolha um modelo, um escopo (MVM ou ECM), um estilo de catalogação, um catálogo de implantação e execute o notebook de instalação. Uma instalação típica de MVM é concluída em dezenas de minutos, em comparação com o Databricks Serverless, que leva menos de duas horas. Ambos produzem uma camada Silver totalmente implantada no Unity Catalog com views de métricas prontas para painéis AI/BI e AI/BI Genie.

Todo modelo é um ponto de partida. Os clientes que precisam adaptar um modelo à sua organização (renomear domínios, fazer merge ou dividir produtos, adicionar um domínio ausente, alterar convenções de nomenclatura) podem fazê-lo usando o Modeling Agent, que itera o modelo por meio de diretrizes em linguagem natural.

Recursos relacionados

Para obter mais informações, confira a primeira parte do nosso lançamento de blog sobre Modelagem de dados ~ Impulsione a sua Modelagem de dados com os Modelos de dados da indústria do Databricks.