Ir para o conteúdo principal

Modelos de Dados de Negócios Lakehouse para Setor Público e Serviços

Modelos de dados de negócios Silver-layer governados e prontos para produção para o Setor Público & Serviços, que são implantados diretamente no Unity Catalog como a base analítica de um Databricks lakehouse—consistentes desde o primeiro dia.

Lakehouse medallion layers with the Silver business data model

Modelos de Dados de Negócios do Databricks Lakehouse

Uma biblioteca de quarenta modelos de dados de negócios Silver-layer prontos para produção, um por indústrias, que são implantados diretamente no Unity Catalog como a base analítica de um Databricks lakehouse.

Cada modelo é completo, governado e internamente consistente desde o primeiro dia. Cada domínio, tabela, coluna, key estrangeira, tags de classificação e view de métrica já está definido. Padrões genéricos do setor fazem uma média de todas as empresas de um segmento, deixando os clientes com meses de trabalho de ajuste. Um Modelo de Dados de Negócios Lakehouse é moldado como uma organização única em seu setor, com a terminologia e as divisões que ela realmente usa.

Cada modelo é fornecido em dois escopos, MVM (Modelo Mínimo Viável) e ECM (Modelo de Cobertura Expandida), oferece suporte a três disposições do Unity Catalog (estilos de catalogação) e inclui o mesmo pacote completo de artefatos.

Onde se enquadram

Modelos de dados de negócios do Databricks Lakehouse: onde se enquadram

Um modelo de dados de negócios do Lakehouse é a camada Silver. A camada Bronze lida com a ingestão de dados brutos (Lakeflow, Auto Loader). A camada Silver é o modelo analítico normalizado e em conformidade do qual todo analista, ferramenta de BI e carga de trabalho de ML faz a leitura. A camada Ouro é derivada de percepções (tabelas de KPI, tabelas de recursos, agregados) computadas sobre a camada Silver.

O que acompanha cada modelo

Cada modelo é publicado como um pacote completo.

`model.json` é o modelo lógico que captura cada domínio, subdomínio, produto, atributo, chave estrangeira, tag de classificação e definição de view de métricas. É a unidade de moeda. Registre no Git, compare as diferenças entre versões e compartilhe entre os ambientes.

Uma implantação do Unity Catalog de esquemas, tabelas Delta, restrições de chave primária, restrições de chave estrangeira (informativas) e tags de classificação. Os nomes exatos do catálogo e do esquema dependem do estilo de catalogação escolhido durante a instalação.

Views de métricas são definições de KPI reutilizáveis instaladas sobre as tabelas físicas, prontas para painéis AI/BI e AI/BI Genie.

Um gráfico de conhecimento RDFS (ontology/) expressa o mesmo modelo que um gráfico semântico para integração de ferramentas semânticas e fundamentação de agentes de AI.

Um diagrama DBML (diagram/) para exploração visual no dbdiagram.io ou em qualquer visualizador compatível com DBML.

DDL SQL (schemas/) para toda a implantação, organizado por esquema.

A documentação de Excel e Markdown foi gerada juntamente com o modelo.

Dados de exemplo sintéticos opcionais. As linhas baseadas em pool respeitam todas as chaves estrangeiras, restrições de regex e tags de classificação.

Hierarquia

Hierarquia organizacional

Cada modelo segue a mesma hierarquia. A organização é o negócio como um todo. Ela contém três divisões: Operações (o que o negócio faz fisicamente), Negócios (a quem serve e como lucra) e Corporativo (o back office de suporte). Cada divisão contém um ou mais domínios (contextos delimitados por palavra única, em minúsculo e no singular). Cada domínio contém dois ou mais subdomínios (agrupamentos semânticos de duas palavras). Cada subdomínio contém produtos (as tabelas Delta). Cada produto contém atributos (as colunas), com tipos de dados e tags de classificação atribuídos antecipadamente.

As operações e os negócios combinados sempre detêm pelo menos 80% dos domínios; o corporativo é limitado a 20%. Essa proporção mantém cada modelo centrado no que realmente executa o negócio, em vez de seu back office administrativo.

Todo modelo também é um Gráfico Acíclico Dirigido por construção. Chaves estrangeiras sempre apontam de filho para pai (order.customer_id, nunca customer.latest_order_id); ciclos são quebrados antes da publicação; cada domínio se conecta a pelo menos um outro por meio de chaves estrangeiras, portanto, a analítica entre domínios é sempre possível.

Dois escopos: MVM e ECM

Dois escopos: MVM e ECM

O Modelo Mínimo Viável (MVM) responde por 30 a 50 por cento do total de tabelas do ECM e engloba apenas funções de negócios essenciais, sendo dimensionado para PMEs, projetos-piloto e ambientes de desenvolvimento e teste.

O Modelo de Cobertura Expandida (ECM) possui alcance empresarial total, englobando domínios corporativos de apoio, projetado para implementações em empresas da Fortune 100. A profundidade de atributos é idêntica em ambos os escopos. O MVM não é um esqueleto, apenas uma área de superfície menor.

Vamos comparar o MVM e o ECM em mais detalhes.

Tabela comparativa direta

O que está disponível para o Setor Público e Indústrias de Serviços

Como ponto de partida, atualmente temos 4 modelos disponíveis como MVM ou ECM. Esses modelos são:

SETORDomínios ECMProdutos ECMDomínios MVMProdutos MVM
Educação1744614203
ONG1530212141
Jurídico1531412153
Gerenciamento de resíduos1747112194
Recrutamento e RH1630212153
Imobiliário1634414177

Educação ~ Um Exemplo

Ao analisar o repo para a indústria de mineração, é possível ver uma comparação dos tipos de modelo MVM e ECM, para que você possa tomar uma decisão fundamentada sobre qual escopo de modelo é de seu interesse.

Comparação de Métricas do Modelo de Educação

Isso inclui uma análise detalhada dos domínios e produtos disponíveis.

Comparação de domínio e produto de serviços do setor público

Você pode obter detalhes sobre o que faz parte do escopo do modelo selecionado. Isso inclui instruções, amostras, documentação e notas sobre a versão.

Estrutura de Pastas de Saída

Se estiver pronto para implantar o modelo em seu ambiente, consulte o arquivo readme no repo principal para seguir os passos. Em linhas gerais, basta executar o notebook de instalação apontando para a indústria e o escopo do modelo do seu interesse.

Comece agora

A biblioteca reside no repo de Soluções da indústria: https://github.com/databricks-industry-solutions/lakehouse-industry-data-models/tree/main. Escolha um modelo, um escopo (MVM ou ECM), um estilo de catalogação, um catálogo de implantação e execute o notebook de instalação. Uma instalação típica de MVM é concluída em dezenas de minutos, em comparação com o Databricks Serverless, que leva menos de duas horas. Ambos produzem uma camada Silver totalmente implantada no Unity Catalog com views de métricas prontas para painéis AI/BI e AI/BI Genie.

Todo modelo é um ponto de partida. Os clientes que precisam adaptar um modelo à sua organização (renomear domínios, fazer merge ou dividir produtos, adicionar um domínio ausente, alterar convenções de nomenclatura) podem fazê-lo usando o Modeling Agent, que itera o modelo por meio de diretrizes em linguagem natural.

Recursos relacionados

Para mais informação, confira a primeira parte da nossa publicação no blog sobre Modelagem de Dados ~ Acelere sua Modelagem de Dados com os Modelos de Dados para indústrias da Databricks
https://www.databricks.com/blog/jumpstart-your-data-modeling-databricks-industry-data-models