Ir para o conteúdo principal

Modelos de Dados de Negócios Lakehouse para Saúde e Ciências da Vida

Modelos de dados de negócios da camada Silver, prontos para produção e governados para Saúde e Ciências da Vida que são implantados diretamente no Unity Catalog como a base analítica de um lakehouse do Databricks — consistentes desde o primeiro dia.

Lakehouse medallion layers with the Silver business data model

Modelos de dados de negócios Databricks Lakehouse

Onde fica

Um modelo de dados de negócios da Lakehouse é a camada prateada. O sistema Bronze lida com a ingestão de matéria-prima (Lakeflow, Auto Loader). Silver é o modelo analítico padronizado e normalizado que todos os analistas, ferramentas de BI e fluxos de trabalho de ML utilizam. O ouro é derivado de percepções (tabelas de KPIs, tabelas de recursos, agregados) calculados com base na prata.

Modelos de Dados de Negócios do Databricks Lakehouse: Onde se encaixam

O que vem com cada modelo

Cada modelo é publicado como um pacote completo.

`model.json` é o modelo lógico que captura cada domínio, subdomínio, produto, atributo, foreign key, classification tag e definição de metric view. É a unidade de troca. Faça o check-in no git, compare as versões e compartilhe entre ambientes.

Uma implantação do Unity Catalog de esquemas, tabelas Delta, restrições de chave primária, restrições de chave estrangeira (informativas) e tags de classificação. Os nomes exatos do catálogo e do esquema dependem do estilo de catalogação escolhido durante a instalação.

Visualizações de métricas são definições de KPI reutilizáveis instaladas sobre as tabelas físicas, prontas para dashboards de AI/BI e para o AI/BI Genie.

Um grafo de conhecimento RDFS (ontology/) expressa o mesmo modelo como um grafo semântico para integração com ferramentas semânticas e embasamento de agentes de AI.

Um diagrama DBML (diagram/) para exploração visual no dbdiagram.io ou em qualquer visualizador compatível com DBML.

SQL DDL (schemas/) para toda a implantação, organizado por esquema.

A documentação em Excel e Markdown foi gerada juntamente com o modelo.

Dados de amostra sintéticos opcionais. Linhas baseadas em pool respeitam todas as chaves estrangeiras, restrições de regex e tags de classificação.

Hierarquia

Hierarquia Organizacional

Todos os modelos seguem a mesma hierarquia. A organização é o negócio como um todo. A empresa é composta por três divisões: Operações (o que a empresa faz fisicamente), Negócios (a quem ela atende e como gera receita) e Corporativa (o escritório administrativo de suporte). Cada divisão contém um ou mais domínios (contextos delimitados de uma palavra, em minúsculas e no singular). Cada domínio contém dois ou mais subdomínios (agrupamentos semânticos de duas palavras). Cada subdomínio contém produtos (as tabelas Delta). Cada produto contém atributos (as colunas), com tipos de dados e tags de classificação atribuídos antecipadamente.

Operações e Negócios, juntos, sempre detêm pelo menos 80% dos domínios; o Corporativo é limitado a 20%. Essa proporção mantém cada modelo centrado no que realmente move o negócio, em vez de em seu back office administrativo.

Todo modelo também é um Grafo Acíclico Dirigido por construção. As chaves estrangeiras sempre apontam de filho para pai (order.customer_id, nunca customer.latest_order_id); Os ciclos são quebrados antes da publicação; cada domínio se conecta a pelo menos um outro por meio de chaves estrangeiras, portanto, a analítica entre domínios é sempre possível.

Dois escopos: MVM e ECM

Dois escopos: MVM e ECM

MVM (Modelo Mínimo Viável) representa de 30 a 50% da contagem de tabelas do ECM e abrange apenas funções de negócios essenciais, dimensionado para engajamentos com PMEs, pilotos e ambientes de desenvolvimento/teste.

ECM (Modelo de Cobertura Expandida) tem uma abrangência empresarial completa, incluindo suporte a domínios corporativos, e é dimensionado para implantações em empresas da Fortune 100. A profundidade de atributos é idêntica em ambos os escopos. O MVM não é um esqueleto, apenas tem uma abrangência menor.

Vamos comparar o MVM e o ECM em mais detalhes.

Tabela de comparação lado a lado

O que está disponível para as indústrias de Saúde e Ciências da Vida

Como ponto de partida, atualmente temos 4 modelos disponíveis como MVM ou ECM. Estes modelos são:

SETORDomínios ECMProdutos ECMDomínios MVMProdutos MVM
Cuidados de saúde2254116189
Produtos farmacêuticos1944115213
Genomics & Biotecnologia1940315182
Ensaios Clínicos1937913193

Assistência médica: um exemplo

Analisando o repo, você pode ver uma comparação dos tipos de Modelo MVM e ECM para poder tomar uma boa decisão sobre qual escopo de modelo lhe interessa.

Comparação de métricas do modelo

Isso inclui uma análise detalhada dos Domínios e Produtos disponíveis.

tabela de faturamento

Você pode obter detalhes sobre o que está incluído no escopo do modelo selecionado. Isso inclui instruções, exemplos, documentação e notas sobre a versão.

Estrutura da pasta de saída

Se você estiver pronto para implantar o modelo em seu ambiente, consulte o arquivo readme no repo principal para obter os passos. Em linhas gerais, tudo o que você precisa fazer é executar o notebook do instalador configurado para o setor e o modelo de seu interesse.

Comece agora

A biblioteca está no repositório do Databricks Industry Solutions: https://github.com/databricks-industry-solutions/lakehouse-industry-data-models/tree/main. Escolha um modelo, um escopo (MVM ou ECM), um estilo de catalogação, um catálogo de implantação e execute o notebook de instalação. Uma instalação típica do MVM é concluída em dezenas de minutos, em comparação com o Databricks Serverless, que leva menos de duas horas. Ambos produzem uma camada Silver totalmente implantada no Unity Catalog com visualizações de métricas prontas para dashboards de AI/BI e para o AI/BI Genie.

Cada modelo é um ponto de partida. Clientes que precisam adaptar um modelo à sua organização (renomear domínios, merge ou dividir produtos, adicionar um domínio ausente, alterar convenções de nomenclatura) podem fazer isso usando o Agente de Modelagem, que itera o modelo por meio de diretivas de linguagem natural.

Recursos relacionados

Para mais informações, confira a primeira parte do lançamento do nosso blog sobre modelagem de dados: Acelere sua Modelagem de Dados com os Modelos de Dados da Indústria da Databricks

Obtenha os modelos de dados setoriais do Databricks Lakehouse no GitHub ~ Modelos de dados setoriais do Lakehouse no GitHub