O lakehouse interno da Databricks abriga mais de 100.000 tabelas que abrangem engenharia, go-to-market, RH, finanças e telemetria de produtos. Antes do Unity Catalog, a governança era inconsistente: os padrões de acesso variavam por equipe, as classificações eram incompletas e ninguém podia dizer com segurança quais conjuntos de dados eram seguros para o treinamento de IA. A equipe da Plataforma de Dados reconstruiu a governança a partir dos princípios fundamentais. Eles tornam a governança na Databricks automática, mensurável e pronta para a era da IA agêntica. Veja como eles fizeram isso.
Quando ninguém consegue responder: "estes dados estão sob governança?"
A Databricks estava crescendo rapidamente, e seus dados ainda mais rápido. Mais de 100.000 tabelas estavam distribuídas em dezenas de equipes, workspaces e catálogos. Cada equipe gerenciava o acesso de forma diferente. As classificações eram inconsistentes ou simplesmente não existiam.
O atrito não era teórico. As equipes de segurança, jurídica e engenharia passavam horas analisando planilhas para responder a perguntas básicas durante as revisões de conformidade. Novos projetos de IA estagnavam porque ninguém conseguia confirmar se um conjunto de dados atendia aos requisitos de privacidade. Quando uma equipe queria treinar um modelo, não havia uma maneira sistemática de verificar se os dados de treinamento estavam classificados, sob governança ou mesmo atualizados.
“Todos tinham acesso de leitura e gravação a cada tabela, a cada job”, diz Bruce Wong, Diretor Sênior de Engenharia e Head de Plataforma de Dados na Databricks. “Não era apenas a falta de uma única fonte da verdade. Havia muitas fontes, e nenhuma verdade. ” Wong descreve o que a equipe herdou como um “pântano de dados” (data swamp), isolado, sem governança e incapaz de escalar.
O desafio não era a falta de boas intenções. As equipes se importavam com a qualidade dos dados. Mas o modelo de governança que funcionava com 10 pessoas e um gigabyte não funciona com 10.000 pessoas e um exabyte. Sem um sistema unificado, a governança era uma colcha de retalhos de processos manuais que não conseguiam acompanhar o ritmo.
Enquanto isso, a equipe da plataforma de dados reformulou todo o ecossistema de dados, desde a ingestão de dados SaaS via Lakeflow Connect até a portabilidade multicloud e a análise federada em domínios de negócios. Para acompanhar o crescimento da empresa, cada linha de negócios precisava de dados confiáveis e sob governança para operar. A equipe da plataforma precisava de uma solução que funcionasse não apenas para os engenheiros que constroem pipelines, mas para cada analista, profissional de marketing, líder financeiro e operador de vendas em toda a empresa. Li Yang, Gerente Sênior de Engenharia na Databricks, conhecia esse desafio de perto, tendo passado uma década em outras empresas de tecnologia enfrentando dificuldades de escala semelhantes. “Em um mundo B2B, a confiança não é um recurso. A confiança é o produto”, diz Yang. “Precisávamos nos afastar de um modelo que parecia tentar consertar um avião em pleno voo.”
Classificação, controles de acesso e uma pontuação para cada conjunto de dados
A equipe começou como cliente alfa do Unity Catalog com um princípio orientador: cada conjunto de dados deve ser confiável, governado e pronto para IA por padrão — por meio de proteções (guardrails), não de barreiras. O Unity Catalog permitiu que eles tomassem decisões de política e governança no nível do catálogo, em vez de gerenciar usuários e tabelas individuais, uma mudança de paradigma que alterou fundamentalmente a forma como abordavam o lakehouse.
Primeiro, eles construíram um modelo de classificação universal dentro do Unity Catalog. Cada tabela é marcada por sensibilidade de dados (Público, Interno, Confidencial, Restrito, Altamente Restrito) e por domínio (Engenharia, GTM, RH, Finanças, etc.). Essas tags são mapeadas para zonas de governança que determinam a aplicação do acesso. Segundo, eles automatizaram os controles de acesso. Uma plataforma interna chamada Fortress, construída sobre as APIs de segurança do Unity Catalog, impõe acesso com finalidade definida e tempo limitado. Chega de permissões permanentes. Cada solicitação indica um motivo, expira no prazo programado e é totalmente auditável.
Para medir a confiança em escala, a equipe criou o Data Governance Score, que fornece uma métrica contínua de 0 a 100 para cada conjunto de dados. A pontuação avalia três pilares: documentação (as colunas estão descritas e as tabelas anotadas?), confiabilidade (as verificações de qualidade de dados passam?) e governança (os dados estão classificados e com controle de acesso?). O Data Governance Score se propaga downstream por meio da linhagem de dados (lineage): se uma tabela upstream perde a confiança, cada tabela que depende dela reflete essa mudança automaticamente. Amit Pahwa, Engenheiro de Software Staff na equipe de Plataforma de Dados da Databricks, ajudou a projetar o Data Governance Score para afastar a empresa da dependência do conhecimento informal (tribal knowledge). Ele destaca que, sem dados estruturados, “a confiança é a diferença entre agir com base em fatos ou seguir sua intuição”.
Além da camada central de governança, fluxos de trabalho adicionais da plataforma de dados estendem o alcance da plataforma. O Lakeflow Connect lida com a ingestão segura de SaaS em escala, o que substituiu conectores frágeis por pipelines sob governança que inserem dados diretamente na arquitetura medalhão. Uma plataforma multicloud garante que as cargas de trabalho sejam portáteis e seguras na AWS, Azure e GCP. Uma camada de análise federada oferece a cada domínio de negócios, de finanças a marketing e operações de vendas, acesso de autoatendimento a dados sob governança por meio de ferramentas como o AI/BI Genie e o Databricks Apps. Um repositório de métricas dedicado construído no Unity Catalog Metric Views garante que as equipes de toda a empresa compartilhem uma única definição para cada métrica fundamental. A implementação do Fortress foi uma mudança cultural para a empresa. "Antes do Fortress, solicitar acesso a dados parecia uma caixa-preta para os usuários", diz Yang. "Agora, é um processo transparente e de autoatendimento, onde a política é aplicada automaticamente, liberando os engenheiros para focar na inovação em vez de aprovar chamados manualmente."
A IA agêntica exige a governança que eles já construíram
O Data Governance Score deu à equipe da Plataforma de Dados algo que eles nunca tiveram: visibilidade em tempo real de quais domínios estavam em conformidade e quais precisavam de atenção. Cada uma das mais de 100.000 tabelas agora é verificada continuamente e recebe uma classificação de confiança de 0 a 100. Em vez de as revisões de conformidade gerarem correrias de última hora, a equipe identifica pontos fracos em tempo real e os aborda proativamente. As equipes jurídica e de segurança passam o tempo prevenindo riscos em vez de correr atrás de planilhas.
O impacto mais amplo vai além da conformidade. Dados confiáveis aceleram todos os fluxos de trabalho downstream. Quando uma equipe deseja treinar um modelo, ela verifica a pontuação de governança e sabe imediatamente se os dados atendem aos requisitos — sem revisão manual, sem espera por aprovações. O repositório de métricas garante que, quando a liderança fizer uma pergunta sobre pipeline, receita ou uso, a resposta seja a mesma, independentemente de quem execute a consulta ou de qual ferramenta utilize.
Mas a transformação mais importante é aquela para a qual a equipe não se planejou. Wong define isso de forma direta: “A governança de dados é o requisito básico para a IA agêntica.” Um ser humano nunca navegará por 100.000 tabelas. Um agente de IA encontrará os dados desatualizados, a tabela com excesso de permissões ou o conjunto de dados não classificado com o qual um ser humano nunca se depararia. “Neste momento, é mais provável que a IA encontre dados ruins e forneça uma resposta com base neles do que realmente alucine”, alerta Wong. A infraestrutura de governança que a equipe passou anos construindo — do modelo de classificação ao Data Governance Score e à propagação de confiança baseada em linhagem — agora serve como a camada de proteção para agentes em toda a empresa.
Hoje, todas as áreas da Databricks — engenharia, finanças, marketing, vendas e até instalações — estão usando agentes construídos sobre essa base governada. A quantidade de dados gerada por IA agêntica está crescendo a um ritmo que Wong espera que eclipse a gerada por humanos. Como as estruturas de governança foram projetadas para humanos em escala, elas se traduzem diretamente para agentes em escala. A equipe que reconstruiu a governança a partir dos princípios fundamentais é agora a equipe que viabiliza o futuro de IA da empresa.


