Ir para o conteúdo principal

Ontologia de dados definida: a camada de contexto que falta aos seus agentes de AI

O Diretor de Marketing de Produto da Databricks, Richard Tomlinson, explica por que o termo "ontologia" está sendo redefinido em tempo real e por que a lacuna que ele preenche é a única barreira entre um agente de AI e uma resposta confiável.

por Richard Tomlinson

  • A arquitetura de dados corporativos sempre assumiu que um humano experiente fica entre os dados e a decisão, fornecendo o contexto que um esquema não consegue. Os agentes de AI removem esse humano, e essa suposição deixa de fazer sentido.
  • Camadas semânticas e grafos de conhecimento tentaram resolver isso antes e muitas vezes acabaram esquecidos na prateleira, porque modelar uma empresa inteira manualmente não consegue acompanhar o ritmo de mudança de um negócio.
  • A solução não é um projeto de documentação maior. É uma ontologia que rege o pequeno conjunto de conceitos que não podem estar errados e aprende continuamente o restante a partir de como a organização já funciona, o modelo que a Databricks incorporou à Genie Ontology.

Pergunte a cinco pessoas na mesma empresa o que significa "receita" e há uma chance de você obter cinco respostas diferentes, cada uma correta em seu próprio contexto e incompatível com as outras. Enquanto um analista humano esteve entre essa ambiguidade e o relatório final, a ambiguidade foi gerenciável. É o conhecimento tribal: o tipo de coisa que um bom analista simplesmente sabe.

Os agentes de AI não sabem disso. E esse é o problema.

Richard Tomlinson passou sua carreira pensando na camada de dados corporativos que quase nunca aparece no esquema. Nesta conversa, ele explica por que essa camada, a ontologia, é de repente a peça de infraestrutura mais importante que a maioria das empresas ainda não construiu, por que a última geração de tentativas de construí-la estagnou em grande parte e o que precisa ser verdade em uma ontologia para que ela se sustente quando os agentes começarem a depender dela.

Por que os agentes de AI precisam de contexto de negócios que um esquema não pode fornecer?

Qual é a suposição sobre dados corporativos que os agentes de AI estão quebrando silenciosamente?

Richard Tomlinson: Por décadas, a arquitetura de dados corporativos operou sob uma suposição implícita: se você organizar os dados corretamente, um usuário inteligente poderá descobrir o que eles significam. Tabelas, esquemas, catálogos e dashboards fornecem estrutura, enquanto os humanos fornecem o contexto que falta. Um analista sabe em qual das cinco tabelas de receita o Financeiro confia, o que "cliente ativo" significa neste trimestre ou por que um cálculo deve ser usado em vez de outro.

Os agentes de AI quebram essa suposição porque pode não haver um humano experiente entre os dados e a decisão. O agente precisa descobrir o significado por si mesmo. Dar a um agente acesso a mais dados não resolve isso. Ele precisa do contexto de negócios que os humanos historicamente carregaram em suas cabeças: definições, relacionamentos, cálculos, fontes autoritativas, conhecimento especializado e permissões. É por isso que o contexto corporativo está se tornando tão importante para a arquitetura de AI quanto os próprios dados.

O que é uma ontologia de dados e como ela difere de um esquema?

Como você define uma ontologia de dados e o que ela captura que um esquema jamais poderia?

Richard Tomlinson: Um esquema descreve como os dados são estruturados. Uma ontologia descreve o que esses dados significam no contexto do negócio. Ela conecta ativos técnicos, como tabelas, métricas e consultas, a conceitos de negócios: definições, relacionamentos, cálculos, fontes de conhecimento especializado e regras sobre como esses conceitos devem ser interpretados.

Um esquema pode dizer a um agente que uma tabela contém net_rev, gross_rev e recog_rev. Uma ontologia pode ajudá-lo a entender qual definição de receita se aplica à pergunta, qual fonte o Financeiro considera autoritativa, como o cálculo é normalmente realizado e se a pessoa que pergunta tem permissão para acessá-lo. O esquema é o mapa dos dados. A ontologia está mais próxima de um mapa de como a organização entende e usa esses dados.

Por que as camadas semânticas e os gráficos de conhecimento tiveram dificuldade para escalar?

As camadas semânticas e os gráficos de conhecimento corporativo prometeram "uma única versão da verdade" anos atrás e, em sua maioria, acabaram engavetados. O que precisa ser verdade em uma ontologia para que ela não sofra o mesmo destino?

Richard Tomlinson: Eu suavizaria um pouco essa premissa. As camadas semânticas e os gráficos de conhecimento entregaram valor real, particularmente para conceitos críticos de negócios. O problema surge quando as organizações tentam modelar manualmente toda a empresa. O conhecimento de negócios muda rápido demais e está espalhado por muitos lugares. A lógica importante pode estar em um dashboard, em uma consulta SQL, em um notebook, em um ticket ou simplesmente na maneira como uma equipe trabalha repetidamente. Nenhuma equipe central consegue documentar tudo isso e mantê-lo atualizado.

O modelo mais escalável é "modelar a cabeça e aprender a cauda". Os humanos devem definir e governar explicitamente o pequeno conjunto de conceitos que não podem estar errados, coisas como receita, regras de conformidade e KPIs principais. A ontologia mais ampla deve aprender continuamente a cauda longa a partir de como a organização opera, ao mesmo tempo em que classifica o conhecimento por autoridade e respeita a governança. Se a manutenção da ontologia se tornar um projeto separado de modelagem de dados corporativos, ela acabará ficando atrás do negócio que deveria descrever.

O que acontece quando um agente de AI carece de contexto de negócios?

Você pode descrever um momento em que um agente deu uma resposta errada com total confiança porque carecia de contexto de negócios real? O que a tornou convincente o suficiente para que alguém quase confiasse nela?

Richard Tomlinson: Um exemplo de nossos próprios testes internos foi pedir a vários sistemas de AI que preparassem um briefing para um próximo Conselho Consultivo de Produtos. Um assistente produziu um relatório polido quase imediatamente e afirmou que 24 clientes estavam participando. Ele incluía o tipo de detalhes que você esperaria em um resumo executivo, então, à primeira vista, a resposta parecia confiável. Quando desafiamos o sistema a explicar de onde vinha o número 24, ele admitiu que o havia inventado.

Esse é o modo de falha perigoso. A resposta não é obviamente absurda. Ela é fluida, específica e apresentada junto com informações legítimas. O problema é que o modelo não sabe qual fonte interna contém a verdade absoluta, então ele preenche a lacuna com inferência. Na AI corporativa, uma resposta plausível pode ser mais perigosa do que nenhuma resposta.

Como saber se sua organização está sem uma camada de contexto?

Se um líder de dados quisesse saber se sua própria organização tem esse problema, o que ele deveria procurar? Existe algum sinal que indique que a camada de contexto está faltando?

Richard Tomlinson: O sinal mais claro é a frequência com que uma pergunta simples de negócios exige que uma pessoa experiente a traduza antes que os dados possam respondê-la. Se alguém pergunta: "Qual foi a receita no último trimestre?" e o analista responde imediatamente com "Qual receita?" ou "Para qual unidade de negócios?", essa etapa de tradução é o contexto de negócios. O mesmo vale para quando os analistas sabem em qual dashboard confiar, qual tabela está obsoleta ou qual definição uma equipe usa em comparação com outra.

Outros sinais: dashboards duplicados, definições conflitantes de KPIs, analistas respondendo repetidamente às mesmas perguntas e usuários de negócios desconfiando do self-service porque ferramentas diferentes retornam respostas diferentes. O problema subjacente geralmente não é que a empresa carece de dados. É que o conhecimento necessário para interpretar os dados vive no conhecimento tribal, em artefatos desconectados e em especialistas individuais, em vez de em uma camada de contexto que a AI possa usar de forma confiável.

EBOOK

Principais conclusões sobre sistemas multiagentes, casos de uso de IA, avaliações e muito mais

Quanto custa para as empresas hoje a falta de contexto de negócios?

Quanto isso está custando para as empresas hoje, mesmo antes de implantarem agentes em escala? São decisões mais lentas, trabalho duplicado de analistas, perda de confiança nos dashboards?

Richard Tomlinson: Tudo isso. As organizações já pagam uma "taxa de contexto". Os analistas gastam tempo redescobrindo definições, localizando fontes autoritativas, reconciliando relatórios conflitantes e explicando a lógica de negócios que existe em outro lugar da organização. Equipes diferentes recriam a mesma semântica dentro de ferramentas de BI diferentes. Os usuários de negócios esperam pelos analistas porque o self-service deixa de funcionar assim que a pergunta se torna mais complexa.

A AI torna esse problema existente mais visível. Sem contexto, os agentes repetem grande parte do mesmo processo de descoberta computacionalmente: explorando esquemas, lendo documentos, testando consultas e reconsiderando suposições. Isso cria latência adicional, consumo de tokens e custos, sem garantir a resposta correta. O custo maior, no entanto, é a confiança. Assim que os usuários descobrem que um dashboard ou assistente de AI pode produzir o número errado com total confiança, eles voltam a perguntar a um humano.

O que muda quando os agentes de AI podem ser confiáveis para agir, e não apenas relatar?

O que muda para uma empresa no momento em que seus agentes podem ser confiáveis para agir, e não apenas relatar?

Richard Tomlinson: O valor da AI muda drasticamente. Relatórios economizam o tempo que alguém levaria para encontrar uma resposta. A ação confiável pode remover etapas inteiras de um fluxo de trabalho. Um agente pode calcular os números mais recentes, preparar a revisão semanal de negócios, investigar uma anomalia, atualizar um ticket, entrar em contato com as pessoas certas e repetir esse processo toda segunda-feira sem que alguém precise orquestrar cada etapa manualmente.

Isso também muda a economia do conhecimento especializado. Um especialista financeiro, gerente de produto ou líder de operações pode codificar métodos críticos uma vez e combiná-los com um agente que entende o contexto de negócios mais amplo. Seu conhecimento especializado pode então ser aplicado em muito mais decisões e fluxos de trabalho do que esse indivíduo poderia apoiar pessoalmente. O qualificador principal é "confiável": a autonomia só se torna útil quando o agente entende o negócio bem o suficiente, e é governado de forma rígida o suficiente, para agir dentro dos limites apropriados.

Qual é a maneira certa de começar a construir uma ontologia de dados?

Qual é a maneira errada de começar, o instinto que leva a mais uma iniciativa engavetada, em comparação com o primeiro passo correto?

Richard Tomlinson: O instinto errado é: "Antes de podermos usar AI, precisamos modelar toda a empresa". Isso transforma o contexto de negócios em um projeto de documentação de vários anos. No momento em que cada termo, relacionamento e regra for modelado, grande parte do modelo já estará desatualizada.

A melhor abordagem é começar com o conhecimento que você já tem. Governe o pequeno número de conceitos que realmente não podem estar errados, como KPIs críticos e definições de negócios, e depois deixe a camada de contexto mais ampla aprender com os dashboards, consultas, notebooks, documentos e atividades operacionais que suas equipes já estão produzindo. Não exija que a empresa documente tudo antes que a AI possa se tornar útil. Deixe que o uso real ajude a construir e aprimorar continuamente a compreensão de negócios que os agentes consomem.

Como os líderes de dados devem repensar a arquitetura de dados para agentes de AI?

Como um líder de dados deve pensar de forma diferente sobre sua arquitetura de dados agora que o contexto, e não apenas a estrutura, é o que realmente vale o investimento?

Richard Tomlinson: Durante anos, a arquitetura de dados focou muito em tornar os dados acessíveis, confiáveis e governados. Isso continua sendo essencial, mas a AI adiciona outro requisito: a arquitetura também deve tornar o significado de negócios acessível. Um agente precisa saber não apenas onde os dados estão, mas como a organização os interpreta, quais relacionamentos importam, quais definições são autoritativas e quais evidências as apoiam.

Isso significa que ativos que antes eram vistos principalmente como infraestrutura de governança ou analytics se tornam ativos estratégicos de AI. Definições de métricas, documentação, linhagem, certificações, padrões de uso e glossários de negócios ensinam coletivamente à AI como a empresa funciona. A arquitetura emergente, portanto, não é apenas um plano de dados mais um modelo de AI. Ela também precisa de uma camada de contexto compartilhada que possa fornecer a mesma compreensão de negócios para muitos agentes e aplicações.

A ontologia de dados realmente melhora a precisão do agente?

Richard Tomlinson: Uma ontologia por si só não torna um agente preciso num passe de mágica. O que melhora a precisão é fornecer ao agente o contexto correto e autoritativo no momento em que ele está raciocinando. Se a ontologia puder dizer ao agente qual definição se aplica, onde os dados confiáveis estão e quais relacionamentos ou cálculos importam, o agente gastará menos tempo adivinhando e explorando caminhos incorretos.

Temos evidências desse efeito com a Genie Ontology, a camada de contexto automática sob o Genie One e os Genie Agents da Databricks. Em um benchmark interno da Databricks usando 28 perguntas reais de análise de dados corporativos, o Genie com Ontology respondeu 84,5% corretamente na primeira tentativa. O agente de codificação de uso geral mais forte na mesma avaliação obteve 52,4%. O Genie também foi cerca de duas vezes mais rápido que esse agente. Esse é um benchmark interno, e não uma garantia de precisão universal, mas ilustra o princípio fundamental: um melhor contexto corporativo pode importar tanto quanto, ou mais do que, simplesmente dar ao modelo mais tempo para raciocinar.

Você precisa criar uma ontologia formal do zero?

Richard Tomlinson: Não, e exigir isso recriaria o problema de escalabilidade que estamos tentando resolver. A maioria das empresas já criou uma grande quantidade de sua compreensão de negócios. Ela existe em definições de métricas, dados certificados, dashboards, consultas, notebooks, documentação e nas maneiras repetidas como as equipes usam esses ativos.

O objetivo deve ser preservar o controle humano sobre os conceitos que mais importam, enquanto se aprende automaticamente grande parte da cauda longa. Com a Genie Ontology, isso significa modelar explicitamente KPIs críticos e termos de negócios, enquanto a camada inferida aprende definições, regras, relacionamentos e fontes autoritativas adicionais a partir do trabalho existente. Você obtém valor do conhecimento que a organização já possui, em vez de esperar que um projeto de ontologia separado seja concluído.

Qual é o papel da governança em um agente de AI baseado em ontologia?

Como a governança se encaixa em um agente baseado em ontologia?

Richard Tomlinson: A governança tem duas funções. A óbvia é o acesso: a ontologia nunca deve se tornar uma porta dos fundos para contornar as permissões existentes. Se um usuário não puder acessar as informações de origem, o agente não deverá ser capaz de recuperar o contexto derivado delas. Com a Genie Ontology, as permissões são aplicadas durante a recuperação, usando a governança das fontes subjacentes, incluindo o Unity Catalog. Portanto, dois funcionários podem fazer a mesma pergunta e receber, de forma apropriada, respostas diferentes com base no que cada um está autorizado a ver.

A segunda função é tão importante quanto: a governança ajuda a AI a entender em que confiar. Certificação, definições autoritativas, linhagem, uso, especialidade e proveniência da fonte tornam-se sinais que ajudam a distinguir a definição oficial de receita de um cálculo pontual que alguém criou seis meses atrás. Na era da AI, a governança não se trata mais apenas de controlar dados. Ela é cada vez mais parte do mecanismo que ensina à AI qual conhecimento de negócios merece autoridade.

Por que a ontologia de dados está se tornando infraestrutura de AI?

A palavra "ontologia" costumava pertencer a equipes de modelagem semântica e debates sobre taxonomia. Ela está se tornando rapidamente algo mais próximo de infraestrutura: a camada que decide se a resposta de um agente reflete como a empresa realmente funciona ou se é apenas um palpite plausível disfarçado de resposta. As organizações que tratam o contexto como algo a ser governado e aprendido continuamente, e não documentado uma vez e deixado de lado, serão aquelas cujos agentes serão confiáveis para agir, e não apenas relatar.

Veja como a Genie ontology fundamenta as respostas de AI no que sua empresa realmente quer dizer. Explore o Genie.

Leia a seguir:

(Esta publicação no blog foi traduzida utilizando ferramentas baseadas em inteligência artificial) Publicação original

Receba os posts mais recentes na sua caixa de entrada

Assine nosso blog e receba os posts mais recentes diretamente na sua caixa de entrada.