Ir para o conteúdo principal
AI Engineering

Por que um agente de dados de fronteira supera os agentes de codificação gerais em qualidade e custo

Avaliamos o Genie Code em comparação com três dos principais agentes de codificação em mais de 400 tarefas de sessões internas reais.

por A Equipe de Pesquisa em IA da Databricks

  • O Genie Code é o agente de dados da Databricks para todo o espectro de trabalho com dados — desde a análise básica de dados até a exploração de dados em todo o espaço de trabalho, passando por tarefas de engenharia de dados, como a criação de pipelines, a depuração de falhas e a publicação de dashboards.
  • Em mais de 400 tarefas de uso interno real, o Genie Code foi o agente mais preciso que testamos e também o mais barato, fornecendo uma resposta correta por menos da metade do custo de outros agentes.
  • Devido à profunda compreensão semântica do contexto empresarial, o Genie Code pode evitar a exploração de esquema por força bruta que causa os erros e os altos custos de outros agentes, levando a respostas mais precisas com um custo significativamente menor.

A sabedoria convencional em IA de agentes diz que respostas melhores custam mais tokens: se deixarmos o agente explorar por mais tempo, verificar mais e tentar novamente mais vezes, a precisão sempre aumentará. Quando avaliamos o Genie Code diretamente contra três dos principais agentes de codificação de uso geral em mais de 400 tarefas de dados reais do nosso uso interno, descobrimos o oposto: o Genie Code foi o agente mais preciso que testamos e também o mais eficiente em termos de custo.

O Genie Code supera os agentes de codificação em mais de 400 tarefas de dados reais


A razão é que os agentes de dados precisam trabalhar em um novo paradigma no qual os agentes de codificação gerais têm dificuldades. Como compartilhamos anteriormente, os agentes de dados enfrentam desafios únicos: eles precisam descobrir os ativos certos em um espaço de trabalho dinâmico e em constante evolução, com centenas de milhares de tabelas, notebooks, dashboards e documentos; precisam determinar a fonte da verdade em metadados e documentos que podem estar desatualizados ou contraditórios; e precisam fazer tudo isso sem os testes verificáveis nos quais os agentes de codificação se apoiam.

Para lidar com esses desafios, equipamos o Genie Code com recursos que permitem evitar a exploração de caminhada aleatória à qual os agentes de codificação gerais recorrem: busca semântica no catálogo e nos ativos do espaço de trabalho, memória persistente das tabelas e da lógica de negócios em que os usuários confiam, e uma profunda compreensão semântica do contexto empresarial.

Observamos essa diferença diretamente nas sessões desta avaliação. Em um exemplo, o Genie Code encontra a tabela certa de maneira eficiente aproveitando a busca semântica e os metadados, escreve uma consulta SQL e chega à resposta correta em cinco chamadas de ferramenta, enquanto nenhum dos três agentes de uso geral consegue se recuperar da exploração.

O Genie Code evita a caminhada aleatória

Abaixo, detalhamos como avaliamos o Genie Code em um amplo espectro de tarefas de usuários do mundo real.

Avaliamos os agentes em mais de 400 tarefas reais de uso real

Criamos deliberadamente um conjunto de avaliação para abranger uma ampla distribuição de tarefas de usuários reais no Genie Code. Destilamos 401 tarefas independentes do uso interno real na Databricks, abrangendo desde perguntas cotidianas até os problemas mais difíceis que os usuários avançados enfrentam: tarefas de descoberta em que o agente deve encontrar os ativos certos, criação e modificação de código e consultas, depuração de código, compreensão e explicação de códigos existentes, consultas de dados precisas que exigem a extração de números exatos de tabelas e muito mais.

Distribuição das tarefas de avaliação

Executamos as mesmas tarefas no Genie Code e em três dos principais agentes de codificação de uso geral, que chamaremos de Agente X, Agente Y e Agente Z, cada um com o mesmo limite de tempo real de 20 minutos por tarefa. As respostas foram avaliadas por um juiz independente com base no fato de a resposta ser correta e útil. Uma tarefa que excede o tempo limite conta como falha. Os valores em dólares nesta análise são estimativas do que um usuário pagaria por cada agente e são mais informativos em termos relativos.

Resultados

Executamos cada agente em todas as 401 tarefas, com todos os agentes usando LLMs semelhantes de nível de fronteira e aprimorados com o MCP da Databricks.

Agente

Precisão

Média de $/tarefa

Genie Code

76.6%

$0.55

Agente X

72.1%

$1.09

Agente Y

55.9%

$0.91

Agente Z

56.1%

$1.16

O Genie Code custa cerca de metade do valor de outros agentes

O Genie Code é o agente mais preciso nesse benchmark e o mais barato: custa cerca de metade do valor por tarefa do Agente X e menos da metade do seu custo por resposta correta. Os Agentes Y e Z ficam na faixa dos 50% de precisão, prejudicados em grande parte por timeouts de tempo real em varreduras de longa duração, muitas vezes devido a consultas ineficientes e sem limite em tabelas muito grandes.

Para este benchmark específico, observamos que a tarefa mediana custa US$ 0,34, o p99 é US$ 2,72, a tarefa mais cara custa US$ 3,87 e apenas 4% das tarefas excedem US$ 2. Os outros agentes colocam de 33% a 40% de suas tarefas acima de US$ 1 (contra 16% do Genie Code), e as execuções de exploração profunda do Agente X chegam a um custo significativamente maior de US$ 9,49. Como todos os agentes têm acesso ao mesmo nível de modelos de fronteira, as variações de custo se resumem à eficiência: fazer menos interações e gastar menos tokens para chegar a uma resposta.

O Genie Code continua eficiente em toda a distribuição de tarefas

A diferença é impulsionada pela forma como cada agente encontra os dados de que precisa. As tarefas mais dificéis do conjunto não nomeiam os ativos explicitamente, e o agente deve localizar as tabelas, notebooks ou dashboards corretos, juntamente com a lógica de negócios relevante, antes de poder responder. Nessas tarefas, os agentes de uso geral recorrem a uma exploração ineficiente do espaço de trabalho, e essa exploração resulta em menor precisão e maior custo.

A compreensão do Genie Code sobre o contexto do espaço de trabalho — busca semântica no catálogo e memória persistente dos dados do espaço de trabalho — permitiu evitar a maior parte disso, com uma média de apenas 8,3 chamadas de ferramenta por tarefa, menos do que qualquer agente que testamos. É disso também que são feitas as caudas de custo acima: as execuções caras de todos os agentes são dominadas por essas tarefas de descoberta, e a cauda do Genie Code é a mais curta. Esperamos que essa vantagem seja ainda mais fortalecida pela Genie Ontology; desativamos a Ontology durante esta execução, pois ela ainda não está disponível globalmente para todos os nossos clientes.

Conclusão

Quando começamos nossa investigação, esperávamos um trade-off entre precisão e custo. Em vez disso, em uma ampla distribuição de tarefas de usuários reais, descobrimos que o Genie Code é capaz de usar sua forte compreensão semântica dos dados para superar os agentes de codificação gerais, sendo mais preciso e mais barato.

O Genie Code foi desenvolvido como um agente de dados de fronteira, otimizado para operar em um ambiente altamente dinâmico e ambíguo como o espaço de trabalho do Databricks. Os agentes de codificação gerais têm dificuldades nesses ambientes: eles acabam gastando suas interações e tokens para redescobrir o contexto que o Genie Code já possui. Essa especialização se traduz em precisão, velocidade e custo ao mesmo tempo, sem comprometer a capacidade de uso geral.

Por fim, assim como nosso benchmark de agentes de codificação na base de código da Databricks, a lição mais ampla é que os rankings genéricos não conseguem medir a experiência diária dos usuários. Estamos expandindo nossas avaliações todos os dias com base em tarefas do mundo real e continuaremos a publicar o que aprendermos.

(Esta publicação no blog foi traduzida utilizando ferramentas baseadas em inteligência artificial) Publicação original

Receba os posts mais recentes na sua caixa de entrada

Assine nosso blog e receba os posts mais recentes diretamente na sua caixa de entrada.