Nous évaluons Genie Code par rapport à trois agents de codage de premier plan sur plus de 400 tâches issues de sessions internes réelles.
Selon l'opinion générale dans le domaine de l'IA agentique, de meilleures réponses coûtent plus de tokens : plus on laisse l'agent explorer, vérifier et réessayer, plus la précision augmente. Lorsque nous avons comparé Genie Code directement à trois des principaux agents de codage généralistes sur plus de 400 tâches de données réelles issues de notre utilisation interne, nous avons constaté le contraire : Genie Code était à la fois l'agent le plus précis que nous ayons testé et le plus rentable.

La raison en est que les agents de données doivent opérer dans un nouveau paradigme où les agents de codage généralistes sont en difficulté. Comme nous l'avons déjà partagé, les agents de données font face à des défis uniques : ils doivent découvrir les bonnes ressources dans un espace de travail dynamique et en constante évolution contenant des centaines de milliers de tables, de notebooks, de tableaux de bord et de documents ; ils doivent déterminer la source unique de vérité parmi des métadonnées et des documents parfois obsolètes ou contradictoires ; et ils doivent faire tout cela sans les tests vérifiables sur lesquels s'appuient les agents de codage.
Pour relever ces défis, nous avons doté Genie Code de capacités qui lui permettent d'éviter l'exploration aléatoire à laquelle les agents de codage généralistes doivent recourir : la recherche sémantique dans le catalogue et les ressources de l'espace de travail, une mémoire persistante des tables et de la logique métier utilisées par les utilisateurs, ainsi qu'une compréhension sémantique approfondie du contexte de l'entreprise.
Nous observons directement cette différence dans les sessions de cette évaluation. Par exemple, Genie Code trouve efficacement la bonne table en s'appuyant sur la recherche sémantique et les métadonnées, écrit une requête SQL et obtient la bonne réponse en seulement cinq appels d'outils, tandis qu'aucun des trois agents généralistes ne parvient à sortir de sa phase d'exploration.

Ci-dessous, nous détaillons la manière dont nous avons évalué Genie Code sur un large éventail de tâches utilisateur réelles.
Nous avons délibérément conçu un ensemble d'évaluation couvrant une large distribution de tâches utilisateur réelles sur Genie Code. Nous avons extrait 401 tâches autonomes issues de l'utilisation interne réelle chez Databricks, allant des questions quotidiennes aux problèmes plus complexes auxquels sont confrontés les utilisateurs expérimentés : tâches de découverte où l'agent doit trouver les bonnes ressources, création et modification de code et de requêtes, débogage de code, compréhension et explication de code existant, recherches de données précises nécessitant d'extraire des chiffres exacts de tables, et bien plus encore.

Nous avons soumis ces mêmes tâches à Genie Code et à trois des principaux agents de codage généralistes, que nous appellerons Agent X, Agent Y et Agent Z, chacun disposant d'un temps limite de 20 minutes par tâche. Les réponses ont été évaluées par un juge indépendant pour déterminer si elles étaient correctes et utiles. Une tâche qui expire (timeout) est considérée comme un échec. Les montants en dollars figurant dans cette analyse sont des estimations de ce qu'un utilisateur paierait pour chaque agent, et ils sont plus informatifs en termes relatifs.
Nous avons testé chaque agent sur l'ensemble des 401 tâches, tous les agents utilisant des LLM de pointe similaires et étant enrichis avec le MCP de Databricks.
Agent | Précision | Coût moyen $/tâche |
Genie Code | 76,6% | 0,55 $ |
Agent X | 72,1% | 1,09 $ |
Agent Y | 55,9% | 0,91 $ |
Agent Z | 56,1% | 1,16 $ |

Genie Code est l'agent le plus précis sur ce benchmark et le moins cher : son coût par tâche est environ deux fois moins élevé que celui de l'Agent X, et moins de la moitié de son coût par réponse correcte. Les agents Y et Z se situent autour de 55 % de précision, pénalisés en grande partie par des dépassements de temps sur des analyses de longue durée, souvent dus à des requêtes inefficaces et non limitées sur de très grandes tables.
Pour ce benchmark particulier, nous avons constaté que la tâche médiane coûte 0,34 $, le p99 est de 2,72 $, la tâche la plus chère s'élève à 3,87 $, et seulement 4 % des tâches dépassent 2 $. Les autres agents dépassent 1 $ pour 33 à 40 % de leurs tâches (contre 16 % pour Genie Code), et les phases d'exploration approfondie de l'Agent X atteignent un coût maximal nettement plus élevé de 9,49 $. Étant donné que tous les agents ont accès à la même catégorie de modèles de pointe, les variations de coût s'expliquent par l'efficacité : effectuer moins d'étapes et consommer moins de tokens pour parvenir à une réponse.

L'écart s'explique par la manière dont chaque agent trouve les données dont il a besoin. Les tâches les plus difficiles de l'ensemble ne nomment pas explicitement les ressources, et l'agent doit localiser les bonnes tables, notebooks ou tableaux de bord, ainsi que la logique métier pertinente avant de pouvoir répondre. Sur ces tâches, les agents généralistes se rabattent sur une exploration inefficace de l'espace de travail, ce qui se traduit par une précision moindre et un coût plus élevé.
La compréhension du contexte de l'espace de travail par Genie Code — recherche sémantique dans le catalogue et mémoire persistante des données de l'espace de travail — lui permet d'éviter la majeure partie de ce processus, avec une moyenne de seulement 8,3 appels d'outils par tâche, soit moins que tous les autres agents testés. C'est également ce qui explique les coûts extrêmes mentionnés ci-dessus : pour chaque agent, les exécutions coûteuses sont dominées par ces tâches de découverte, et la traîne de Genie Code est la plus courte. Nous prévoyons que cet avantage sera encore renforcé par la Genie Ontology ; nous avons désactivé l'Ontology lors de ce test car elle n'est pas encore disponible mondialement pour tous nos clients.
Lorsque nous avons commencé notre étude, nous nous attendions à un compromis entre précision et coût. Au lieu de cela, sur une large distribution de tâches utilisateur réelles, nous constatons que Genie Code est capable d'utiliser sa solide compréhension sémantique des données pour surpasser les agents de codage généralistes, en étant à la fois plus précis et moins cher.
Genie Code est conçu comme un agent de données de pointe, optimisé pour fonctionner dans un environnement hautement dynamique et ambigu comme l'espace de travail Databricks. Les agents de codage généralistes ont du mal dans ces environnements : ils finissent par consacrer leurs étapes et leurs tokens à redécouvrir un contexte que Genie Code possède déjà. Cette expertise se traduit simultanément par une amélioration de la précision, de la rapidité et des coûts, sans aucun compromis sur les capacités généralistes.
Enfin, à l'instar de notre benchmark d'agents de codage sur la base de code Databricks, la leçon plus large est que les classements génériques ne peuvent pas mesurer l'expérience quotidienne des utilisateurs. Nous élargissons chaque jour nos évaluations en nous basant sur des tâches du monde réel, et nous continuerons à publier nos conclusions.
(Cet article de blog a été traduit à l'aide d'outils basés sur l'intelligence artificielle) Article original
Abonnez-vous à notre blog et recevez les derniers articles directement dans votre boîte mail.