Comment nous avons conçu un routage sensible aux tâches entre modèles et environnements d'évaluation pour réduire les coûts des tâches de codage réelles chez Databricks
par Ankit Mathur, Ivan Zhou, Bryan Qiu, Rohit Agrawal, Elise Gonzales et Kelly Albano
La frontière de prix et de performance pour les tâches de codage présente une immense diversité de modèles et de harnais : rien qu'en 2026, nous avons vu la sortie de 33 nouveaux modèles. Dans notre article précédent sur l'évaluation comparative par rapport à la base de code Databricks, nous avons constaté que les modèles se regroupent par niveaux de compétences et qu'une grande partie du travail quotidien (par exemple, activer un flag, modifier un seul fichier, corriger un bug bien délimité) ne nécessitait pas les modèles les plus coûteux.
Alors, comment réduire les coûts de codage par AI sans sacrifier la productivité des développeurs ? L'une des meilleures opportunités consiste à associer chaque tâche au bon modèle plutôt que d'attribuer par défaut chaque tâche à l'option la plus performante (et la plus coûteuse). Le simple fait d'utiliser des modèles moins coûteux peut vous faire économiser plus de 50 %, mais c'est extrêmement intimidant pour les utilisateurs. Avec la prolifération d'excellents modèles et de harnais performants, les utilisateurs d'agents de codage sont constamment confrontés à une surcharge de choix. Au lieu de perdre du temps à essayer de sélectionner le meilleur modèle pour chaque tâche, beaucoup configurent le plus performant avec le niveau d'effort le plus élevé et passent à autre chose. Plutôt que de demander aux utilisateurs de choisir ou de freiner la productivité avec des limites strictes, nous savions que nous devions innover.

C'est pourquoi nous lançons le prochain contrôle de coût majeur dans Unity AI Gateway : le Smart Routing, désormais disponible en Beta. Unity AI Gateway fournit un espace centralisé pour accéder à l'AI, gérer les dépenses et appliquer des contrôles dans toute votre entreprise, et le Smart Routing ajoute une optimisation intelligente en associant automatiquement les tâches au bon modèle en fonction de leur complexité. Le Smart Routing fonctionne directement dans Claude Code et Codex, vous permettant d'optimiser les outils que les développeurs utilisent déjà.
Et nous allons au-delà du routage de modèles. Avec Omnigent, notre méta-harnais pour les agents de codage, les équipes peuvent exploiter toute la puissance du Smart Routing en optimisant à la fois les modèles et les harnais de codage, offrant aux développeurs la bonne combinaison pour la tâche sans qu'ils aient à la choisir eux-mêmes.
Les résultats parlent d'eux-mêmes : sur les charges de travail de codage internes, le Smart Routing a surpassé n'importe quel modèle unique pour seulement 65 % du coût par tâche d'un modèle de premier plan comme Opus 5. Sur les benchmarks publics, le Smart Routing a égalé les performances d'Opus 5 pour moins de la moitié du coût.

Voici ce que nous avons appris :
Voyons en détail comment nous avons construit cela.
Le routage intelligent de modèles sélectionne le modèle le mieux adapté à une tâche en fonction de facteurs tels que la complexité, la capacité et le coût. Pour les agents de codage, une décision importante est de savoir quand ce routage doit avoir lieu.
Il existe généralement deux approches de routage :
Nous avons opté pour un routage basé sur la tâche afin de préserver l'efficacité du cache tout en associant chaque tâche de codage au modèle et au harnais appropriés. Le problème le plus intéressant consiste à évaluer la difficulté d'une tâche avant de la commencer. Nous voulions commencer simplement, c'est pourquoi notre routeur utilise actuellement une politique unique et l'applique de la même manière à chaque tâche.
Tout d'abord, nous classifions la tâche. Pour cela, nous utilisons un modèle moins cher et à faible latence qui lit la description de la tâche et l'étiquette avec quelques champs sémantiques : quelle partie du système change, quelles preuves de code le prompt contient (un extrait, un traceback ou rien d'explicite), comment il semble échouer, à quel point la correction semble localisée et à quel type de projet elle appartient. À partir de ces éléments, le routeur dérive une famille de types de tâches et une famille de langages. L'utilisation d'un modèle de pointe taxerait chaque requête (même les plus simples sur lesquelles nous voulons économiser), l'extracteur est donc volontairement petit et rapide.
Ensuite, nous triangulons pour déterminer quelle classe de modèle est la meilleure. Le routeur utilise par défaut un modèle de taille moyenne et utilise les étiquettes pour s'orienter dans un sens ou dans l'autre, en escaladant vers un modèle plus coûteux lorsque la tâche exige des capacités et des connaissances de pointe, ou en déléguant à un modèle moins cher lorsque ce n'est pas le cas. Cela signifie que la politique unique peut tirer parti de toute une suite de modèles.
Les premiers résultats sont prometteurs. Par rapport à notre propre benchmark interne, auquel aucun laboratoire n'a eu accès, nous avons constaté une économie de 35 %. Par rapport aux benchmarks de codage publics qui démontrent la généralisation de nos résultats, nous avons réalisé 56 % d'économies. Nous nous attendons à voir ces chiffres augmenter à mesure que nous en apprendrons davantage sur nos propres cas d'usage et avec nos partenaires de conception.
Le Smart Routing gère la décision de routage, mais vous devez ensuite être en mesure d'agir en conséquence. Il fonctionne nativement dans Claude Code et Codex, mais pour les agents de codage, nous constatons de meilleures performances en choisissant non seulement le bon modèle, mais aussi le bon harnais de codage. Aider les ingénieurs à tirer parti du modèle et du harnais choisis nécessite une couche située au-dessus des sessions de codage individuelles pour les orchestrer. C'est pourquoi nous avons créé Omnigent.

Le Smart Routing est implémenté dans Omnigent à deux niveaux :
Tout d'abord, les développeurs utilisant Omnigent peuvent sélectionner le Smart Routing au lieu de choisir manuellement un harnais de codage spécifique. Omnigent sélectionne ensuite automatiquement le harnais et le modèle pour chaque tâche, le routage du modèle étant alimenté par le Smart Routing dans Unity AI Gateway. Cette conception donne aux développeurs et aux administrateurs la liberté de fournir des personnalisations, telles que des directives au niveau de l'organisation ou la possibilité d'utiliser l'historique des conversations précédentes, sans avoir à modifier le client à chaque fois.
Cela signifie également que tous les lancements de sous-agents passent par l'API Smart Routing, ce qui permet aux sous-agents de tirer parti d'un harnais et d'un modèle différents. Le prompt initial de l'utilisateur est souvent sous-spécifié et difficile à évaluer en termes de complexité. Les sous-agents vous permettent donc d'ajuster le nouveau travail en fonction de nouvelles informations, avec un cache frais et des instructions claires. Une seule tâche peut faire l'objet de décisions de routage nuancées entre la planification et le travail parallèle des sous-agents (par exemple, vous pouvez router les tâches de résumé de grandes bases de code vers des modèles moins chers tout en concevant l'architecture avec des modèles plus coûteux), ce qui entraîne des économies encore plus substantielles.
Un routage de modèles efficace doit optimiser à la fois les coûts et la productivité des développeurs, et pas seulement les coûts. Il est essentiel de disposer de signaux de retour d'expérience, car les routeurs sont encore des technologies émergentes qui nécessiteront de nombreuses itérations. Notre première étape a consisté à enregistrer toutes les traces des sessions de codage pour une évaluation ultérieure. Nous voulons prendre en compte à la fois le coût et l'expérience des développeurs – nous ne voulons pas optimiser les coûts au détriment de la productivité.
Avec Unity AI Gateway, les traces des agents de codage peuvent être enregistrées dans Unity Catalog. Il s'agit de données extrêmement sensibles, qui doivent rester régies par des politiques d'accès et d'étiquetage sophistiquées dans la plupart des entreprises matures.
Nous avons utilisé à la fois des modèles AI et une évaluation humaine pour analyser les traces afin d'évaluer les modifications apportées au routeur. Lorsque nous avons effectué cette analyse sur nos propres sessions avant le routage, nous avons constaté qu'une grande partie des sessions dépensaient le budget d'un modèle de pointe pour un travail qui n'en avait pas besoin, simplement parce que le modèle par défaut était le plus cher. En pratique, pour valider l'utilité du routeur, il convient de suivre en continu les indicateurs suivants :

Nous pensons qu'il s'agit d'un domaine qui présente d'immenses opportunités et nous prévoyons de continuer à y mener des recherches approfondies. C'est encore le début, nous avons donc beaucoup à apprendre.
Notre premier défi a été le manque de fiabilité des données de référence qui ne correspondent pas au comportement réel des utilisateurs. Les tâches de référence sont généralement très bien structurées, chacune se présentant comme un énoncé de travail autonome. Bien que les routeurs soient performants sur ce type de tâches, les sessions réelles sont souvent bien différentes.
Nous étudions donc de nouvelles pistes pour recueillir plus d'informations et tester de nouvelles techniques :
Le routage est généralement présenté comme un moyen de dépenser moins. Bien que la plupart de nos gains proviennent de tarifs plus bas pour des tâches simples, le même mécanisme peut nous aider à décider quand dépenser plus pour obtenir un meilleur résultat. L'optimisation de la valeur fonctionne dans les deux sens : choisir le modèle économique lorsqu'il suffit, et ne pas hésiter à dépenser plus lorsque la valeur le justifie.
Les outils de codage incitent souvent les utilisateurs à consommer de plus en plus de tokens, mais ce que nous voulons réellement, c'est optimiser le rendement productif par dollar, et non les tokens. Choisir un modèle plus rapide et moins cher lorsqu'il suffit ne permet pas seulement d'économiser de l'argent. Cela permet également de gagner du temps et de préserver la capacité limitée des modèles de pointe pour les tâches qui en ont réellement besoin.
Smart Routing est désormais disponible en version bêta via Unity AI Gateway. Il oriente automatiquement les tâches de codage vers le bon modèle en fonction de leur complexité, aidant ainsi les équipes à atteindre des performances de pointe tout en réalisant plus de 30 % d'économies grâce à la sélection du meilleur modèle pour chaque tâche. Pour les équipes qui cherchent à réduire les coûts de codage liés à l'AI sans limiter le choix ou la productivité des développeurs, Smart Routing offre une alternative à la sélection manuelle des modèles ou aux limites de dépenses strictes. Et avec Omnigent, vous pouvez étendre le routage intelligent aux modèles et aux environnements de codage.
Pour commencer, consultez nos pages de documentation :
Pour en savoir plus sur Unity AI Gateway, visitez notre site web.
(Cet article de blog a été traduit à l'aide d'outils basés sur l'intelligence artificielle) Article original
Abonnez-vous à notre blog et recevez les derniers articles directement dans votre boîte mail.