Revenir au contenu principal
Produit

Routage intelligent dans Unity AI Gateway : égalez la qualité des modèles de pointe pour un coût par tâche réduit de plus de 30 %

Comment nous avons conçu un routage sensible aux tâches entre modèles et environnements d'évaluation pour réduire les coûts des tâches de codage réelles chez Databricks

par Ankit Mathur, Ivan Zhou, Bryan Qiu, Rohit Agrawal, Elise Gonzales et Kelly Albano

La frontière de prix et de performance pour les tâches de codage présente une immense diversité de modèles et de harnais : rien qu'en 2026, nous avons vu la sortie de 33 nouveaux modèles. Dans notre article précédent sur l'évaluation comparative par rapport à la base de code Databricks, nous avons constaté que les modèles se regroupent par niveaux de compétences et qu'une grande partie du travail quotidien (par exemple, activer un flag, modifier un seul fichier, corriger un bug bien délimité) ne nécessitait pas les modèles les plus coûteux.

Alors, comment réduire les coûts de codage par AI sans sacrifier la productivité des développeurs ? L'une des meilleures opportunités consiste à associer chaque tâche au bon modèle plutôt que d'attribuer par défaut chaque tâche à l'option la plus performante (et la plus coûteuse). Le simple fait d'utiliser des modèles moins coûteux peut vous faire économiser plus de 50 %, mais c'est extrêmement intimidant pour les utilisateurs. Avec la prolifération d'excellents modèles et de harnais performants, les utilisateurs d'agents de codage sont constamment confrontés à une surcharge de choix. Au lieu de perdre du temps à essayer de sélectionner le meilleur modèle pour chaque tâche, beaucoup configurent le plus performant avec le niveau d'effort le plus élevé et passent à autre chose. Plutôt que de demander aux utilisateurs de choisir ou de freiner la productivité avec des limites strictes, nous savions que nous devions innover.

C'est pourquoi nous lançons le prochain contrôle de coût majeur dans Unity AI Gateway : le Smart Routing, désormais disponible en Beta. Unity AI Gateway fournit un espace centralisé pour accéder à l'AI, gérer les dépenses et appliquer des contrôles dans toute votre entreprise, et le Smart Routing ajoute une optimisation intelligente en associant automatiquement les tâches au bon modèle en fonction de leur complexité. Le Smart Routing fonctionne directement dans Claude Code et Codex, vous permettant d'optimiser les outils que les développeurs utilisent déjà.

Et nous allons au-delà du routage de modèles. Avec Omnigent, notre méta-harnais pour les agents de codage, les équipes peuvent exploiter toute la puissance du Smart Routing en optimisant à la fois les modèles et les harnais de codage, offrant aux développeurs la bonne combinaison pour la tâche sans qu'ils aient à la choisir eux-mêmes.

Les résultats parlent d'eux-mêmes : sur les charges de travail de codage internes, le Smart Routing a surpassé n'importe quel modèle unique pour seulement 65 % du coût par tâche d'un modèle de premier plan comme Opus 5. Sur les benchmarks publics, le Smart Routing a égalé les performances d'Opus 5 pour moins de la moitié du coût.

Voici ce que nous avons appris :

  1. L'essentiel des gains provient de l'utilisation de modèles moins chers pour les tâches plus simples. Nous constatons une grande diversité de tâches en interne, et la plupart d'entre elles n'ont pas besoin d'un modèle premium. Nous avons configuré le routeur pour sélectionner des modèles moins chers pour les tâches simples, mais pour « escalader » vers des modèles plus performants pour le travail complexe qui requiert les capacités d'un modèle de pointe.
  2. Nous avons obtenu de bons résultats en utilisant uniquement les informations disponibles au début de la tâche (description et métadonnées). Nous n'avons pas fourni la réponse, les tests, ni aucun élément concernant le dépôt, et le Smart Routing a tout de même été capable de faire un choix efficace.
  3. Il reste encore une marge de progression importante pour évaluer efficacement la complexité du travail et escalader si nécessaire. Un routeur doté d'une prévoyance parfaite surpasserait chaque modèle individuel pour une fraction de ce que le nôtre dépense, et dans les sessions réelles, il peut également être utile de réévaluer à mi-parcours si la tâche est devenue plus complexe. Combler cet écart est à la fois un problème de recherche et de conception de harnais. Nous devons apprendre des retours des utilisateurs réels pour nous améliorer.

Voyons en détail comment nous avons construit cela.

Comment fonctionne le routage intelligent de modèles ?

Le routage intelligent de modèles sélectionne le modèle le mieux adapté à une tâche en fonction de facteurs tels que la complexité, la capacité et le coût. Pour les agents de codage, une décision importante est de savoir quand ce routage doit avoir lieu.

Il existe généralement deux approches de routage :

  1. Routage par requête : Dans une session donnée, certaines équipes ont exploré le routage de chaque requête uniquement en fonction de la complexité du prompt de ce message. Le défi est qu'à grande échelle, les coûts sont dominés par le taux de réussite du cache. Pour obtenir un taux de réussite du cache élevé, il faut acheminer les étapes consécutives vers le même modèle (et, actuellement, vers le même niveau d'effort pour les modèles populaires).
  2. Routage basé sur la tâche : Au début de la session, vous commencez par évaluer la complexité de la tâche, puis vous suggérez un modèle et un harnais pour celle-ci, auxquels vous vous tenez pendant toute la durée de la session. Cela préserve le taux de réussite du cache et offre une opportunité d'optimisation future, comme la mise à niveau ou le déclassement selon les besoins lorsque le cache devient obsolète (par exemple, lors d'un événement de compaction).

Comment fonctionne notre Smart Router

Nous avons opté pour un routage basé sur la tâche afin de préserver l'efficacité du cache tout en associant chaque tâche de codage au modèle et au harnais appropriés. Le problème le plus intéressant consiste à évaluer la difficulté d'une tâche avant de la commencer. Nous voulions commencer simplement, c'est pourquoi notre routeur utilise actuellement une politique unique et l'applique de la même manière à chaque tâche.

Tout d'abord, nous classifions la tâche. Pour cela, nous utilisons un modèle moins cher et à faible latence qui lit la description de la tâche et l'étiquette avec quelques champs sémantiques : quelle partie du système change, quelles preuves de code le prompt contient (un extrait, un traceback ou rien d'explicite), comment il semble échouer, à quel point la correction semble localisée et à quel type de projet elle appartient. À partir de ces éléments, le routeur dérive une famille de types de tâches et une famille de langages. L'utilisation d'un modèle de pointe taxerait chaque requête (même les plus simples sur lesquelles nous voulons économiser), l'extracteur est donc volontairement petit et rapide.

Ensuite, nous triangulons pour déterminer quelle classe de modèle est la meilleure. Le routeur utilise par défaut un modèle de taille moyenne et utilise les étiquettes pour s'orienter dans un sens ou dans l'autre, en escaladant vers un modèle plus coûteux lorsque la tâche exige des capacités et des connaissances de pointe, ou en déléguant à un modèle moins cher lorsque ce n'est pas le cas. Cela signifie que la politique unique peut tirer parti de toute une suite de modèles.

Les premiers résultats sont prometteurs. Par rapport à notre propre benchmark interne, auquel aucun laboratoire n'a eu accès, nous avons constaté une économie de 35 %. Par rapport aux benchmarks de codage publics qui démontrent la généralisation de nos résultats, nous avons réalisé 56 % d'économies. Nous nous attendons à voir ces chiffres augmenter à mesure que nous en apprendrons davantage sur nos propres cas d'usage et avec nos partenaires de conception.

Comment router les tâches de codage entre les modèles et les harnais ?

Le Smart Routing gère la décision de routage, mais vous devez ensuite être en mesure d'agir en conséquence. Il fonctionne nativement dans Claude Code et Codex, mais pour les agents de codage, nous constatons de meilleures performances en choisissant non seulement le bon modèle, mais aussi le bon harnais de codage. Aider les ingénieurs à tirer parti du modèle et du harnais choisis nécessite une couche située au-dessus des sessions de codage individuelles pour les orchestrer. C'est pourquoi nous avons créé Omnigent.

Le Smart Routing est implémenté dans Omnigent à deux niveaux :

Tout d'abord, les développeurs utilisant Omnigent peuvent sélectionner le Smart Routing au lieu de choisir manuellement un harnais de codage spécifique. Omnigent sélectionne ensuite automatiquement le harnais et le modèle pour chaque tâche, le routage du modèle étant alimenté par le Smart Routing dans Unity AI Gateway. Cette conception donne aux développeurs et aux administrateurs la liberté de fournir des personnalisations, telles que des directives au niveau de l'organisation ou la possibilité d'utiliser l'historique des conversations précédentes, sans avoir à modifier le client à chaque fois.

Cela signifie également que tous les lancements de sous-agents passent par l'API Smart Routing, ce qui permet aux sous-agents de tirer parti d'un harnais et d'un modèle différents. Le prompt initial de l'utilisateur est souvent sous-spécifié et difficile à évaluer en termes de complexité. Les sous-agents vous permettent donc d'ajuster le nouveau travail en fonction de nouvelles informations, avec un cache frais et des instructions claires. Une seule tâche peut faire l'objet de décisions de routage nuancées entre la planification et le travail parallèle des sous-agents (par exemple, vous pouvez router les tâches de résumé de grandes bases de code vers des modèles moins chers tout en concevant l'architecture avec des modèles plus coûteux), ce qui entraîne des économies encore plus substantielles.

Comment évaluer si le routage de modèles fonctionne ?

Un routage de modèles efficace doit optimiser à la fois les coûts et la productivité des développeurs, et pas seulement les coûts. Il est essentiel de disposer de signaux de retour d'expérience, car les routeurs sont encore des technologies émergentes qui nécessiteront de nombreuses itérations. Notre première étape a consisté à enregistrer toutes les traces des sessions de codage pour une évaluation ultérieure. Nous voulons prendre en compte à la fois le coût et l'expérience des développeurs – nous ne voulons pas optimiser les coûts au détriment de la productivité.

Avec Unity AI Gateway, les traces des agents de codage peuvent être enregistrées dans Unity Catalog. Il s'agit de données extrêmement sensibles, qui doivent rester régies par des politiques d'accès et d'étiquetage sophistiquées dans la plupart des entreprises matures.

Nous avons utilisé à la fois des modèles AI et une évaluation humaine pour analyser les traces afin d'évaluer les modifications apportées au routeur. Lorsque nous avons effectué cette analyse sur nos propres sessions avant le routage, nous avons constaté qu'une grande partie des sessions dépensaient le budget d'un modèle de pointe pour un travail qui n'en avait pas besoin, simplement parce que le modèle par défaut était le plus cher. En pratique, pour valider l'utilité du routeur, il convient de suivre en continu les indicateurs suivants :

  • Répartition des sessions par modèle
  • Nombre de sessions réalisées de bout en bout par les modèles routés
  • Montant des économies réalisées grâce au routage

Les prochaines étapes du routage intelligent de modèles

Nous pensons qu'il s'agit d'un domaine qui présente d'immenses opportunités et nous prévoyons de continuer à y mener des recherches approfondies. C'est encore le début, nous avons donc beaucoup à apprendre.
Notre premier défi a été le manque de fiabilité des données de référence qui ne correspondent pas au comportement réel des utilisateurs. Les tâches de référence sont généralement très bien structurées, chacune se présentant comme un énoncé de travail autonome. Bien que les routeurs soient performants sur ce type de tâches, les sessions réelles sont souvent bien différentes.

  • Les prompts initiaux sont rarement précis, car ce qu'un développeur saisit en premier est plutôt un symptôme ou une intention approximative qu'une spécification, et notre routeur lit ce premier message et s'y engage.
  • Les sessions sont réutilisées, de sorte que la décision qui était bonne pour la première requête peut s'avérer mauvaise à la quatrième, sans que le routeur ne soit sollicité à nouveau.

Nous étudions donc de nouvelles pistes pour recueillir plus d'informations et tester de nouvelles techniques :

  1. Commencer là où la définition de la tâche ne coûte rien. Les revues de PR, les lancements de sous-agents, les migrations par lots et les tâches planifiées sont entièrement spécifiés dès le départ car une machine a rédigé l'énoncé de la tâche. Le routage fonctionne aujourd'hui sur cette catégorie sans changer les habitudes de quiconque, c'est pourquoi nous le déployons ici en premier.
  2. Router après quelques échanges, pas dès le premier. Pour le travail interactif, le prompt initial est le pire moment possible pour prendre une décision, et rien ne nous y oblige. Au lieu de cela, il peut être utile de laisser un modèle économique gérer l'échange initial et poser des questions de clarification, puis de router la tâche une fois qu'elle a pris forme. Il est préférable d'explorer avec un modèle rapide et de petite taille, ce qui devrait améliorer à la fois le coût et l'expérience.
  3. Raccourcir les sessions. Les sessions qui se concentrent sur une seule tâche se routent mieux et coûtent moins cher, et les outils peuvent y inciter en faisant de l'ouverture d'une nouvelle session le choix évident lorsque le sujet change.
  4. Rendre le changement de modèle économique. Tout ce qui précède nécessite que les changements de modèle en cours de session soient abordables. Aujourd'hui, alors que les coûts sont dominés par le taux de réussite du cache, un changement en milieu de session est intenable à grande échelle. La compaction de contexte est la transition naturelle, puisqu'un échec de cache s'y produit déjà (c'est ainsi que procède Devin Fusion de Cognition). À terme, nous voulons que la couche de routage tarifie explicitement les échecs de cache plutôt que d'intégrer cela dans notre façon d'utiliser le routeur.

Le routage est généralement présenté comme un moyen de dépenser moins. Bien que la plupart de nos gains proviennent de tarifs plus bas pour des tâches simples, le même mécanisme peut nous aider à décider quand dépenser plus pour obtenir un meilleur résultat. L'optimisation de la valeur fonctionne dans les deux sens : choisir le modèle économique lorsqu'il suffit, et ne pas hésiter à dépenser plus lorsque la valeur le justifie.

Les outils de codage incitent souvent les utilisateurs à consommer de plus en plus de tokens, mais ce que nous voulons réellement, c'est optimiser le rendement productif par dollar, et non les tokens. Choisir un modèle plus rapide et moins cher lorsqu'il suffit ne permet pas seulement d'économiser de l'argent. Cela permet également de gagner du temps et de préserver la capacité limitée des modèles de pointe pour les tâches qui en ont réellement besoin.

Essayez Smart Routing dès aujourd'hui

Smart Routing est désormais disponible en version bêta via Unity AI Gateway. Il oriente automatiquement les tâches de codage vers le bon modèle en fonction de leur complexité, aidant ainsi les équipes à atteindre des performances de pointe tout en réalisant plus de 30 % d'économies grâce à la sélection du meilleur modèle pour chaque tâche. Pour les équipes qui cherchent à réduire les coûts de codage liés à l'AI sans limiter le choix ou la productivité des développeurs, Smart Routing offre une alternative à la sélection manuelle des modèles ou aux limites de dépenses strictes. Et avec Omnigent, vous pouvez étendre le routage intelligent aux modèles et aux environnements de codage.

Pour commencer, consultez nos pages de documentation :

Pour en savoir plus sur Unity AI Gateway, visitez notre site web.

(Cet article de blog a été traduit à l'aide d'outils basés sur l'intelligence artificielle) Article original

Recevez les derniers articles dans votre boîte mail

Abonnez-vous à notre blog et recevez les derniers articles directement dans votre boîte mail.