Un guide sur les personnes, les processus et les technologies nécessaires pour déployer des agents d'AI gouvernés et fiables à l'échelle de l'entreprise
par Pavithra Rao, Jeanne Choo, Kyra Wulffert et Alex Baur
AgentOps est la discipline opérationnelle pour la création, le déploiement et l'amélioration des agents AI en production. Elle rassemble l'architecture, l'évaluation, l'observabilité, la gouvernance, la sécurité et la gestion des coûts au sein d'un processus reproductible par les équipes.
Un agent AI est bien plus qu'un modèle qui génère une réponse. Les agents peuvent choisir des outils lors de l'exécution, récupérer des données d'entreprise, appeler des API et accomplir une tâche en plusieurs étapes de manière autonome. Chacune de ces capacités présente un risque de dysfonctionnement, comme un mauvais appel d'outil, une autorisation trop large ou une hausse imprévue des coûts.
L'AgentOps existe pour éviter que cette complexité ne devienne un handicap. Bien menée, elle rend le système suffisamment fiable pour inspirer la confiance, et assez simple pour qu'une équipe puisse réellement le gérer.
L'AI générative est passée de l'expérimentation à l'entreprise plus rapidement que la plupart des autres vagues technologiques. Le prochain défi consiste à transformer des projets pilotes prometteurs en systèmes fiables sur lesquels on peut compter.
La plupart des équipes butent sur les mêmes questions opérationnelles :
Répondre à ces questions nécessite plus qu'un modèle plus performant. Il faut un modèle opérationnel pour l'agent lui-même.
C'est un terrain connu. MLOps a mûri à mesure que les équipes ont sorti les modèles de machine learning des notebooks pour les mettre en production. LLMOps a suivi, en ajoutant des pratiques pour le versioning des prompts et des modèles, le service distribué et le contrôle des coûts. AgentOps constitue l'étape suivante et étend cette discipline aux systèmes qui raisonnent, utilisent des outils et agissent de manière autonome.
Un agent en production a besoin de limites claires sur ce que ses outils peuvent toucher, d'un historique traçable de l'exécution en plusieurs étapes, d'un moyen de mesurer la qualité, d'un plan en cas de défaillance, et d'un alignement suffisant entre l'ingénierie, le produit, la sécurité, la conformité et la finance pour que personne ne soit surpris lors de son déploiement.
L'expérience client le confirme. L'agent de connaissances text-to-code de FactSet est passé d'un simple modèle de fondation à un système d'agent complet, offrant une amélioration de 44 % de la précision. Lire l'histoire de FactSet.
Le Big Book of AgentOps codifies les pratiques qui aident les équipes d'entreprise à effectuer cette transition : modèles d'architecture, pipeline de livraison par étapes, boucles d'évaluation et de feedback, gouvernance, gestion des coûts et décisions des parties prenantes qui déterminent si un agent atteint réellement la production.
L'ouvrage passe des concepts à la mise en œuvre à travers six chapitres.
Les agents ne se résument pas à un simple appel LLM de type prompt-réponse.
La journalisation, les étapes d'évaluation, la gouvernance, le rollback et la surveillance sont tous importants, mais les exigences varient selon quatre architectures d'agents. Nous présentons chaque architecture et ses exigences opérationnelles correspondantes pour s'y référer facilement.
Tout aussi importants sont les anti-patterns qui empêchent le déploiement des projets pilotes : commencer par un cas d'usage trop large, recourir à l'orchestration multi-agents avant que la complexité ne soit justifiée, avoir une boucle de raisonnement inutile et repousser l'évaluation à plus tard. Nous partageons une liste des erreurs les plus courantes que nous avons observées afin d'éviter de reproduire les mêmes fautes.
Les architectures de déploiement vont du simple au complexe selon le cas d'usage et les besoins de l'entreprise. Nous couvrons quatre modèles de déploiement, allant du déploiement depuis un espace de travail Databricks unique à la configuration la plus complexe : une topologie d'entreprise multi-comptes et multi-agents. Chaque modèle est accompagné de conseils pour choisir et évoluer d'un modèle à l'autre au fur et à mesure que vos besoins changent. À chaque étape, Unity Catalog, Unity Gateway et MLflow restent au cœur du support de l'architecture.
Une feuille de route en sept phases, allant de la formation d'une équipe et de la sélection d'un cas d'usage à la mise en place de l'infrastructure de données, des boucles d'évaluation et des meilleures pratiques de gouvernance.
Nous mettons en évidence les points importants à noter pour chaque phase. Par exemple, le coût est un aspect essentiel du cycle de vie. Une seule requête utilisateur peut déclencher plusieurs appels de modèles lorsque l'on prend en compte les sous-agents, les tentatives et les vérifications de garde-fous. Il est donc crucial d'attribuer l'utilisation, de fixer des limites et d'établir une responsabilité claire pour les dépenses.
Les équipes doivent itérer rapidement pour développer un agent de haute qualité. Elles doivent également faire évoluer l'agent en fonction des avancées de la recherche et des besoins changeants de leur organisation. Pour y répondre, nous montrons comment les principes de flux, de feedback et d'apprentissage continu, tirés de The DevOps Handbook, fournissent une base utile pour exploiter les systèmes d'agents AI.
Appliquer ces principes aux systèmes d'agents consiste à créer un ensemble de données d'évaluation de référence (« golden dataset ») à partir de traces réelles, à calibrer les juges automatisés par rapport aux retours des experts métier (SME) et à utiliser les résultats d'évaluation pour orienter les prochains développements. Un exemple concret d'agent de messagerie client montre comment l'examen humain, les juges basés sur des modèles et les vérifications basées sur des règles collaborent sans transformer chaque version en un audit manuel.
Une séquence de planification en six étapes aide les équipes à concentrer leurs efforts là où cela fait réellement la différence : cartographier le workflow humain, le traduire en une architecture technique, définir les besoins d'observabilité par persona, intégrer le traçage dans le système, associer les contrôles d'accès aux données et aux outils, et identifier ce qui peut être réutilisé.
Un agent de support client dans les télécommunications met cette séquence en pratique, jusqu'aux schémas de données, aux outils disponibles pour un sous-agent de facturation et aux contrôles précis qui empêchent un client de voir les données d'un autre.
Une bonne ingénierie ne garantit pas qu'un agent atteigne la production. De nombreux projets techniquement solides s'embourbent plutôt dans des problèmes humains.
La mise en production dépend de l'alignement des parties prenantes au sein de l'organisation, des sponsors exécutifs et des chefs de produit aux SME, à la sécurité, à la conformité et à la finance. Cette section fournit une matrice RACI pratique qui clarifie la responsabilité des décisions qui bloquent le plus souvent, ainsi que des rythmes de communication suggérés pour les phases de projet pré et post-lancement. Ces processus d'équipe permettent à des boucles de feedback serrées avec les SME de garantir le bon déroulement de la surveillance opérationnelle et des examens post-lancement, et de s'assurer que les projets apportent de la valeur à long terme.
Choisissez un cas d'usage bien défini avec des indicateurs de réussite clairs avant de vous lancer dans l'orchestration. Présentez rapidement un prototype fonctionnel aux parties prenantes. Laissez ce que vous apprenez, et non une feuille de route préétablie, décider de la suite des développements.
DXC Technology a suivi cette voie tout en élargissant son portefeuille d'AI. L'entreprise exploite désormais trois agents AI en production, en a huit autres en phase pilote ou de développement, et a réduit de 30 % le coût total de possession de la plateforme après sa migration vers Databricks. Lire l'histoire de DXC Technology.
L'évaluation est ce qui permet à une équipe de déployer un agent en toute confiance, puis de continuer à le mettre à jour en toute sécurité. Commencez par faire examiner des traces réelles par des SME, plutôt qu'une poignée de prompts de chat triés sur le volet. Ce jugement humain permet de faire émerger les modes de défaillance, de constituer un ensemble d'évaluation représentatif et de calibrer les juges automatisés qui prendront ensuite le relais pour les vérifications de routine.
Databricks intègre cela directement dans la plateforme : évaluation des agents, juges assistés par AI et analyse basée sur les traces qui permettent aux équipes d'identifier les problèmes en production, d'en rechercher les causes profondes et de tester un correctif avant de le redéployer.
Intercontinental Exchange (ICE) a mis cela en œuvre dans une application text-to-SQL gouvernée qui répond à des questions métier à l'aide de données financières, atteignant une précision syntaxique de 77 % et une correspondance d'exécution de 96 % sur environ 50 requêtes.
Les contrôles qui résident au sein d'applications individuelles deviennent plus difficiles à auditer à mesure que le nombre d'agents augmente. Une approche de plateforme offre aux équipes un espace unique pour gérer l'accès aux données, l'utilisation des modèles et des outils, le traçage, l'évaluation et l'application des politiques, plutôt que de réinventer la gouvernance pour chaque nouvel agent.
Sur Databricks, ce socle repose sur MLflow pour l'évaluation et le traçage, Unity Gateway pour le trafic des modèles et des outils, et Unity Catalog pour la découverte gouvernée, les autorisations, le lignage et le contrôle d'accès à travers les actifs de données et d'AI.
Block est un bon exemple de ce qu'une base gouvernée peut vous apporter. Son environnement Databricks prend en charge à la fois les cas d'usage AI et opérationnels, avec Unity Catalog qui gère l'accès aux données entre les différentes entités de l'entreprise. Databricks fait état de 10 millions de dollars de gains de productivité grâce au système d'agents AI de Block pour les opérations des vendeurs.
The Big Book of AgentOps s'adresse à toute personne chargée de mettre un agent AI en production ou de l'y maintenir une fois opérationnel :
Quiconque a des utilisateurs qui dépendent du comportement de l'agent devrait l'avoir sous la main.
Lisez l'eBook complet pour aller plus loin et découvrir les fonctionnalités de la plateforme qui soutiennent les agents AI en production :
Il s'agit de l'ensemble des pratiques permettant de concevoir, d'évaluer, de déployer, de gouverner, d'observer et d'améliorer les agents AI une fois qu'ils sont opérationnels, ainsi que de la discipline opérationnelle qui permet à un système de raisonner, d'utiliser des outils et d'agir de manière fiable.
Parce qu'il peut se passer énormément de choses entre la réception d'une requête et l'envoi d'une réponse : appels d'outils, récupération d'informations, vérifications d'autorisations, tentatives de reconnexion et orchestration. Chacune de ces étapes influe sur la qualité, le risque, la latence ou le coût, et aucune d'entre elles n'est visible si vous vous contentez de surveiller le résultat final du modèle.
Le panorama des agents et les anti-patterns, les architectures de déploiement, un pipeline de projet en sept phases, les boucles d'évaluation et de rétroaction, les pratiques DevOps adaptées aux systèmes non déterministes, les activités de planification à fort impact et la gestion des parties prenantes.
Choisissez un cas d'usage précis avec des critères de réussite mesurables. Créez un ensemble d'évaluation à partir d'exemples réels, suivez les actions réelles de l'agent, appliquez une gouvernance de moindre privilège et établissez un rythme de fonctionnement avant de vous lancer dans une orchestration plus complexe.
(Cet article de blog a été traduit à l'aide d'outils basés sur l'intelligence artificielle) Article original
Abonnez-vous à notre blog et recevez les derniers articles directement dans votre boîte mail.