Revenir au contenu principal

Comment Concurrence gouverne l'IA clinique à l'échelle d'un billion de jetons avec Unity Gateway

Avec l'utilisation de l'IA multipliée par 5 en moins d'un an, Concurrence construit une fondation unifiée de données et d'IA sur Databricks et utilise Unity Gateway pour gouverner des milliards de jetons d'agents de codage.

par Ali Khokhar, John Xing, Tony Shi et Kelly Albano

L'IA dans le domaine de la santé a une faible marge d'erreur. Les agents d'IA qui aident à coordonner les soins aux patients dépendent d'un contexte patient fiable, de contrôles clairs sur l'accès aux données et aux modèles, et d'une visibilité sur chaque interaction, tout en respectant des exigences de conformité strictes. 

Concurrence opère ces systèmes d'agents d'IA pour la santé à une échelle significative. L'entreprise développe des agents d'IA cliniques pour les flux de travail orientés patient et fournisseur, allant des cliniciens, infirmières et coordinateurs de soins IA à la documentation ambiante, aux résumés de plans de soins et à la récupération de connaissances.

Dans son environnement d'IA de production, Concurrence traite désormais environ 100,8 milliards de tokens d'entrée et 11,2 millions d'appels LLM tous les 30 jours, ce qui équivaut à un taux d'exécution annualisé d'environ 1,2 billion de tokens d'entrée. Le volume mensuel de tokens a été multiplié par environ 5 entre sa base de référence de fin 2025 et juillet 2026.

Dans les flux de travail cliniques à enjeux élevés, des agents d'IA fiables commencent par des données fiables et bien gouvernées. Soutenir cette fiabilité à l'échelle nécessite une conformité solide, des tests rigoureux des agents et un accès à l'IA gouverné. Concurrence consolide ces capacités sur Databricks, avec Lakebase pour l'état opérationnel des agents et des conversations, Unity Catalog pour la gouvernance des données et des actifs d'IA, et Unity Gateway pour l'accès centralisé à l'IA et la sécurité sur ses charges de travail d'IA pour développeurs en croissance rapide.

Construire une IA clinique fiable sur des données de confiance

Les données de santé sont souvent en conflit entre les systèmes. Un patient peut fournir des informations différentes d'un dossier existant, et la valeur la plus récente n'est pas toujours la plus fiable.

Concurrence résout ce problème en enregistrant les nouvelles informations comme des événements immuables plutôt qu'en écrasant les enregistrements existants. À partir de cet historique, Concurrence calcule l'état actuel du patient tout en préservant la source et la provenance de chaque information, ce qu'elle appelle son modèle du monde. Cela donne aux agents une vue et un historique cohérents de ce qui est connu sur un patient, tout en permettant à ce qu'ils apprennent des patients et des cliniciens de réalimenter l'état pour les futurs flux de travail.

Databricks fournit la base de données partagée pour cette architecture. Les événements transitent via Zerobus Ingest vers des tables Delta gouvernées, incluant 2,7 millions d'événements de modèle du monde par mois et 90 000 par jour en période de pointe. Apache Spark™ Declarative Pipelines dérivent le modèle du monde et les données cliniques de Concurrence ; Unity Catalog gouverne chaque environnement client ; et Lakebase sert l'état du patient, l'état de l'agent et de la conversation, ainsi que les données de la base de connaissances nécessaires aux applications opérationnelles.

Le suivi des lacunes de soins et de l'observance médicamenteuse en est un exemple. Les agents de Concurrence peuvent appeler ou envoyer des messages aux patients en retard pour un suivi ou qui ne prennent plus un médicament, utiliser le contexte patient existant pour guider la conversation et enregistrer ce qu'ils apprennent dans l'état du patient pour les futurs flux de travail. Concurrence exécute également des applications de production sur Databricks Apps, y compris un guide de dossier de soins, un résumé de plan de soins infirmier et une interface de révision de contenu clinique. Chacune s'appuie sur le même contexte patient et la même infrastructure gouvernés. Le passage à cette architecture a également permis à Concurrence de retirer son magasin de journaux de prompts et ses tâches d'ETL inversé au profit de tables Delta gouvernées et de Lakebase Synced Tables.


Tester les agents d'IA cliniques avant la production

Chaque agent sur la nouvelle plateforme de Concurrence est testé sur des patients simulés avant d'atteindre un patient réel. Aujourd'hui, le trafic de simulation et d'évaluation est environ sept fois supérieur au trafic de production sur la nouvelle plateforme.

L'architecture de données de Concurrence rend ces tests possibles. Étant donné que l'état du patient est calculé à partir d'un historique d'événements immuables, les équipes peuvent rejouer cet état et tester différents chemins sans modifier le dossier patient réel. Cela permet à Concurrence d'évaluer comment un agent répond à différents scénarios avant de le déployer auprès des patients.

Les traces d'agents transitent via Zerobus Ingest et atterrissent dans des tables Delta aux côtés des données cliniques qui les ont produites. Des tâches ai_query planifiées utilisant Claude hébergé par Databricks, évaluent ensuite ces interactions pour la qualité et la sécurité de la conversation, extraient la mémoire et réécrivent les résultats dans Delta. Avec les données patient, les traces, les résultats et les évaluations sur la même base gouvernée, les équipes peuvent déterminer si les changements de performance proviennent du modèle, des données ou du flux de travail.

Appliquer la gouvernance et la conformité de l'IA dans le domaine de la santé

Pour Concurrence, les exigences HIPAA façonnent l'architecture dès le départ. Concurrence est aujourd'hui conforme HIPAA, GDPR et SOC 2, avec HITRUST et ISO 27001/42001 en cours. Chaque organisation de soins de santé obtient son propre schéma et principal de service, avec des contrôles d'accès, une lignée et des pistes d'audit gouvernés via Unity Catalog.

Pour les charges de travail d'IA par lots, Concurrence exécute des tâches ai_query sur Claude hébergé par Databricks dans le cadre d'un BAA. Son résolveur de points de terminaison n'autorise que les modèles au sein de l'espace de noms couvert par le BAA, empêchant ainsi le routage des PHI vers un modèle non couvert. Le même chemin couvert exécute la classification de sécurité de Concurrence pour l'automutilation, l'idéation suicidaire et les urgences médicales. Certaines de ses charges de travail d'IA les plus critiques sont donc protégées par la même contrainte architecturale. Cela façonne également l'approche de Concurrence en matière de routage de modèles : le routage est soumis à des exigences de conformité avant d'être soumis à des considérations de coût. Les modèles doivent d'abord satisfaire aux exigences de conformité d'une charge de travail avant que Concurrence n'envisage la qualité, les performances ou le coût.

L'inférence en temps réel pour les patients et les cliniciens reste aujourd'hui sur l'infrastructure fournisseur existante de Concurrence. Concurrence a déjà construit et activé par feature flag son intégration Unity Gateway pour l'inférence en temps réel, avec un canari synthétique la testant en continu de bout en bout. Le trafic de production pourra être déplacé vers Unity Gateway dès que la couverture de conformité requise sera disponible.

Gouverner les agents de codage avec Unity Gateway

Concurrence applique la même approche à l'IA pour développeurs. Les agents de codage sont utilisés dans l'ingénierie, les opérations et la recherche, y compris par des ingénieurs déployés chez les clients travaillant dans des environnements qui traitent des données de santé sensibles.

Concurrence achemine tout le trafic des modèles et outils des agents de codage via l'interface de ligne de commande de codage de Unity Gateway, ug. Les développeurs obtiennent un chemin gouverné unique vers les modèles approuvés et les outils MCP, tandis que chaque requête reste associée à l'identité de la personne qui l'a effectuée. L'accès MCP est géré de manière centralisée via le même environnement, avec des autorisations attribuées par groupe d'ingénieurs et chaque utilisateur s'authentifiant individuellement lorsque les agents accèdent à des outils tels que Databricks, Datadog et Linear.

L'échelle est déjà substantielle. En juillet, 14 utilisateurs individuels ont généré 35,85 milliards de tokens d'entrée via Unity Gateway, dont 95,37 % étaient des lectures de cache. Depuis le déploiement de ug le 10 juillet, les agents de codage de Concurrence ont généré environ 360 000 requêtes et 61 milliards de tokens d'entrée cumulés.

La centralisation du trafic des agents de codage donne à Concurrence une visibilité sur la façon dont l'IA pour développeurs est utilisée et sur son coût. Chaque requête est attribuée à l'ingénieur qui l'a effectuée, permettant aux individus de surveiller leur propre utilisation via ug usage. Au niveau de l'organisation, Concurrence utilise les données d'utilisation de Databricks provenant de system.ai_gateway.usage pour suivre les modèles utilisés, la consommation de tokens, les taux de cache et les dépenses par personne et par équipe.

Centraliser l'accès à l'IA avec Unity Gateway

L'objectif de Concurrence est de regrouper l'IA de production, par lots et pour développeurs sous un point de contrôle d'inférence commun avec Unity Gateway. L'IA pour développeurs fonctionne déjà via Unity Gateway, tandis que l'inférence par lots s'exécute sur des modèles hébergés par Databricks via des chemins couverts par un BAA. Aujourd'hui, Claude Opus 4.8 et GPT-5.6 Sol représentent la majeure partie de l'utilisation des modèles d'agents de codage, l'utilisation d'Opus 5 étant en croissance. L'inférence en temps réel pour les patients et les cliniciens reste sur l'infrastructure fournisseur existante de Concurrence jusqu'à ce que la couverture de conformité requise soit disponible.

Cette approche multi-modèle est particulièrement importante pour les charges de travail cliniques de Concurrence. L'entreprise dispose actuellement de 14 modèles pour l'inférence en production et d'un catalogue gouverné de 46 modèles. La majeure partie du volume de production s'exécute sur des modèles plus petits et plus rapides, les modèles de pointe étant réservés aux raisonnements plus complexes. Concurrence développe des benchmarks de raisonnement clinique pour déterminer quels modèles sont les plus performants pour différentes tâches de santé.

Concurrence est également enthousiasmé par le rythme d'innovation d'Unity Gateway. Plus récemment, ils ont commencé à tester Unity Gateway Smart Routing par rapport aux approches de routage spécifiques au secteur de la santé qu'il développe et publie les résultats. Étant donné que l'éligibilité des modèles dans le secteur de la santé commence par la conformité, ces évaluations détermineront comment le routage intelligent peut optimiser le choix des modèles dans les limites établies pour chaque charge de travail. Du côté des développeurs, Concurrence explore également Omnigent comme méta-harnais dans son environnement d'agents de codage.

Une fondation unifiée pour l'IA dans le secteur de la santé

À mesure que Concurrence déplace davantage de workflows sur Databricks, la fondation devient plus précieuse à chaque interaction d'agent. Le travail de chaque agent peut enrichir l'état du patient à partir duquel l'agent suivant commence, permettant aux nouveaux workflows de réutiliser le contexte existant plutôt que de le reconstruire, réduisant ainsi le coût et l'effort supplémentaires liés à l'ajout de nouveaux workflows d'IA.

Avec un taux annualisé d'environ 1,2 billion de tokens d'entrée en production, cette fondation cumulative est importante. En regroupant le contexte patient, l'état opérationnel, les traces, les évaluations, la gouvernance et l'accès à l'IA sur Databricks, Concurrence peut faire évoluer l'IA clinique à enjeux élevés tout en maintenant la fiabilité et les contrôles exigés par le secteur de la santé.

(Cet article de blog a été traduit à l'aide d'outils basés sur l'intelligence artificielle) Article original

Recevez les derniers articles dans votre boîte mail

Abonnez-vous à notre blog et recevez les derniers articles directement dans votre boîte mail.