Passa al contenuto principale
Sanità e bioscienze

Come Concurrence governa l'AI clinica su una scala di trilioni di token con Unity Gateway

Con l'uso dell'AI cresciuto di 5 volte in meno di un anno, Concurrence sta creando una base unificata di dati e AI su Databricks e utilizza Unity Gateway per governare miliardi di token di agenti di codifica

di Ali Khokhar, John Xing, Tony Shi e Kelly Albano

L'AI per il settore sanitario ha un margine di errore minimo. Gli agenti AI che aiutano a coordinare l'assistenza ai pazienti dipendono da un contesto affidabile del paziente, da controlli chiari sull'accesso ai dati e ai modelli e dalla visibilità su ogni interazione, il tutto mantenendo rigorosi requisiti di conformità. 

Concurrence gestisce questi sistemi agentici per il settore sanitario su scala significativa. L'azienda sviluppa agenti AI clinici per flussi di lavoro rivolti a pazienti e operatori sanitari, da medici, infermieri e coordinatori dell'assistenza AI fino alla documentazione ambientale, ai riepiloghi dei piani di cura e al recupero delle informazioni.

Nel suo ambiente AI di produzione, Concurrence elabora ora circa 100,8 miliardi di token di input e 11,2 milioni di chiamate LLM ogni 30 giorni, equivalenti a un tasso di esecuzione annualizzato di circa 1,2 bilioni di token di input. Il volume mensile di token è cresciuto di circa 5 volte rispetto al valore di riferimento di fine 2025 a luglio 2026.

Nei flussi di lavoro clinici ad alto rischio, gli agenti AI affidabili partono da dati attendibili e ben governati. Supportare tale affidabilità su scala richiede una forte conformità, test rigorosi sugli agenti e un accesso controllato all'AI. Concurrence sta consolidando queste funzionalità su Databricks, con Lakebase per l'agente operativo e lo stato della conversazione, Unity Catalog per la governance dei dati e degli asset AI, e Unity Gateway per l'accesso centralizzato all'AI e la sicurezza nei suoi carichi di lavoro AI per sviluppatori in rapida crescita.

Creare un'AI clinica affidabile su dati sicuri

I dati sanitari sono spesso in conflitto tra i diversi sistemi. Un paziente può fornire informazioni diverse da quelle presenti in un record esistente e il valore più recente non è sempre il più affidabile.

Concurrence affronta questo problema registrando le nuove informazioni come eventi immutabili anziché sovrascrivere i record esistenti. Da questa cronologia, Concurrence calcola lo stato attuale del paziente preservando l'origine e la provenienza di ogni informazione, che definisce il suo world model. Ciò offre agli agenti una visione coerente e la cronologia di ciò che si sa su un paziente, consentendo al contempo che ciò che apprendono da pazienti e medici ritorni nello stato per i flussi di lavoro futuri.

Databricks fornisce la base di dati condivisa per questa architettura. Gli eventi fluiscono tramite Zerobus Ingest in tabelle Delta governate, inclusi 2,7 milioni di eventi del world model al mese e 90.000 al giorno nei picchi. Apache Spark™ Declarative Pipelines derivano il world model e i dati clinici di Concurrence; Unity Catalog governa l'ambiente di ciascun cliente; e Lakebase fornisce lo stato del paziente, lo stato dell'agente e della conversazione e i dati della knowledge base necessari per le applicazioni operative.

Le attività di sensibilizzazione sui gap assistenziali e sull'aderenza terapeutica sono un esempio. Gli agenti di Concurrence possono chiamare o inviare messaggi ai pazienti che sono in ritardo con le visite di controllo o che stanno interrompendo una terapia farmacologica, utilizzare il contesto esistente del paziente per guidare la conversazione e registrare ciò che apprendono nello stato del paziente per i flussi di lavoro futuri. Concurrence esegue anche applicazioni di produzione su Databricks Apps, tra cui una guida ai pacchetti di cura, un riepilogo del piano di cura infermieristico e un'interfaccia di revisione dei contenuti clinici. Ognuna si basa sullo stesso contesto del paziente e sulla stessa infrastruttura governata. Il passaggio a questa architettura ha inoltre consentito a Concurrence di ritirare il proprio archivio di log dei prompt sviluppato internamente e i job di reverse-ETL a favore di tabelle Delta governate e Lakebase Synced Tables.


Testare gli agenti AI clinici prima della produzione

Ogni agente sulla nuova piattaforma di Concurrence viene testato su pazienti simulati prima di raggiungere un paziente reale. Oggi, il traffico di simulazione e valutazione è circa sette volte superiore al traffico di produzione sulla nuova piattaforma.

L'architettura dei dati di Concurrence rende possibili questi test. Poiché lo stato del paziente viene calcolato a partire da una cronologia di eventi immutabile, i team possono riprodurre tale stato e testare percorsi diversi senza modificare la cartella clinica reale del paziente. Ciò consente a Concurrence di valutare come un agente risponde a diversi scenari prima di distribuirlo ai pazienti.

Le tracce degli agenti fluiscono tramite Zerobus Ingest e arrivano nelle tabelle Delta insieme ai dati clinici che le hanno prodotte. I job pianificati di ai_query che utilizzano Claude ospitato su Databricks valutano quindi tali interazioni in termini di qualità e sicurezza della conversazione, estraggono la memoria e riscrivono i risultati in Delta. Con dati dei pazienti, tracce, risultati e valutazioni sulla stessa base governata, i team possono verificare se i cambiamenti nelle prestazioni derivino dal modello, dai dati o dal flusso di lavoro.

Applicare la governance e la conformità dell'AI nel settore sanitario

Per Concurrence, i requisiti HIPAA modellano l'architettura fin dall'inizio. Concurrence è oggi conforme a HIPAA, GDPR e SOC 2, con HITRUST e ISO 27001/42001 in corso di definizione. Ogni organizzazione sanitaria riceve il proprio schema e service principal, con controlli di accesso, lineage e audit trail governati tramite Unity Catalog.

Per i carichi di lavoro AI in batch, Concurrence esegue job ai_query su Claude ospitato su Databricks nell'ambito di un BAA. Il suo risolutore di endpoint consente solo modelli all'interno dello spazio dei nomi coperto da BAA, impedendo che le PHI vengano indirizzate a un modello non coperto. Lo stesso percorso coperto esegue la classificazione di sicurezza di Concurrence per autolesionismo, ideazione suicidaria ed emergenze mediche. Alcuni dei suoi carichi di lavoro AI a più alto rischio sono quindi protetti dallo stesso vincolo architetturale. Questo modella anche l'approccio di Concurrence al routing dei modelli: il routing è vincolato alla conformità prima ancora che al costo. I modelli devono prima soddisfare i requisiti di conformità di un carico di lavoro prima che Concurrence prenda in considerazione qualità, prestazioni o costi.

L'inferenza in tempo reale per pazienti e medici rimane oggi sull'infrastruttura del provider esistente di Concurrence. Concurrence ha già sviluppato e configurato tramite feature flag la sua integrazione con Unity Gateway per l'inferenza in tempo reale, con un canary sintetico che la testa continuamente end-to-end. Il traffico di produzione potrà passare a Unity Gateway non appena sarà disponibile la copertura di conformità richiesta.

Governare gli agenti di codifica con Unity Gateway

Concurrence applica lo stesso approccio all'AI per gli sviluppatori. Gli agenti di codifica sono utilizzati in tutta l'ingegneria, le operazioni e la ricerca, anche da ingegneri sul campo che lavorano all'interno di ambienti dei clienti che gestiscono dati sanitari sensibili.

Concurrence reindirizza tutto il traffico dei modelli e degli strumenti degli agenti di codifica attraverso la CLI di codifica di Unity Gateway, ug. Gli sviluppatori ottengono un unico percorso governato verso i modelli approvati e gli strumenti MCP, mentre ogni richiesta rimane associata all'identità della persona che l'ha effettuata. L'accesso MCP è gestito centralmente attraverso lo stesso ambiente, con autorizzazioni assegnate per gruppo di ingegneri e ogni utente che si autentica individualmente quando gli agenti accedono a strumenti come Databricks, Datadog e Linear.

La scala è già notevole. A luglio, 14 singoli utenti hanno generato 35,85 miliardi di token di input tramite Unity Gateway, di cui il 95,37% erano letture da cache. Da quando ug è stato introdotto il 10 luglio, gli agenti di codifica di Concurrence hanno generato circa 360.000 richieste e 61 miliardi di token di input cumulativi.

La centralizzazione del traffico degli agenti di codifica offre a Concurrence visibilità su come viene utilizzata l'AI per gli sviluppatori e su quanto costa. Ogni richiesta è attribuita all'ingegnere che l'ha effettuata, consentendo ai singoli di monitorare il proprio utilizzo tramite ug usage. A livello di organizzazione, Concurrence utilizza i dati di utilizzo di Databricks provenienti da system.ai_gateway.usage per tracciare i modelli in uso, il consumo di token, i tassi di cache e la spesa per persona e team.

Centralizzare l'accesso all'AI con Unity Gateway

L'obiettivo di Concurrence è portare l'AI di produzione, in batch e per sviluppatori sotto un punto di controllo dell'inferenza comune con Unity Gateway. L'AI per gli sviluppatori viene già eseguita tramite Unity Gateway, mentre l'inferenza in batch viene eseguita su modelli ospitati su Databricks tramite percorsi coperti da BAA. Oggi, Claude Opus 4.8 e GPT-5.6 Sol rappresentano la maggior parte dell'utilizzo dei modelli degli agenti di codifica, con un aumento dell'uso di Opus 5. L'inferenza in tempo reale per pazienti e medici rimane sull'infrastruttura del provider esistente di Concurrence fino a quando non sarà disponibile la copertura di conformità richiesta.

Questo approccio multi-modello è particolarmente importante per i carichi di lavoro clinici di Concurrence. L'azienda ha attualmente 14 modelli che gestiscono l'inferenza in produzione e un catalogo governato di 46 modelli. La maggior parte del volume di produzione viene eseguita su modelli più piccoli e veloci, mentre i modelli di frontiera sono riservati a ragionamenti più complessi. Concurrence sta sviluppando benchmark di ragionamento clinico per determinare quali modelli offrano le prestazioni migliori nei diversi compiti sanitari.

Concurrence è inoltre entusiasta del ritmo di innovazione di Unity Gateway. Più di recente, ha iniziato a testare Unity Gateway Smart Routing rispetto agli approcci di routing specifici per il settore sanitario che sta sviluppando, pubblicandone i risultati. Poiché l'idoneità dei modelli in ambito sanitario inizia con la conformità, tali valutazioni analizzeranno come il routing intelligente possa ottimizzare la scelta del modello entro i limiti stabiliti per ciascun carico di lavoro. Dal lato sviluppatori, Concurrence sta esplorando anche Omnigent come meta-harness all'interno del suo ambiente di agenti di codifica.

Una base unificata per l'AI nel settore sanitario

Man mano che Concurrence sposta un numero maggiore di flussi di lavoro su Databricks, questa base acquisisce valore a ogni interazione degli agenti. Il lavoro di ciascun agente può arricchire lo stato del paziente da cui parte l'agente successivo, consentendo ai nuovi flussi di lavoro di riutilizzare il contesto esistente anziché ricostruirlo, riducendo così il costo incrementale e lo sforzo necessario per aggiungere nuovi flussi di lavoro AI.

Con un tasso annualizzato di circa 1,2 mila miliardi di token di input in produzione, questa base cumulativa fa la differenza. Riunendo il contesto del paziente, lo stato operativo, le tracce, le valutazioni, la governance e l'accesso all'AI su Databricks, Concurrence può scalare l'AI clinica di importanza critica mantenendo al contempo l'affidabilità e i controlli richiesti dal settore sanitario.

(Questo post sul blog è stato tradotto utilizzando strumenti basati sull'intelligenza artificiale) Post originale

Ricevi gli ultimi articoli nella tua casella di posta

Iscriviti al nostro blog e ricevi gli ultimi articoli direttamente nella tua casella di posta.