Ir al contenido principal
Salud y ciencias biológicas

¿Cómo Concurrence gobierna la IA clínica a escala de un billón de tokens con Unity Gateway?

Con el uso de la IA creciendo 5 veces en menos de un año, Concurrence está construyendo una base unificada de datos e IA en Databricks y está utilizando Unity Gateway para gobernar miles de millones de tokens de agentes de codificación.

por Ali Khokhar, John Xing, Tony Shi y Kelly Albano

La IA en el sector de la salud tiene poco margen de error. Los agentes de IA que ayudan a coordinar la atención al paciente dependen de un contexto de paciente fiable, controles claros sobre el acceso a datos y modelos, y visibilidad de cada interacción, todo ello manteniendo estrictos requisitos de cumplimiento. 

Concurrence está operando estos sistemas agénticos de atención médica a una escala significativa. La empresa desarrolla agentes de IA clínicos para flujos de trabajo orientados al paciente y al proveedor, desde médicos, enfermeras y coordinadores de atención de IA hasta documentación ambiental, resúmenes de planes de atención y recuperación de conocimiento.

En su entorno de IA de producción, Concurrence procesa ahora aproximadamente 100.800 millones de tokens de entrada y 11.2 millones de llamadas a LLM cada 30 días, lo que equivale a una tasa de ejecución anualizada de aproximadamente 1.2 billones de tokens de entrada. El volumen mensual de tokens ha crecido aproximadamente 5 veces desde su línea base de finales de 2025 hasta julio de 2026.

En flujos de trabajo clínicos de alto riesgo, los agentes de IA fiables comienzan con datos confiables y bien gobernados. Apoyar esa fiabilidad a escala requiere un cumplimiento sólido, pruebas rigurosas de agentes y acceso gobernado a la IA. Concurrence está consolidando estas capacidades en Databricks, con Lakebase para el estado del agente operativo y de la conversación, Unity Catalog para gobernar los datos y activos de IA, y Unity Gateway para el acceso centralizado a la IA y la seguridad en sus crecientes cargas de trabajo de IA para desarrolladores.

Construcción de IA clínica fiable sobre datos de confianza

Los datos de atención médica a menudo entran en conflicto entre sistemas. Un paciente puede proporcionar información que difiere de un registro existente, y el valor más reciente no siempre es el más fiable.

Concurrence aborda esto registrando nueva información como eventos inmutables en lugar de sobrescribir los registros existentes. A partir de ese historial, Concurrence calcula el estado actual del paciente mientras preserva la fuente y la procedencia de cada pieza de información, lo que denomina su modelo del mundo. Esto proporciona a los agentes una vista e historial consistentes de lo que se sabe sobre un paciente, al tiempo que permite que lo que aprenden de pacientes y clínicos se retroalimente en el estado para futuros flujos de trabajo.

Databricks proporciona la base de datos compartida para esta arquitectura. Los eventos fluyen a través de Zerobus Ingest hacia tablas Delta gobernadas, incluyendo 2.7 millones de eventos del modelo del mundo al mes y 90,000 al día en el pico. Apache Spark™ Declarative Pipelines derivan el modelo del mundo y los datos clínicos de Concurrence; Unity Catalog gobierna cada entorno de cliente; y Lakebase sirve el estado del paciente, el estado del agente y de la conversación, y los datos de la base de conocimiento necesarios para las aplicaciones operativas.

La divulgación sobre brechas de atención y adherencia a la medicación es un ejemplo. Los agentes de Concurrence pueden llamar o enviar mensajes de texto a pacientes que tienen citas de seguimiento pendientes o que están dejando una medicación, usar el contexto existente del paciente para guiar la conversación y registrar lo que aprenden de nuevo en el estado del paciente para futuros flujos de trabajo. Concurrence también ejecuta aplicaciones de producción en Databricks Apps, incluyendo una guía de paquetes de atención, un resumen del plan de atención de enfermería y una superficie de revisión de contenido clínico. Cada una se basa en el mismo contexto e infraestructura de paciente gobernados. El cambio a esta arquitectura también ha permitido a Concurrence retirar su almacén de registros de prompts y trabajos de ETL inverso desarrollados internamente en favor de tablas Delta gobernadas y Lakebase Synced Tables.


Prueba de agentes de IA clínicos antes de la producción

Cada agente en la nueva plataforma de Concurrence se prueba con pacientes simulados antes de que llegue a uno real. Hoy, el tráfico de simulación y evaluación es aproximadamente siete veces mayor que el tráfico de producción en la nueva plataforma.

La arquitectura de datos de Concurrence hace posible esta prueba. Debido a que el estado del paciente se calcula a partir de un historial de eventos inmutable, los equipos pueden reproducir ese estado y probar diferentes rutas sin cambiar el registro real del paciente. Esto permite a Concurrence evaluar cómo responde un agente a diferentes escenarios antes de desplegarlo a los pacientes.

Los rastros de los agentes fluyen a través de Zerobus Ingest y aterrizan en tablas Delta junto con los datos clínicos que los produjeron. Los trabajos programados ai_query que utilizan Claude alojado en Databricks, luego califican esas interacciones en cuanto a calidad y seguridad de la conversación, extraen la memoria y escriben los resultados de nuevo en Delta. Con los datos del paciente, los rastros, los resultados y las evaluaciones en la misma base gobernada, los equipos pueden investigar si los cambios en el rendimiento provienen del modelo, los datos o el flujo de trabajo.

Aplicación de la gobernanza y el cumplimiento de la IA en el sector de la salud

Para Concurrence, los requisitos de HIPAA dan forma a la arquitectura desde el principio. Concurrence cumple hoy con HIPAA, GDPR y SOC 2, y tiene HITRUST e ISO 27001/42001 en progreso. Cada organización de atención médica obtiene su propio esquema y principal de servicio, con controles de acceso, linaje y pistas de auditoría gobernados a través de Unity Catalog.

Para las cargas de trabajo de IA por lotes, Concurrence ejecuta trabajos ai_query en Claude alojado en Databricks bajo un BAA. Su resolvedor de puntos finales solo permite modelos dentro del espacio de nombres cubierto por el BAA, evitando que la PHI sea enrutada a un modelo no cubierto. La misma ruta cubierta ejecuta la clasificación de seguridad de Concurrence para autolesiones, ideación suicida y emergencias médicas. Algunas de sus cargas de trabajo de IA de mayor riesgo están, por lo tanto, protegidas por la misma restricción arquitectónica. Esto también da forma al enfoque de Concurrence para el enrutamiento de modelos: el enrutamiento está restringido por el cumplimiento antes de estarlo por el costo. Los modelos deben cumplir primero con los requisitos de cumplimiento de una carga de trabajo antes de que Concurrence considere la calidad, el rendimiento o el costo.

La inferencia en tiempo real de pacientes y clínicos permanece hoy en la infraestructura de proveedor existente de Concurrence. Concurrence ya ha construido y activado su integración de Unity Gateway para la inferencia en tiempo real, con un canario sintético probándola continuamente de extremo a extremo. El tráfico de producción puede moverse a Unity Gateway a medida que la cobertura de cumplimiento requerida esté disponible.

Gobernanza de agentes de codificación con Unity Gateway

Concurrence aplica el mismo enfoque a la IA para desarrolladores. Los agentes de codificación se utilizan en ingeniería, operaciones e investigación, incluso por ingenieros desplegados en entornos de clientes que manejan datos sanitarios sensibles.

Concurrence enruta todo el tráfico de modelos y herramientas de agentes de codificación a través de la CLI de codificación de Unity Gateway, ug. Los desarrolladores obtienen una única ruta gobernada a modelos aprobados y herramientas MCP, mientras que cada solicitud permanece asociada con la identidad de la persona que la realizó. El acceso a MCP se gestiona centralmente a través del mismo entorno, con permisos asignados por grupo de ingenieros y cada usuario autenticándose individualmente cuando los agentes acceden a herramientas como Databricks, Datadog y Linear.

La escala ya es sustancial. En julio, 14 usuarios individuales generaron 35.850 millones de tokens de entrada a través de Unity Gateway, de los cuales el 95.37% fueron lecturas de caché. Desde que ug se lanzó el 10 de julio, los agentes de codificación de Concurrence han generado aproximadamente 360,000 solicitudes y 61.000 millones de tokens de entrada acumulados.

Centralizar el tráfico de agentes de codificación le da a Concurrence visibilidad sobre cómo se utiliza la IA para desarrolladores y cuánto cuesta. Cada solicitud se atribuye al ingeniero que la realizó, lo que permite a los individuos monitorear su propio uso a través de ug usage. A nivel de organización, Concurrence utiliza los datos de uso de Databricks de system.ai_gateway.usage para rastrear los modelos en uso, el consumo de tokens, las tasas de caché y el gasto por persona y equipo.

Centralización del acceso a la IA con Unity Gateway

El objetivo de Concurrence es unificar la IA de producción, por lotes y para desarrolladores bajo un punto de control de inferencia común con Unity Gateway. La IA para desarrolladores ya se ejecuta a través de Unity Gateway, mientras que la inferencia por lotes se ejecuta en modelos alojados en Databricks a través de rutas cubiertas por BAA. Hoy, Claude Opus 4.8 y GPT-5.6 Sol representan la mayor parte del uso de modelos de agentes de codificación, con un crecimiento en el uso de Opus 5. La inferencia en tiempo real de pacientes y clínicos permanece en la infraestructura de proveedor existente de Concurrence hasta que la cobertura de cumplimiento requerida esté disponible.

Ese enfoque multimodelo es especialmente importante para las cargas de trabajo clínicas de Concurrence. La empresa cuenta actualmente con 14 modelos que sirven inferencia en producción y un catálogo gobernado de 46 modelos. La mayor parte del volumen de producción se ejecuta en modelos más pequeños y rápidos, reservando los modelos de frontera para razonamientos más complejos. Concurrence está desarrollando puntos de referencia de razonamiento clínico para determinar qué modelos funcionan mejor en diferentes tareas de atención médica.

Concurrence también está entusiasmada con el ritmo de innovación de Unity Gateway. Más recientemente, han comenzado a probar Unity Gateway Smart Routing frente a los enfoques de enrutamiento específicos para el sector sanitario que está desarrollando y publicando los resultados. Dado que la elegibilidad de los modelos en el sector sanitario comienza con el cumplimiento normativo, esas evaluaciones analizarán cómo el enrutamiento inteligente puede optimizar la elección del modelo dentro de los límites establecidos para cada carga de trabajo. Por el lado del desarrollador, Concurrence también está explorando Omnigent como un meta-arnés en su entorno de agentes de codificación.

Una base unificada para la IA en el sector sanitario

A medida que Concurrence traslada más flujos de trabajo a Databricks, la base se vuelve más valiosa con cada interacción del agente. El trabajo de cada agente puede enriquecer el estado del paciente desde el que parte el siguiente agente, lo que permite que los nuevos flujos de trabajo reutilicen el contexto existente en lugar de reconstruirlo, reduciendo el costo y el esfuerzo incrementales de añadir nuevos flujos de trabajo de IA.

A una tasa anualizada de aproximadamente 1.2 billones de tokens de entrada en producción, esa base compuesta es importante. Al reunir el contexto del paciente, el estado operativo, los rastreos, las evaluaciones, la gobernanza y el acceso a la IA en Databricks, Concurrence puede escalar la IA clínica de alto riesgo manteniendo la fiabilidad y los controles que exige la atención médica.

(Esta entrada del blog ha sido traducida utilizando herramientas basadas en inteligencia artificial) Publicación original

Recibe las últimas publicaciones en tu bandeja de entrada

Suscríbete a nuestro blog y recibe las últimas publicaciones directamente en tu bandeja de entrada.