Ir para o conteúdo principal
Saúde e ciências da vida

Como a Concurrence gerencia a IA clínica em escala de trilhões de tokens com Unity Gateway

Com o uso de IA crescendo 5x em menos de um ano, a Concurrence está construindo uma base unificada de dados e IA na Databricks e está usando o Gateway de Unidade para governar bilhões de tokens de agentes de codificação.

por Ali Khokhar, John Xing, Tony Shi e Kelly Albano

A IA na área da saúde tem pouca margem para erros. Agentes de IA que ajudam a coordenar o cuidado do paciente dependem de um contexto confiável do paciente, controles claros sobre o acesso a dados e modelos, e visibilidade em cada interação, tudo isso enquanto mantêm requisitos de conformidade rigorosos. 

Concurrence está operando esses sistemas de IA para agentes de saúde em uma escala significativa. A empresa constrói agentes de IA clínicos para fluxos de trabalho voltados para pacientes e provedores, desde clínicos, enfermeiros e coordenadores de cuidados de IA até documentação ambiente, resumos de planos de cuidados e recuperação de conhecimento.

Em seu ambiente de IA de produção, a Concurrence agora processa aproximadamente 100,8 bilhões de tokens de entrada e 11,2 milhões de chamadas de LLM a cada 30 dias, o que equivale a uma taxa de execução anualizada de aproximadamente 1,2 trilhão de tokens de entrada. O volume mensal de tokens cresceu cerca de 5 vezes desde sua linha de base do final de 2025 até julho de 2026.

Em fluxos de trabalho clínicos de alto risco, agentes de IA confiáveis começam com dados confiáveis e bem governados. Apoiar essa confiabilidade em escala requer forte conformidade, testes rigorosos de agentes e acesso governado à IA. A Concurrence está consolidando essas capacidades no Databricks, com Lakebase para o estado operacional do agente e da conversa, Unity Catalog para governar dados e ativos de IA, e Unity Gateway para acesso centralizado à IA e segurança em suas cargas de trabalho de IA para desenvolvedores em rápido crescimento.

Construindo IA clínica confiável com dados confiáveis

Dados de saúde frequentemente entram em conflito entre sistemas. Um paciente pode fornecer informações que diferem de um registro existente, e o valor mais recente nem sempre é o mais confiável.

A Concurrence aborda isso registrando novas informações como eventos imutáveis, em vez de sobrescrever registros existentes. A partir desse histórico, a Concurrence calcula o estado atual do paciente, preservando a fonte e a proveniência de cada informação, o que ela chama de seu modelo de mundo. Isso oferece aos agentes uma visão consistente e um histórico do que se sabe sobre um paciente, ao mesmo tempo em que permite que o que eles aprendem com pacientes e clínicos seja realimentado no estado para futuros fluxos de trabalho.

Databricks fornece a base de dados compartilhada para esta arquitetura. Eventos fluem através do Zerobus Ingest para tabelas Delta governadas, incluindo 2,7 milhões de eventos de modelo de mundo por mês e 90.000 por dia no pico. Apache Spark™ Declarative Pipelines derivam o modelo de mundo e os dados clínicos da Concurrence; o Unity Catalog governa cada ambiente do cliente; e o Lakebase serve o estado do paciente, o estado do agente e da conversa, e os dados da base de conhecimento necessários para aplicações operacionais.

A comunicação sobre lacunas no cuidado e adesão à medicação é um exemplo. Os agentes da Concurrence podem ligar ou enviar mensagens de texto para pacientes que estão atrasados para acompanhamento ou que estão deixando de tomar uma medicação, usar o contexto existente do paciente para guiar a conversa e registrar o que aprendem de volta no estado do paciente para futuros fluxos de trabalho. A Concurrence também executa aplicações de produção no Databricks Apps, incluindo um guia de pacote de cuidados, um resumo do plano de cuidados de enfermagem e uma superfície de revisão de conteúdo clínico. Cada um se baseia no mesmo contexto e infraestrutura de paciente governados. A mudança para esta arquitetura também permitiu à Concurrence aposentar seu prompt-log store e jobs de reverse-ETL desenvolvidos internamente em favor de tabelas Delta governadas e Lakebase Synced Tables.


Testando agentes de IA clínicos antes da produção

Cada agente na nova plataforma da Concurrence é testado contra pacientes simulados antes de chegar a um real. Hoje, o tráfego de simulação e avaliação é aproximadamente sete vezes maior do que o tráfego de produção na nova plataforma.

A arquitetura de dados da Concurrence torna este teste possível. Como o estado do paciente é calculado a partir de um histórico de eventos imutável, as equipes podem reproduzir esse estado e testar diferentes caminhos sem alterar o registro real do paciente. Isso permite à Concurrence avaliar como um agente responde a diferentes cenários antes de implantá-lo em pacientes.

Os rastros dos agentes fluem através do Zerobus Ingest e chegam às tabelas Delta junto com os dados clínicos que os produziram. Jobs agendados de ai_query usando Claude hospedado no Databricks, então pontuam essas interações para qualidade e segurança da conversa, extraem memória e escrevem os resultados de volta para o Delta. Com dados do paciente, rastros, resultados e avaliações na mesma base governada, as equipes podem investigar se as mudanças no desempenho vieram do modelo, dos dados ou do fluxo de trabalho.

Impondo governança e conformidade de IA na área da saúde

Para a Concurrence, os requisitos da HIPAA moldam a arquitetura desde o início. A Concurrence é hoje compatível com HIPAA, GDPR e SOC 2, com HITRUST e ISO 27001/42001 em andamento. Cada organização de saúde obtém seu próprio esquema e service principal, com controles de acesso, linhagem e trilhas de auditoria governados através do Unity Catalog.

Para cargas de trabalho de IA em lote, a Concurrence executa jobs de ai_query no Claude hospedado no Databricks sob um BAA. Seu resolvedor de endpoint permite apenas modelos dentro do namespace coberto pelo BAA, impedindo que PHI seja roteado para um modelo não coberto. O mesmo caminho coberto executa a classificação de segurança da Concurrence para autoagressão, ideação suicida e emergências médicas. Algumas de suas cargas de trabalho de IA de maior risco são, portanto, protegidas pela mesma restrição arquitetônica. Isso também molda a abordagem da Concurrence para o roteamento de modelos: o roteamento é restrito por conformidade antes de ser restrito por custo. Os modelos devem primeiro atender aos requisitos de conformidade de uma carga de trabalho antes que a Concurrence considere qualidade, desempenho ou custo.

A inferência em tempo real de pacientes e clínicos permanece na infraestrutura de provedor existente da Concurrence hoje. A Concurrence já construiu e sinalizou (feature-flagged) sua integração com o Unity Gateway para inferência em tempo real, com um canary sintético testando-a continuamente de ponta a ponta. O tráfego de produção pode ser movido para o Unity Gateway assim que a cobertura de conformidade necessária estiver disponível.

Governando agentes de codificação com o Unity Gateway

A Concurrence aplica a mesma abordagem à IA para desenvolvedores. Agentes de codificação são usados em engenharia, operações e pesquisa, inclusive por engenheiros implantados em campo que trabalham em ambientes de clientes que lidam com dados de saúde sensíveis.

A Concurrence roteia todo o tráfego de modelos e ferramentas de agentes de codificação através da CLI de codificação do Unity Gateway, ug. Os desenvolvedores obtêm um único caminho governado para modelos aprovados e ferramentas MCP, enquanto cada solicitação permanece associada à identidade da pessoa que a fez. O acesso MCP é gerenciado centralmente através do mesmo ambiente, com permissões atribuídas por grupo de engenheiros e cada usuário autenticando individualmente quando os agentes acessam ferramentas como Databricks, Datadog e Linear.

A escala já é substancial. Em julho, 14 usuários individuais geraram 35,85 bilhões de tokens de entrada através do Unity Gateway, dos quais 95,37% foram leituras de cache. Desde que o ug foi lançado em 10 de julho, os agentes de codificação da Concurrence geraram aproximadamente 360.000 solicitações e 61 bilhões de tokens de entrada cumulativos.

Centralizar o tráfego de agentes de codificação dá à Concurrence visibilidade sobre como a IA para desenvolvedores é usada e quanto custa. Cada solicitação é atribuída ao engenheiro que a fez, permitindo que os indivíduos monitorem seu próprio uso através de ug usage. No nível organizacional, a Concurrence usa dados de uso do Databricks de system.ai_gateway.usage para rastrear modelos em uso, consumo de tokens, taxas de cache e gastos por pessoa e equipe.

Centralizando o acesso à IA com o Unity Gateway

O objetivo da Concurrence é trazer a IA de produção, em lote e para desenvolvedores sob um ponto de controle de inferência comum com o Unity Gateway. A IA para desenvolvedores já funciona através do Unity Gateway, enquanto a inferência em lote é executada em modelos hospedados no Databricks através de caminhos cobertos por BAA. Hoje, Claude Opus 4.8 e GPT-5.6 Sol respondem pela maior parte do uso de modelos de agentes de codificação, com o uso do Opus 5 crescendo. A inferência em tempo real de pacientes e clínicos permanece na infraestrutura de provedor existente da Concurrence até que a cobertura de conformidade necessária esteja disponível.

Essa abordagem multimodelos é especialmente importante para as cargas de trabalho clínicas da Concurrence. Atualmente, a empresa possui 14 modelos para inferência em produção e um catálogo governado de 46 modelos. A maior parte do volume de produção é executada em modelos menores e mais rápidos, com modelos de ponta reservados para raciocínios mais complexos. A Concurrence está desenvolvendo benchmarks de raciocínio clínico para determinar quais modelos têm o melhor desempenho em diferentes tarefas de saúde.

A Concurrence também está entusiasmada com o ritmo da inovação com o Unity Gateway. Mais recentemente, eles começaram a testar Unity Gateway Smart Routing contra abordagens de roteamento específicas para a área da saúde que está desenvolvendo e publicando os resultados. Como a elegibilidade de modelos na área da saúde começa com a conformidade, essas avaliações analisarão como o roteamento inteligente pode otimizar a escolha do modelo dentro dos limites estabelecidos para cada carga de trabalho. No lado do desenvolvedor, a Concurrence também está explorando Omnigent como um meta-arnês em seu ambiente de agente de codificação.

Uma base unificada para a IA na saúde

À medida que a Concurrence move mais fluxos de trabalho para a Databricks, a base se torna mais valiosa a cada interação do agente. O trabalho de cada agente pode enriquecer o estado do paciente a partir do qual o próximo agente começa, permitindo que novos fluxos de trabalho reutilizem o contexto existente em vez de reconstruí-lo, reduzindo o custo incremental e o esforço de adicionar novos fluxos de trabalho de IA.

Com uma taxa anualizada de aproximadamente 1,2 trilhão de tokens de entrada de produção, essa base composta é importante. Ao reunir contexto do paciente, estado operacional, rastros, avaliações, governança e acesso à IA na Databricks, a Concurrence pode escalar a IA clínica de alto risco, mantendo a confiabilidade e os controles que a área da saúde exige.

(Esta publicação no blog foi traduzida utilizando ferramentas baseadas em inteligência artificial) Publicação original

Receba os posts mais recentes na sua caixa de entrada

Assine nosso blog e receba os posts mais recentes diretamente na sua caixa de entrada.