주요 컨텐츠로 이동
의료 및 생명 공학

Concurrence가 Unity Gateway를 사용하여 1조 토큰 규모의 임상 AI를 어떻게 관리하는가

AI 사용량이 1년도 안 되어 5배 증가하면서, Concurrence는 Databricks를 기반으로 통합 데이터 및 AI 기반을 구축하고 있으며, 수십억 개의 코딩 에이전트 토큰을 관리하기 위해 Unity Gateway를 사용하고 있습니다.

작성자: Ali Khokhar, John Xing, Tony Shi , 켈리 알바노

의료 AI는 오류 발생 여지가 거의 없습니다. 환자 치료를 조율하는 데 도움을 주는 AI 에이전트는 엄격한 규정 준수 요구 사항을 유지하면서도 신뢰할 수 있는 환자 컨텍스트, 데이터 및 모델 접근에 대한 명확한 제어, 모든 상호 작용에 대한 가시성에 의존합니다. 

Concurrence는 이러한 의료 에이전트 시스템을 상당한 규모로 운영하고 있습니다. 이 회사는 AI 임상의, 간호사, 진료 코디네이터부터 주변 문서화, 진료 계획 요약, 지식 검색에 이르기까지 환자 및 의료 제공자 대면 워크플로우 전반에 걸쳐 임상 AI 에이전트를 구축합니다.

Concurrence는 프로덕션 AI 환경에서 현재 30일마다 약 1,008억 개의 입력 토큰과 1,120만 건의 LLM 호출을 처리하며, 이는 연간 약 1조 2천억 개의 입력 토큰에 해당합니다. 월별 토큰 볼륨은 2025년 말 기준선부터 2026년 7월까지 약 5배 증가했습니다.

중요한 임상 워크플로우에서 신뢰할 수 있는 AI 에이전트는 신뢰할 수 있고 잘 관리된 데이터에서 시작됩니다. 대규모로 이러한 신뢰성을 지원하려면 강력한 규정 준수, 엄격한 에이전트 테스트 및 관리되는 AI 접근이 필요합니다. Concurrence는 Databricks에서 이러한 기능을 통합하고 있으며, 운영 에이전트 및 대화 상태를 위한 Lakebase, 데이터 및 AI 자산 관리를 위한 Unity Catalog, 그리고 빠르게 성장하는 개발자 AI 워크로드 전반에 걸쳐 중앙 집중식 AI 접근 및 보안을 위한 Unity Gateway를 사용합니다.

신뢰할 수 있는 데이터로 안정적인 임상 AI 구축

의료 데이터는 시스템마다 충돌하는 경우가 많습니다. 환자가 기존 기록과 다른 정보를 제공할 수 있으며, 최신 값이 항상 가장 신뢰할 수 있는 것은 아닙니다.

Concurrence는 기존 기록을 덮어쓰는 대신 새로운 정보를 불변 이벤트로 기록하여 이 문제를 해결합니다. 이 기록을 바탕으로 Concurrence는 각 정보의 출처와 이력을 보존하면서 현재 환자 상태를 계산하며, 이를 세계 모델(world model)이라고 부릅니다. 이는 에이전트에게 환자에 대해 알려진 내용에 대한 일관된 시각과 이력을 제공하는 동시에, 환자와 임상의로부터 학습한 내용을 향후 워크플로우를 위한 상태로 다시 피드백할 수 있도록 합니다.

Databricks는 이 아키텍처를 위한 공유 데이터 기반을 제공합니다. 이벤트는 Zerobus Ingest를 통해 관리되는 Delta 테이블로 스트리밍되며, 여기에는 월 270만 건의 세계 모델 이벤트와 피크 시 하루 9만 건이 포함됩니다. Apache Spark™ Declarative Pipelines는 Concurrence의 세계 모델과 임상 데이터를 도출하고, Unity Catalog는 각 고객 환경을 관리하며, Lakebase는 운영 애플리케이션에 필요한 환자 상태, 에이전트 및 대화 상태, 지식 기반 데이터를 제공합니다.

진료 공백 및 약물 복용 준수 지원은 한 가지 예시입니다. Concurrence의 에이전트는 후속 진료가 지연되거나 약물 복용을 중단한 환자에게 전화 또는 문자를 보내고, 기존 환자 컨텍스트를 사용하여 대화를 안내하며, 학습한 내용을 향후 워크플로우를 위한 환자 상태에 다시 기록할 수 있습니다. Concurrence는 또한 Databricks Apps에서 진료 패킷 가이드, 간호사 진료 계획 요약, 임상 콘텐츠 검토 화면을 포함한 프로덕션 애플리케이션을 실행합니다. 각각은 동일하게 관리되는 환자 컨텍스트와 인프라를 기반으로 구축됩니다. 이 아키텍처로의 전환을 통해 Concurrence는 자체 개발한 프롬프트 로그 저장소 및 역-ETL 작업을 관리되는 Delta 테이블과 Lakebase Synced Tables로 대체할 수 있었습니다.


프로덕션 전 임상 AI 에이전트 테스트

Concurrence의 새 플랫폼에 있는 모든 에이전트는 실제 환자에게 도달하기 전에 시뮬레이션된 환자를 대상으로 테스트됩니다. 현재 새 플랫폼의 시뮬레이션 및 평가 트래픽은 프로덕션 트래픽보다 약 7배 더 많습니다.

Concurrence의 데이터 아키텍처는 이러한 테스트를 가능하게 합니다. 환자 상태는 불변 이벤트 기록에서 계산되므로, 팀은 실제 환자 기록을 변경하지 않고 해당 상태를 재생하고 다양한 경로를 테스트할 수 있습니다. 이를 통해 Concurrence는 에이전트를 환자에게 배포하기 전에 다양한 시나리오에 어떻게 반응하는지 평가할 수 있습니다.

에이전트 추적은 Zerobus Ingest를 통해 스트리밍되어 이를 생성한 임상 데이터와 함께 Delta 테이블에 저장됩니다. Databricks에서 호스팅되는 Claude를 사용하는 예약된 ai_query 작업은 대화 품질 및 안전에 대한 상호 작용을 평가하고, 메모리를 추출하며, 결과를 Delta에 다시 기록합니다. 동일하게 관리되는 기반 위에 환자 데이터, 추적, 결과 및 평가가 있으므로 팀은 성능 변화가 모델, 데이터 또는 워크플로우에서 비롯되었는지 조사할 수 있습니다.

의료 분야에서 AI 거버넌스 및 규정 준수 강화

Concurrence의 경우, HIPAA 요구 사항이 처음부터 아키텍처를 형성합니다. Concurrence는 현재 HIPAA, GDPR 및 SOC 2를 준수하며, HITRUST 및 ISO 27001/42001 인증을 진행 중입니다. 각 의료 기관은 Unity Catalog를 통해 관리되는 접근 제어, 계보 및 감사 추적과 함께 자체 스키마 및 서비스 주체를 가집니다.

배치 AI 워크로드의 경우, Concurrence는 BAA에 따라 Databricks에서 호스팅되는 Claude에서 ai_query 작업을 실행합니다. 해당 엔드포인트 리졸버는 BAA 적용 네임스페이스 내의 모델만 허용하여 PHI가 미적용 모델로 라우팅되는 것을 방지합니다. 동일한 적용 경로는 자해, 자살 충동 및 의료 응급 상황에 대한 Concurrence의 안전 분류를 실행합니다. 따라서 일부 가장 중요한 AI 워크로드는 동일한 아키텍처 제약 조건에 의해 보호됩니다. 이는 또한 모델 라우팅에 대한 Concurrence의 접근 방식을 형성합니다. 즉, 라우팅은 비용 제약 전에 규정 준수 제약을 받습니다. Concurrence는 품질, 성능 또는 비용을 고려하기 전에 모델이 먼저 워크로드의 규정 준수 요구 사항을 충족해야 합니다.

실시간 환자 및 임상의 추론은 현재 Concurrence의 기존 공급자 인프라에 남아 있습니다. Concurrence는 실시간 추론을 위한 Unity Gateway 통합을 이미 구축하고 기능 플래그를 지정했으며, 합성 카나리가 이를 지속적으로 엔드투엔드로 테스트하고 있습니다. 필요한 규정 준수 적용 범위가 제공되면 프로덕션 트래픽은 Unity Gateway로 이동할 수 있습니다.

Unity Gateway로 코딩 에이전트 관리

Concurrence는 개발자 AI에도 동일한 접근 방식을 적용합니다. 코딩 에이전트는 민감한 의료 데이터를 처리하는 고객 환경에서 작업하는 현장 배치 엔지니어를 포함하여 엔지니어링, 운영 및 연구 전반에 걸쳐 사용됩니다.

Concurrence는 모든 코딩 에이전트 모델 및 도구 트래픽을 Unity Gateway의 코딩 CLI, ug를 통해 라우팅합니다. 개발자는 승인된 모델 및 MCP 도구에 대한 단일 관리 경로를 얻으며, 각 요청은 요청을 한 사람의 신원과 계속 연결됩니다. MCP 접근은 동일한 환경을 통해 중앙에서 관리되며, 엔지니어 그룹별로 권한이 할당되고 에이전트가 Databricks, Datadog 및 Linear와 같은 도구에 접근할 때 각 사용자가 개별적으로 인증합니다.

규모는 이미 상당합니다. 7월에 14명의 개별 사용자가 Unity Gateway를 통해 358억 5천만 개의 입력 토큰을 생성했으며, 이 중 95.37%는 캐시 읽기였습니다. 7월 10일 ug가 출시된 이후 Concurrence의 코딩 에이전트는 약 36만 건의 요청과 누적 610억 개의 입력 토큰을 생성했습니다.

코딩 에이전트 트래픽을 중앙 집중화함으로써 Concurrence는 개발자 AI가 어떻게 사용되고 비용이 얼마나 드는지에 대한 가시성을 확보합니다. 모든 요청은 이를 생성한 엔지니어에게 귀속되어 개인이 ug usage를 통해 자신의 사용량을 모니터링할 수 있습니다. 조직 수준에서 Concurrence는 system.ai_gateway.usage의 Databricks 사용량 데이터를 사용하여 사용 중인 모델, 토큰 소비량, 캐시율, 개인 및 팀별 지출을 추적합니다.

Unity Gateway로 AI 접근 중앙 집중화

Concurrence의 목표는 Unity Gateway를 통해 프로덕션, 배치 및 개발자 AI를 공통 추론 제어 지점 아래로 통합하는 것입니다. 개발자 AI는 이미 Unity Gateway를 통해 실행되며, 배치 추론은 BAA 적용 경로를 통해 Databricks에서 호스팅되는 모델에서 실행됩니다. 현재 Claude Opus 4.8 및 GPT-5.6 Sol이 대부분의 코딩 에이전트 모델 사용량을 차지하며, Opus 5 사용량이 증가하고 있습니다. 실시간 환자 및 임상의 추론은 필요한 규정 준수 적용 범위가 제공될 때까지 Concurrence의 기존 공급자 인프라에 남아 있습니다.

이 다중 모델 접근 방식은 Concurrence의 임상 워크로드에 특히 중요합니다. 이 회사는 현재 프로덕션 추론을 제공하는 14개의 모델과 46개의 모델로 구성된 거버넌스 카탈로그를 보유하고 있습니다. 대부분의 프로덕션 볼륨은 더 작고 빠른 모델에서 실행되며, 최신 모델은 더 복잡한 추론을 위해 예약되어 있습니다. Concurrence는 다양한 의료 작업에서 어떤 모델이 가장 잘 수행되는지 결정하기 위해 임상 추론 벤치마크를 개발하고 있습니다.

Concurrence는 또한 Unity Gateway의 혁신 속도에 대해 기대하고 있습니다. 최근에는 개발 중인 의료 분야별 라우팅 접근 방식과 비교하여 Unity Gateway 스마트 라우팅을 테스트하기 시작했으며 그 결과를 발표하고 있습니다. 의료 분야에서 모델 적격성은 규정 준수에서 시작되므로, 이러한 평가는 지능형 라우팅이 각 워크로드에 설정된 경계 내에서 모델 선택을 어떻게 최적화할 수 있는지 평가할 것입니다. 개발자 측면에서 Concurrence는 또한 코딩 에이전트 환경 전반에 걸쳐 메타 하네스로서 Omnigent를 탐색하고 있습니다.

의료 AI를 위한 통합 기반

Concurrence가 더 많은 워크플로를 Databricks로 이전함에 따라, 모든 에이전트 상호 작용을 통해 기반이 더욱 가치 있게 됩니다. 각 에이전트의 작업은 다음 에이전트가 시작하는 환자 상태를 풍부하게 하여, 새로운 워크플로가 기존 컨텍스트를 다시 구축하는 대신 재사용할 수 있도록 하고, 새로운 AI 워크플로를 추가하는 증분 비용과 노력을 줄입니다.

연간 약 1.2조 개의 프로덕션 입력 토큰이라는 비율로, 이러한 복합적인 기반은 중요합니다. 환자 컨텍스트, 운영 상태, 추적, 평가, 거버넌스 및 AI 액세스를 Databricks에서 통합함으로써 Concurrence는 의료 분야에서 요구하는 신뢰성과 제어를 유지하면서 중요한 임상 AI를 확장할 수 있습니다.

(이 글은 AI의 도움을 받아 번역되었습니다. 원문이 궁금하시다면 여기를 클릭해 주세요)

최신 게시물을 이메일로 받아보세요

블로그를 구독하고 최신 게시물을 이메일로 받아보세요.