Direkt zum Hauptinhalt

Wie Concurrence klinische KI im Trillionen-Token-Maßstab mit Unity Gateway steuert

Da die KI-Nutzung in weniger als einem Jahr um das Fünffache gestiegen ist, baut Concurrence eine vereinheitlichte Daten- und KI-Grundlage auf Databricks auf und nutzt Unity Gateway, um Milliarden von Coding-Agent-Tokens zu verwalten.

von Ali Khokhar, John Xing, Tony Shi und Kelly Albano

KI im Gesundheitswesen hat wenig Spielraum für Fehler. KI-Agenten, die bei der Koordination der Patientenversorgung helfen, sind auf einen zuverlässigen Patientenkontext, klare Kontrollen über Daten- und Modellzugriff sowie Transparenz bei jeder Interaktion angewiesen, während gleichzeitig strenge Compliance-Anforderungen eingehalten werden müssen. 

Concurrence betreibt diese agentenbasierten Gesundheitssysteme in erheblichem Umfang. Das Unternehmen entwickelt klinische KI-Agenten für patienten- und anbieterorientierte Workflows, von KI-Ärzten, -Krankenschwestern und -Pflegekoordinatoren bis hin zu Umgebungsdokumentation, Pflegeplanübersichten und Wissensabruf.

In seiner Produktions-KI-Umgebung verarbeitet Concurrence derzeit etwa 100,8 Milliarden Eingabetokens und 11,2 Millionen LLM-Aufrufe alle 30 Tage, was einer annualisierten Rate von etwa 1,2 Billionen Eingabetokens entspricht. Das monatliche Token-Volumen ist von der Basis Ende 2025 bis Juli 2026 um das Fünffache gestiegen.

In kritischen klinischen Workflows beginnen zuverlässige KI-Agenten mit vertrauenswürdigen, gut verwalteten Daten. Die Unterstützung dieser Zuverlässigkeit in großem Maßstab erfordert starke Compliance, rigorose Agententests und einen geregelten KI-Zugriff. Concurrence konsolidiert diese Funktionen auf Databricks, mit Lakebase für den Betriebsagenten- und Konversationszustand, Unity Catalog zur Verwaltung von Daten- und KI-Assets und Unity Gateway für zentralisierten KI-Zugriff und Sicherheit über seine schnell wachsenden Entwickler-KI-Workloads hinweg.

Aufbau zuverlässiger klinischer KI auf vertrauenswürdigen Daten

Gesundheitsdaten widersprechen sich oft über verschiedene Systeme hinweg. Ein Patient kann Informationen bereitstellen, die von einem bestehenden Datensatz abweichen, und der neueste Wert ist nicht immer der zuverlässigste.

Concurrence begegnet diesem Problem, indem es neue Informationen als unveränderliche Ereignisse aufzeichnet, anstatt bestehende Datensätze zu überschreiben. Aus dieser Historie berechnet Concurrence den aktuellen Patientenzustand, während Quelle und Herkunft jeder Information erhalten bleiben, was es als sein Weltmodell bezeichnet. Dies gibt Agenten eine konsistente Ansicht und Historie dessen, was über einen Patienten bekannt ist, und ermöglicht gleichzeitig, dass das, was sie von Patienten und Klinikern lernen, in den Zustand für zukünftige Workflows zurückfließt.

Databricks bietet die gemeinsame Datengrundlage für diese Architektur. Ereignisse strömen über Zerobus Ingest in verwaltete Delta-Tabellen, darunter 2,7 Millionen Weltmodell-Ereignisse pro Monat und 90.000 pro Tag in Spitzenzeiten. Apache Spark™ Declarative Pipelines leiten das Weltmodell und die klinischen Daten von Concurrence ab; Unity Catalog verwaltet jede Kundenumgebung; und Lakebase dient dem Patientenzustand, dem Agenten- und Konversationszustand sowie den Wissensbasisdaten, die von operativen Anwendungen benötigt werden.

Ein Beispiel ist die Kontaktaufnahme bei Versorgungslücken und Medikationsadhärenz. Die Agenten von Concurrence können Patienten anrufen oder ihnen eine Nachricht senden, die eine Nachsorge überfällig haben oder eine Medikation absetzen, den bestehenden Patientenkontext nutzen, um das Gespräch zu leiten, und das Gelernte für zukünftige Workflows in den Patientenzustand zurückschreiben. Concurrence betreibt auch Produktionsanwendungen auf Databricks Apps, darunter einen Pflegepaket-Leitfaden, eine Zusammenfassung des Pflegeplans für Krankenschwestern und eine Oberfläche zur Überprüfung klinischer Inhalte. Jede basiert auf demselben verwalteten Patientenkontext und derselben Infrastruktur. Der Übergang zu dieser Architektur hat es Concurrence auch ermöglicht, seinen selbst entwickelten Prompt-Log-Speicher und Reverse-ETL-Jobs zugunsten von verwalteten Delta-Tabellen und Lakebase Synced Tables einzustellen.


Testen klinischer KI-Agenten vor der Produktion

Jeder Agent auf der neuen Plattform von Concurrence wird an simulierten Patienten getestet, bevor er einen echten erreicht. Heute ist der Simulations- und Evaluierungsverkehr auf der neuen Plattform etwa siebenmal höher als der Produktionsverkehr.

Die Datenarchitektur von Concurrence ermöglicht diese Tests. Da der Patientenzustand aus einer unveränderlichen Ereignishistorie berechnet wird, können Teams diesen Zustand wiedergeben und verschiedene Pfade testen, ohne den echten Patientendatensatz zu ändern. Dies ermöglicht es Concurrence, zu bewerten, wie ein Agent auf verschiedene Szenarien reagiert, bevor er bei Patienten eingesetzt wird.

Agenten-Traces strömen durch Zerobus Ingest und landen in Delta-Tabellen zusammen mit den klinischen Daten, die sie erzeugt haben. Geplante ai_query Jobs, die Databricks-gehostetes Claude verwenden, bewerten dann diese Interaktionen hinsichtlich Gesprächsqualität und Sicherheit, extrahieren den Speicher und schreiben die Ergebnisse zurück nach Delta. Mit Patientendaten, Traces, Ergebnissen und Bewertungen auf derselben verwalteten Grundlage können Teams untersuchen, ob Leistungsänderungen vom Modell, den Daten oder dem Workflow herrührten.

Durchsetzung von KI-Governance und Compliance im Gesundheitswesen

Für Concurrence prägen HIPAA-Anforderungen die Architektur von Anfang an. Concurrence ist heute HIPAA-, GDPR- und SOC 2-konform, mit HITRUST und ISO 27001/42001 in Arbeit. Jede Gesundheitsorganisation erhält ihr eigenes Schema und ihren eigenen Dienstprinzipal, mit Zugriffssteuerungen, Herkunft und Audit-Trails, die über Unity Catalog verwaltet werden.

Für Batch-KI-Workloads führt Concurrence ai_query Jobs auf Databricks-gehostetem Claude unter einem BAA aus. Sein Endpunkt-Resolver erlaubt nur Modelle innerhalb des BAA-abgedeckten Namensraums, wodurch verhindert wird, dass PHI an ein nicht abgedecktes Modell geleitet wird. Derselbe abgedeckte Pfad führt die Sicherheitsklassifizierung von Concurrence für Selbstverletzung, Suizidgedanken und medizinische Notfälle aus. Einige seiner kritischsten KI-Workloads sind daher durch dieselbe architektonische Einschränkung geschützt. Dies prägt auch den Ansatz von Concurrence für das Modell-Routing: Das Routing ist Compliance-gesteuert, bevor es kostenorientiert ist. Modelle müssen zuerst die Compliance-Anforderungen eines Workloads erfüllen, bevor Concurrence Qualität, Leistung oder Kosten berücksichtigt.

Die Echtzeit-Inferenz für Patienten und Kliniker verbleibt heute auf der bestehenden Anbieterinfrastruktur von Concurrence. Concurrence hat bereits seine Unity Gateway-Integration für Echtzeit-Inferenz entwickelt und mit Feature-Flags versehen, wobei ein synthetischer Canary diese kontinuierlich End-to-End testet. Der Produktionsverkehr kann auf Unity Gateway umgestellt werden, sobald die erforderliche Compliance-Abdeckung verfügbar ist.

Verwaltung von Coding-Agenten mit Unity Gateway

Concurrence wendet denselben Ansatz auf Entwickler-KI an. Coding-Agenten werden in den Bereichen Engineering, Betrieb und Forschung eingesetzt, auch von vor Ort eingesetzten Ingenieuren, die in Kundenumgebungen arbeiten, die sensible Gesundheitsdaten verarbeiten.

Concurrence leitet den gesamten Modell- und Tool-Verkehr von Coding-Agenten über Unity Gateway’s Coding-CLI, ug. Entwickler erhalten einen einzigen verwalteten Pfad zu genehmigten Modellen und MCP-Tools, während jede Anfrage der Identität der Person zugeordnet bleibt, die sie gestellt hat. Der MCP-Zugriff wird zentral über dieselbe Umgebung verwaltet, wobei Berechtigungen nach Ingenieurgruppe zugewiesen werden und jeder Benutzer sich individuell authentifiziert, wenn Agenten auf Tools wie Databricks, Datadog und Linear zugreifen.

Der Umfang ist bereits beträchtlich. Im Juli generierten 14 einzelne Benutzer 35,85 Milliarden Eingabetokens über Unity Gateway, wovon 95,37 % Cache-Lesevorgänge waren. Seit der Einführung von ug am 10. Juli haben die Coding-Agenten von Concurrence etwa 360.000 Anfragen und 61 Milliarden kumulative Eingabetokens generiert.

Die Zentralisierung des Coding-Agenten-Verkehrs verschafft Concurrence Einblick, wie Entwickler-KI genutzt wird und wie viel sie kostet. Jede Anfrage wird dem Ingenieur zugeschrieben, der sie gestellt hat, sodass Einzelpersonen ihre eigene Nutzung über ug usage überwachen können. Auf Organisationsebene verwendet Concurrence Databricks-Nutzungsdaten aus system.ai_gateway.usage, um verwendete Modelle, Token-Verbrauch, Cache-Raten und Ausgaben nach Person und Team zu verfolgen.

Zentralisierung des KI-Zugriffs mit Unity Gateway

Das Ziel von Concurrence ist es, Produktions-, Batch- und Entwickler-KI unter einem gemeinsamen Inferenz-Kontrollpunkt mit Unity Gateway zu vereinen. Entwickler-KI läuft bereits über Unity Gateway, während Batch-Inferenz auf Databricks-gehosteten Modellen über BAA-abgedeckte Pfade läuft. Heute entfallen die meisten Coding-Agenten-Modellnutzungen auf Claude Opus 4.8 und GPT-5.6 Sol, wobei die Nutzung von Opus 5 zunimmt. Die Echtzeit-Inferenz für Patienten und Kliniker verbleibt auf der bestehenden Anbieterinfrastruktur von Concurrence, bis die erforderliche Compliance-Abdeckung verfügbar ist.

Dieser Multi-Modell-Ansatz ist besonders wichtig für die klinischen Workloads von Concurrence. Das Unternehmen verfügt derzeit über 14 Modelle, die für die Produktionsinferenz eingesetzt werden, und einen verwalteten Katalog von 46 Modellen. Das meiste Produktionsvolumen läuft auf kleineren, schnelleren Modellen, wobei Frontier-Modelle für komplexere Schlussfolgerungen reserviert sind. Concurrence entwickelt klinische Reasoning-Benchmarks, um festzustellen, welche Modelle bei verschiedenen Gesundheitsaufgaben am besten abschneiden.

Concurrence ist auch begeistert vom Innovationstempo bei Unity Gateway. Zuletzt haben sie begonnen,  Unity Gateway Smart Routing gegenüber von ihnen entwickelten und veröffentlichten Ergebnissen von gesundheitsspezifischen Routing-Ansätzen zu testen. Da die Modellberechtigung im Gesundheitswesen mit Compliance beginnt, werden diese Evaluierungen bewerten, wie intelligentes Routing die Modellauswahl innerhalb der für jede Arbeitslast festgelegten Grenzen optimieren kann. Auf Entwicklerseite erforscht Concurrence auch  Omnigent als Meta-Harness in ihrer Coding-Agent-Umgebung.

Eine einheitliche Grundlage für KI im Gesundheitswesen

Während Concurrence mehr Workflows auf Databricks verlagert, wird die Grundlage mit jeder Agenteninteraktion wertvoller. Die Arbeit jedes Agenten kann den Patientenzustand anreichern, von dem der nächste Agent ausgeht, wodurch neue Workflows bestehenden Kontext wiederverwenden können, anstatt ihn neu aufzubauen, was die inkrementellen Kosten und den Aufwand für das Hinzufügen neuer KI-Workflows reduziert.

Bei einer annualisierten Rate von etwa 1,2 Billionen Produktions-Input-Tokens ist diese sich verstärkende Grundlage von Bedeutung. Indem Concurrence Patientenkontext, Betriebsstatus, Traces, Evaluierungen, Governance und KI-Zugriff auf Databricks zusammenführt, kann es hochrelevante klinische KI skalieren und gleichzeitig die Zuverlässigkeit und Kontrollen aufrechterhalten, die das Gesundheitswesen erfordert.

(Dieser Blogbeitrag wurde mit KI-gestützten Tools übersetzt.) Originalbeitrag

Erhalten Sie die neuesten Beiträge in Ihrem Posteingang

Abonnieren Sie unseren Blog und erhalten Sie die neuesten Beiträge direkt in Ihren Posteingang.