주요 컨텐츠로 이동
솔루션

생체 의료 영상의 진정한 병목 현상은 모델이 아닌 데이터입니다.

PACS 사일로에서 다중 오믹스까지: 영상 AI가 데이터 문제로 정체되는 이유와 이를 해결할 기반을 구축하는 방법

작성자: Parastou Eslami , 더글라스 무어

  • 요약: 병원, 학계, 의료 기술, 제약 산업 전반에서 의료 영상 AI가 기대 이하의 성과를 내는 이유와 R&D 전반에 걸쳐 더욱 강력한 데이터 기반이 무엇인지에 대한 현장 관점입니다.
  • 과제: 영상 데이터는 의학 분야에서 가장 풍부한 데이터이지만 활용도가 가장 낮습니다. PACS, CRO, 중앙 연구소에 사일로화되어 있고, 식별 해제가 어려우며, 바이오마커 및 환자 계층화에 활용되는 다른 데이터 양식과 거의 연결되지 않습니다. 어려운 부분은 모델이 아니라 데이터입니다.
  • 핵심 요약: 핵심은 더 나은 모델이 아니라 그 밑에 있는 데이터 기반입니다. 영상을 한 곳에서 관리하고, 쿼리 가능하게 만들고, 대규모로 식별 해제하며, EHR, 오믹스, 임상 시험 데이터와 연결해야 합니다(거버넌스 적용 레이크하우스 패턴을 통해). 데이터를 제대로 구축하면 모델은 쉬운 부분이 됩니다.

파트 I — 문제점

네 가지 분야, 한 가지 병목 현상

병원과 의료 시스템은 원자재를 생성합니다. 영상의학은 의료 AI 분야에서 가장 엄격하게 규제되는 영역입니다. 2024년 중반까지 FDA가 승인한 약 950개의 AI/ML 지원 기기 중 약 723개(약 76%)가 영상의학 도구였습니다. 거의 모든 도구는 범위가 좁고 사람의 감독을 받으며, 분류, 측정, 재구성 또는 작업 목록 우선순위 지정을 수행합니다. 병원에서 진정한 어려움은 모델 자체인 경우가 드뭅니다. 문제는 데이터가 PACS와 벤더 중립 아카이브 내에 잠겨 있다는 것입니다. 이 시스템들은 연구 질문에 답하기 위해서가 아니라 뷰어에게 이미지를 제공하기 위해 구축되었습니다. 코호트를 추출한다는 것은 임상 시스템에서 이미지를 추출하고, 비식별화(PHI는 DICOM 헤더에 숨겨져 있으며 픽셀에 기록됨)하고, 이를 사용할 컴퓨팅 자원을 찾는 것을 의미합니다. 모델은 쉬운 10%에 불과합니다.

대부분의 오픈 사이언스는 학술 의료 센터에서 이루어집니다. 이 분야의 발전은 MIMIC-CXR(흉부 X선 377,110개), The Cancer Imaging Archive, fastMRI, UK Biobank 영상 부문과 같은 공유 데이터셋과 MONAI, nnU-Net, 3D Slicer와 같은 오픈 툴링 덕분입니다. 학계는 또한 이 분야의 신뢰성 문제를 드러냅니다. 심층 학습 대 임상의 영상 연구에 대한 잘 알려진 BMJ 리뷰(Nagendran et al., 2020)에 따르면, 81개 연구 중 소수만이 전향적이거나 실제 임상 환경에서 테스트되었으며, 93%와 95%의 연구에서 코드와 데이터를 사용할 수 없었습니다. 이러한 재현성 문제는 영상 데이터를 공유하고 다시 실행하기가 얼마나 어려운지에 직접적으로 기인합니다.

메드테크 및 기기 회사(GE HealthCare, Siemens Healthineers, Philips, Canon)는 스캐너에 AI를 직접 구축합니다. 스캔 시간을 단축하는 딥러닝 재구성, 선량 감소, 온디바이스 분류 등이 그 예입니다. 가장 어려운 문제는 일반화입니다. 한 벤더의 스캐너, 자기장 강도 및 프로토콜로 훈련된 알고리즘은 다른 벤더의 시스템에서는 조용히 성능이 저하될 수 있습니다. 실제 세계를 대표하는 다중 사이트 훈련 데이터를 큐레이션하고, 510(k) 및 PMA 경로를 통해 규제 기관에 이를 증명하는 것은 진입 장벽이자 비용입니다.

제약 및 바이오테크 기업은 영상을 측정 도구로 취급합니다. 종양학 임상 시험은 RECIST, iRECIST, RANO와 같은 표준화된 반응 기준에 의존하며, 이는 사이트 편향을 제거하기 위해 중앙에서 맹검으로 판독됩니다. 정량적 영상 바이오마커는 크기 기반 측정보다 약물 반응을 더 일찍 감지할 수 있습니다. 측정이 여러 사이트, 스캐너 및 시간에 걸쳐 동일한 의미를 갖지 않는 한 이 모든 것은 작동하지 않습니다. 이것이 RSNA의 QIBA가 명시된 정밀도로 획득 및 분석을 고정하는 프로파일을 작성하는 이유입니다. 가변성은 임상 시험의 최종 목표에 대한 적입니다.

네 가지 다른 업무, 하나의 공통된 병목 현상. 픽셀은 어디에나 있지만, 어디에서도 쿼리할 수 없습니다.

image4.png
그림 1. 병원, 학계, 메드테크, 제약 회사 모두 동일한 문제에 직면합니다. 픽셀은 어디에나 있지만, 어디에서도 쿼리할 수 없습니다.

협업이 전부인 이유, 그리고 왜 그렇게 어려운가

어떤 단일 기관도 일반화할 수 있는 모델을 구축할 만큼 충분히 다양한 데이터를 보유하고 있지 않습니다. 현재까지 가장 강력한 협력 연구가 이 점을 보여줍니다. EXAM 연구(Nature Medicine, 2021)에서 20개 기관은 환자 데이터를 서로 이동하지 않고 흉부 X선과 EMR 데이터를 통해 COVID-19 산소 요구량을 예측하는 공유 모델을 훈련했습니다. 모델 가중치만 이동했으며, 연합 학습 모델은 단일 사이트 모델에 비해 AUC에서 평균 16%, 일반화 가능성에서 38% 향상되었습니다. 그 작동 방식은 생각보다 복잡하지 않습니다. 각 사이트는 로컬에서 훈련하고, 코디네이터는 데이터 대신 모델 가중치를 평균화하며(고전적인 연합 평균화 방식), 보안 집계와 차등 프라이버시는 특정 사이트의 기록이 해당 가중치로부터 재구성되는 것을 방지합니다.

그것이 바로 약속입니다. 현실은 기술적인 이유보다는 구조적인 이유로 인해 협업이 진정으로 어렵다는 것입니다.

  • 데이터 이질성. 서로 다른 스캐너, 프로토콜 및 라벨링 규칙은 "동일한" 검사가 실제로는 그렇지 않은 경우가 많다는 것을 의미합니다. 연합 학습 모델은 배치 정규화 평균화 또는 사이트 인식 조화와 같은 기술로 의도적으로 설계되지 않는 한, 이러한 비독립 동일 분포(non-IID), 획득 편향 데이터에서 성능이 저하됩니다.
  • 프라이버시 및 거버넌스. 모든 기관 간 연구는 사이트별 IRB 승인, 데이터 사용 계약, 그리고 방어 가능한 비식별화를 수반합니다.
  • 공통 기반 부재. MIDRC(ACR, RSNA, AAPM 공동 주도)와 같은 컨소시엄은 데이터 수집, 큐레이션, 비식별화, 라벨링 및 공유가 너무 어려워 전담 국가적 노력이 필요하기 때문에 존재합니다.

영상 분야에서의 협업은 있으면 좋은 것이 아닙니다. 이는 훈련된 건물 밖에서도 작동하는 모델을 만들 수 있는 유일한 경로이며, 거의 전적으로 데이터 파이프라인과 거버넌스에 의해 좌우됩니다.

이 분야 외부의 대부분의 사람들이 결코 보지 못하는 복잡성

사람들이 "의료 영상"이라고 말할 때, 그들은 보통 흉부 X선을 떠올립니다. 현실은 일반적인 데이터 툴링으로는 감당하기 어려운 다양한 형식과 규모의 집합체입니다.

영상 유형형식차원 및 규모범용 툴링이 한계에 부딪히는 이유
영상의학 — X선, CT, MRIDICOM, 약 12가지 전송 구문으로 인코딩 가능 (압축 해제 → JPEG 2000 → HTJ2K)2D X선 → 3D CT/MRI 볼륨 → 4D 동적 심장기기 간 연구를 이동시키기 위해 구축되었으며, 대량 분석용이 아님; 디코더(pydicom, GDCM, pylibjpeg)는 단일 스레드로 실행됨 — 몇몇 연구는 사소하지만, 수백만 건은 분산 시스템 문제입니다.
디지털 병리학 — 전체 슬라이드 이미지벤더 형식: Aperio .svs, Hamamatsu .ndpi, Philips iSyntax (OpenSlide 경유); DICOM은 거의 없음기가픽셀 — 여러 GB, 수만 개의 타일, 여러 배율로 피라미드처럼 읽음메모리에서 열기에는 너무 큼; 염색 및 스캐너 색상이 실험실마다 달라 모델 오류의 원인이 됨
안과, 피부과 및 기타OCT 볼륨, 임상 사진, 각각 고유한 규칙을 가짐2D 및 3D, 모달리티별JPEG 폴더 도구가 처리하도록 만들어지지 않은 또 다른 형식 세트

"의료 영상"은 단일한 것이 아닙니다. 이는 다양한 형식과 규모의 집합체입니다. 연구 아카이브는 페타바이트에 달하며, 대규모로 비식별화하는 것 자체가 하나의 연구 분야로 발표될 정도입니다.

연구를 조용히 망가뜨리는 두 번째 종류의 복잡성이 있습니다. 바로 숫자 자체가 여러 사이트에서 비교할 수 없다는 것입니다. 두 개의 스캐너와 두 개의 프로토콜로 측정된 표준화된 섭취량 값 또는 종양 부피는 동일한 측정이 아닙니다. 이것이 정량적 영상이 QIBA 프로파일 및 방사선학 특징에 대한 IBSI 정의와 같은 표준에 의존하는 이유이며, 순수한 정확도가 아닌 재현성이 일반적으로 실패하는 이유입니다.

JPEG 폴더를 처리하는 도구는 이 중 어떤 것도 처리할 수 없으며, 이것이 영상이 유전체학 및 EHR 데이터에 비해 분석 준비 상태가 늦어진 큰 이유입니다.

영상은 더 큰 문제의 가장 첨예한 부분입니다.

초점이 영상에만 머물 때 놓치기 쉬운 점은, 여기에 언급된 모든 것이 나머지 R&D에도 해당된다는 것입니다. 영상은 데이터가 가장 크고 가장 특이하기 때문에 문제가 가장 먼저 나타나는 곳일 뿐입니다.

오늘날 생명 과학 R&D 조직에 들어가 보면, 진정한 개척 분야는 어떤 단일 데이터 유형이 아닙니다. 이는 각기 고유한 형식과 사일로를 가진 유전체학, 전사체학, 단백질체학, 대사체학을 포함하는 다중 오믹스입니다. 이는 실제 세계 및 임상 시험 데이터, EHR, 등록 데이터 및 파형입니다. 이는 의료 업무 및 문헌입니다. 실제로 프로그램을 진전시키는 질문, 즉 어떤 환자가 반응하고 그 이유는 무엇인지, 영상과 분자 서명 및 결과가 함께 무엇을 말하는지는 이러한 도메인 간의 연결점에 있으며, 그 중 어느 하나 안에 있는 것이 아닙니다.

이러한 모든 데이터 유형은 영상이 겪는 것과 동일한 어려움을 안고 있습니다. 풍부하고, 고차원적이며, 대부분 비정형화되어 있고, 도메인별 시스템에 갇혀 있으며, 거버넌스가 어렵고, 연결하기는 더 어렵습니다. 전체 슬라이드 이미지, 유전체 변이 호출, 임상 시험 최종 목표는 각각 자체적으로도 충분히 어렵습니다. 가치는 이들을 같은 문맥에 놓을 때 나옵니다. 이는 AI 문제가 되기 전에 데이터 기반 문제입니다. 그리고 팀들이 가장 과소평가하는 부분입니다.

이것은 단지 의료 분야만의 이야기가 아닙니다. AI 예산은 계속 증가하지만 수익은 그렇지 않은 이유에 대한 최근 베인(Bain) 분석에 따르면, 데이터 접근 및 통합이 AI의 가장 큰 단일 장벽이며, 41%의 기업이 이를 언급했고, 선두 기업들이 후발 기업들보다 훨씬 더 자주 언급했습니다. 그들의 직설적인 표현에 따르면: 대부분의 조직은 여전히 자체 데이터에 안정적으로 접근할 수 없습니다. 의료 분야는 이 문제를 외면하기 더 어렵게 만들 뿐입니다.

파트 II — 기반

이 부분부터는 더 구체적이고 기술적인 내용이 나옵니다. 플랫폼을 구축하지 않는 독자들을 위한 요약은 간단합니다. 모든 것을 한 곳에서 관리하고, 픽셀을 쿼리 가능하게 만들고, 대규모로 비식별화하며, 영상을 환자의 나머지 정보와 연결하십시오. 이 섹션의 나머지는 그 방법을 설명합니다.

데이터 기반이 실제로 해야 할 일

분야별 특성을 제거하면 요구 사항은 동일합니다. 플랫폼은 다음을 수행해야 합니다.

  1. 비정형 영상 파일과 추출된 메타데이터를 한 곳에서 관리하며, 규제 기관의 질문에 답할 수 있는 접근 제어, 계보 및 감사 기능을 갖춰야 합니다.
  2. 페타바이트 규모, 기가픽셀, 다차원 데이터(2D X-레이, 3D CT/MRI 볼륨, 4D 동적 연구, 기가픽셀 병리 슬라이드)를 문제없이 처리합니다.
  3. 헤더와 픽셀 모두에서 대규모로 비식별화합니다.
  4. 이미징 데이터를 EHR, 유전체학, 파형, 텍스트와 연결하여 단일 연구 질문으로 이 모든 데이터를 활용할 수 있습니다.
  5. 기관 간 공유를 6개월간의 협상이 아닌 구성 단계로 만듭니다.

이것이 레이크하우스의 모습입니다. Databricks에서 작동하는 패턴을 사용하여 실제 적용되는 방식은 다음과 같습니다.

Pixels를 위한 메달리온 아키텍처

이미징을 다루기 쉽게 만드는 사고 모델은 팀이 이미 테이블 형식 데이터에 사용하는 메달리온 패턴과 동일하며, 바이너리 파일에 맞게 조정되었습니다.

  • 브론즈: 원본 연구 데이터는 먼저 제한된 접근 권한의 클라우드 객체 스토리지 또는 Volume에 저장되며, 다른 작업에 앞서 헤더와 픽셀에 대한 비식별화 작업이 실행됩니다. 비식별화된 파일은 Unity Catalog Volumes에서 관리되는 브론즈 레이어를 형성하며, 파일당 하나의 카탈로그 행으로 구성됩니다. Auto Loader가 증분 도착을 처리하여 새로운 연구 데이터가 불안정한 야간 배치 대신 지속적으로 유입됩니다.
  • 실버: 텍스트 값의 DICOM 태그는 Delta 테이블로 추출되며(픽셀 데이터와 같은 바이너리 블롭은 파일에 남아 있음), 파일 내에 갇혀 있던 메타데이터는 일반 SQL로 쿼리할 수 있게 됩니다. 이 단계는 "뷰어가 열 수 있다"를 "분석가가 쿼리할 수 있다"로 바꿉니다. 오픈 소스 Pixels 가속기는 파일을 병렬로 카탈로그화하고 태그를 대규모로 추출하여 이 작업을 정확히 수행합니다.
  • 골드: 임상 및 오믹스 테이블과 결합되어 큐레이션되고 분석 준비가 된 코호트로서, 학습, BI 또는 규제 기관 대상 연구에 사용할 준비가 되어 있습니다.

이것이 간단하지 않은 이유는 처리량 때문입니다. DICOM 파싱 라이브러리는 단일 코어입니다. 핵심은 이를 분산시키는 것입니다. 실제로는 pandas UDF와 mapInPandas를 사용하여 클러스터 전체에 파싱을 분산시키거나, 사용자 지정 Spark 데이터 소스를 사용하는 것을 의미합니다. Pixels 팀이 발표한 작업에서 zipdcm 데이터 소스는 ZIP 아카이브에서 DICOM 메타데이터를 메모리로 직접 읽어와 원본 파일을 압축된 상태로 유지합니다. 이 데이터 소스는 두 개의 8코어 워커에서 약 3.5분 만에 107,000개 이상의 DICOM을 카탈로그화했으며, 이전 접근 방식보다 약 7배 빨랐습니다. 병목 현상이 디스크 및 네트워크 I/O에서 순수 CPU 파싱으로 전환되는데, 이는 클러스터가 잘하는 종류의 작업입니다.

image7.png
그림 2. Pixels 아키텍처: 오픈 소스 Databricks 솔루션 가속기

감사를 통과하는 거버넌스

이미징은 궁극적인 비정형 데이터 거버넌스 문제이며, 대부분의 플랫폼이 조용히 실패하는 요구 사항입니다. Unity Catalog Volumes는 S3, ADLS 또는 GCS의 원본 파일을 3단계 네임스페이스 아래에서 관리하며, 추출된 메타데이터는 Delta에 저장됩니다. 둘 다 데이터로 학습된 모델에까지 이르는 단일 액세스 제어 및 계보 모델 아래에 있어, 몇 달 후에도 "이 코호트를 누가 건드렸고, 무엇이 만들어졌는가"에 답할 수 있습니다. 행 및 열 수준 보안과 속성 기반 규칙을 통해 조직은 비식별화된 메타데이터를 광범위하게 노출하면서도 기본 픽셀은 잠금 상태로 유지할 수 있습니다.

비식별화는 여기서부터 실제적인 문제입니다. 헤더 PHI는 형식 보존 암호화를 통해 처리되므로, 동일한 환자 식별자는 항상 동일한 가명으로 매핑됩니다. 이 세부 사항은 겉보기보다 중요합니다. 이는 환자의 CT가 실제 식별자를 노출하지 않고도 여러 데이터 세트에서 환자의 병리학 및 검사 결과와 여전히 연결될 수 있음을 의미합니다. DICOM 표준의 기밀성 프로필은 제거할 내용과 유지할 내용을 정의합니다. 더 어려운 문제는 픽셀에 새겨진 PHI, 즉 초음파나 스캔된 양식에 포함된 환자 이름입니다. Presidio와 같은 기존 도구는 자유 텍스트를 잘 처리하지만 이미지는 놓칩니다. 새겨진 PHI를 제거하는 것은 활발한 연구 문제입니다. 최근 연구에 따르면 비전-언어 모델은 이제 OCR 전용 파이프라인보다 이를 감지하고 가리는 데 더 뛰어난 성능을 보입니다(Lee et al., Radiology 2025). 또한 DICOM 메타데이터 정리와 새겨진 텍스트에 대한 표적 OCR을 결합한 생산 비식별화 방법은 10가지 양식에 걸쳐 수십만 개의 이미지에서 검증되었습니다(Macdonald et al., 2024). 픽셀의 경우, Pixels 팀은 OCR과 VLM을 결합하고 pandas UDF로 분산 실행되는 비전-언어 모델 파이프라인을 발표했습니다. MIDI-B 벤치마크의 균형 잡힌 샘플에서 GPT-4o와 Claude 3.7 Sonnet은 약 100%의 재현율과 정밀도를 달성했으며, 오픈 소스 Llama 4 Maverick은 비용의 일부로 100% 재현율을 기록했습니다. Spark는 1,000프레임의 비식별화 시간을 105분에서 6분으로 단축했습니다. 팀은 이를 더욱 발전시키기 위해 더 간결한 VLM 전용 접근 방식도 탐색하고 있습니다.

동일하게 관리되는 데이터 기반의 학습 및 서빙

픽셀을 쿼리하고 관리할 수 있게 되면 ML 레이어는 더 이상 어려운 부분이 아닙니다. 분할 및 분류 모델은 MLflow 모델과 동일한 카탈로그에 등록되며, 학습된 정확한 코호트까지의 계보를 가집니다. 특히 이미징의 경우, NVIDIA MONAI 및 VISTA-3D(127개 해부학적 클래스를 다루는 파운데이션 분할 모델)가 자동 분할 및 미세 조정을 위해 플러그인되며, Databricks App에 OHIF 뷰어가 내장되어 방사선 전문의나 병리학자가 플랫폼의 보안 모델 하에서 검토, 수정 및 재라벨링할 수 있습니다.

MONAI Label의 능동 학습 루프는 각 수정이 다음 배치를 개선한다는 것을 의미하며, 이는 팀이 시작하기 전에 완전히 주석이 달린 데이터 세트가 필요하다는 함정에서 벗어나는 방법입니다. 추론은 실시간 GPU 모델 서빙(거의 사용되지 않는 모델이 GPU를 소모하지 않도록 스케일 투 제로) 또는 수백만 건의 연구에 걸친 분산 배치 추론으로 실행됩니다. 그리고 최신 Pixels 작업은 DICOMweb 서비스(QIDO-RS, WADO-RS, STOW-RS)를 제공하므로, 레이크하우스는 별도로 떨어져 있지 않고 임상 또는 PACS/VNA 워크플로우에 직접 통합될 수 있습니다.

안전성 입증: 유효성 검사, 드리프트 및 규제 경로

모델 학습은 시작일 뿐 끝이 아닙니다. 한 사이트의 스캐너에서는 훌륭하게 작동하는 모델이 다른 사이트에서는 조용히 성능이 저하될 수 있으므로, 실제 작업은 사이트, 공급업체 및 프로토콜 전반에 걸친 외부 유효성 검사이며, 스캐너가 업그레이드되고 프로토콜이 프로덕션에서 변경됨에 따라 드리프트를 모니터링하는 것입니다. MLflow는 평가 및 추적을 처리합니다. 더 어려운 규율은 모든 모델을 코호트, 메트릭 및 승인이 첨부된 버전 관리 자산으로 취급하는 것입니다. 임상으로 향하는 모든 것에 대해 규제 기관은 적응형 AI에 대해 중간 지점에서 만나기 시작했습니다. FDA의 사전 결정 변경 제어 계획(PCCP)은 팀이 매번 새로운 제출 없이 모델을 재학습하고 업데이트할 수 있는 방법을 미리 지정할 수 있도록 하며, 우수 기계 학습 관행(GMLP)은 데이터, 유효성 검사 및 모니터링에 대한 기대치를 설정합니다. 이러한 안전 장치를 나중에 추가하는 대신 데이터 기반에 구축하는 것이 데모와 병원이 배포할 수 있는 것을 구분하는 요소입니다.

데이터 이동 없이 협업

EXAM이 필요하다고 보여준 기관 간 다양성을 확보하는 두 가지 보완적인 방법이 있으며, 이들은 서로 다른 문제를 해결합니다.

연합 학습은 데이터를 물리적으로 제자리에 유지하고 모델 가중치만 이동시키며, 연합 평균화를 통해 이를 결합하고 보안 집계 및 차등 프라이버시를 통해 어떤 사이트의 데이터도 외부로 유출되지 않도록 합니다. 이는 데이터가 법적으로 전혀 이동할 수 없을 때 적합한 도구입니다.

레이크하우스는 실제로는 더 간단한 두 번째 옵션을 추가합니다. Delta Sharing 및 Clean Rooms는 기관이 아무것도 복사하지 않고 관리되는 테이블과 파일(또는 비식별화된 코호트에 대한 공동 분석)을 공유할 수 있도록 하며, 데이터 내보내기 대신 자격 증명 제공을 사용합니다. 많은 다중 사이트 연구에서 "코호트의 관리되는 뷰 공유"는 연합 학습 링을 구축하는 것보다 훨씬 가벼운 작업이며, 이 두 가지는 혼합하여 사용할 수 있습니다.

이미징을 다중 모달로 만들기

이는 이미징을 독립적인 양식에서 환자의 일부로 전환시키는 요구 사항입니다. 메타데이터가 Delta이기 때문에 이미징은 EHR의 FHIR 및 HL7 피드, 유전체 변이 테이블, 파형, 임상 텍스트와 결합될 수 있으며, 환자 식별은 가명화 계층을 통해 해결됩니다. OMOP와 같은 공통 데이터 모델은 관찰 데이터가 저장될 공유 스키마를 제공합니다. 또한 Vector Search는 의미 검색을 위한 임베딩을 색인화하며(Pixels는 일반 영어 용어를 올바른 DICOM 태그에 매핑하는 함수도 제공), Genie와 같은 자연어 도구를 통해 과학자는 SQL을 작성하는 대신 요청하여 코호트를 구축할 수 있습니다.

생체 신호 파형은 그 자체로 고유한 데이터입니다. ECG, 동맥압 추적, IVUS 또는 OCT 풀백은 초당 수백 또는 수천 번 샘플링되는 고주파 시계열이며, 일반적으로 DICOM보다는 WFDB와 같은 형식으로 저장됩니다. 기술적인 문제는 정렬입니다. 풀백 프레임이나 ECG 박동은 이미지 및 해당 임상 이벤트와 시간 동기화될 때만 의미가 있습니다. 이를 올바르게 수행하고, 리샘플링하고, 타임스탬프를 조정하고, 연구 옆에 시리즈를 저장하는 것은 환자가 반응했는지 여부가 아니라 '왜' 반응했는지에 대한 질문에 답할 때 정확히 효과를 발휘하는 종류의 조인입니다.

임베딩은 검색보다 더 강력한 것을 가능하게 합니다. 쌍을 이루는 스캔 및 보고서(BiomedCLIP 및 CheXzero 작업 계열)로 훈련된 이미지-텍스트 모델은 이미지와 언어를 공유 벡터 공간에 배치하여 시스템이 유사한 사례를 검색하고, 명시적인 레이블 없이 소견을 표시하거나, 생성 모델을 훈련 데이터만 사용하는 대신 환자의 실제 이미지 및 이전 보고서에 기반을 둘 수 있도록 합니다. 이미지와 보고서에 대한 검색 증강 생성이라는 마지막 패턴은 보고서 초안 작성 및 사례 요약을 임상의에게 보여줄 만큼 신뢰할 수 있게 만듭니다. 모델이 본 것을 지적할 수 있기 때문입니다. 이는 이미지, 보고서 및 해당 임베딩이 하나의 거버넌스 아래 함께 있을 때만 작동하며, 이는 이 전체 내용의 축소판입니다.

이는 새로운 파운데이션 모델의 물결이 필요로 하는 것이기도 합니다. 171,189개의 전체 슬라이드 이미지에서 13억 개의 타일로 자체 지도 학습을 통해 사전 훈련된 Prov-GigaPath (Nature, 2024)는 크고, 다양하며, 거버넌스가 적용되고, 멀티모달인 데이터에서만 작동합니다. 사일로는 이를 공급할 수 없습니다. 레이크하우스는 가능합니다.

성과: 연구자를 위한 공동 과학자, 임상의를 위한 동반자

이 모든 것의 실제적인 버전은 누구도 대체하는 자율 시스템이 아닙니다. 이는 개방형 인터넷이 아닌 기관 자체의 거버넌스 데이터에 기반을 둔 연구자를 위한 AI 공동 과학자이자 임상의를 위한 공동 조종사입니다.

연구자에게 공동 과학자 에이전트는 질문을 작업으로 바꿉니다. "기저 CT, 일치하는 병리 및 EGFR 상태를 가진 치료 경험이 없는 NSCLC 환자를 찾아내고, 추적 관찰 시 병변이 어떻게 변했는지 요약하라"고 요청하면, 에이전트는 단계를 계획하고, Genie 공간을 통해 영상 및 임상 테이블을 쿼리하고, Vector Search로 유사 사례를 검색하고, 분할 엔드포인트를 호출하여 병변을 측정하며, 사용한 데이터로 모든 주장을 추적할 수 있도록 관련 문헌에 요약을 기반합니다.

새롭게 부상하는 "AI 공동 과학자" 시스템은 단순히 조회에 답하는 것을 넘어 가설을 생성하고 분류하는 데 도움을 주는 것을 목표로 합니다. 장난감과 신뢰할 수 있는 협력자를 구분하는 것은 거버넌스가 적용된 멀티모달 데이터에 기반을 두는지 여부입니다.

임상의에게 동일한 시스템은 방사선 전문의나 종양 전문의가 수동으로 수행했을 작업을 대신하는 동반자가 됩니다. 즉, 환자의 이전 기록을 가져오고, 병변을 측정 및 비교하며, 적용되는 가이드라인 기준을 제시하고, 검토를 위한 보고서 초안을 작성합니다. 시스템이 최종 승인하지 않으며, 사람이 합니다. 이는 한계가 아니라 설계입니다. 오늘날 승인된 거의 모든 영상 AI는 인간의 감독을 받으며, 자신의 작업을 보여주고 출처를 인용하는 동반자는 그러한 감독을 형식적인 것이 아닌 실제적인 것으로 만듭니다.

image3.png
그림 3. 모든 R&D를 위한 하나의 거버넌스 기반: 영상, 멀티오믹스, 임상 및 실제 데이터, 파형, 문헌이 동일한 레이크하우스에 있으며, 도메인 간의 조인에 존재하는 가치가 마침내 도달 가능해집니다.

둘 중 어느 것이든 안전하게 만드는 것은 그 밑에 있는 기반입니다. 에이전트가 호출하는 모든 도구는 거버넌스가 적용된 객체, Unity Catalog 함수, 모델 서빙 엔드포인트, Vector Search 인덱스, Genie 공간이므로, 픽셀을 보호하는 것과 동일한 액세스 제어, 계보 및 대리 신원이 에이전트가 보고 수행할 수 있는 것을 제한합니다. 감독자 아래에 방사선 에이전트, 유전체학 에이전트, 의료 업무 에이전트와 같은 전문가들을 구성하면, 에이전트 팀은 데이터 기반이 이미 가능하게 하는 멀티모달 조인을 반영합니다. 기반이 올바르면 동반자는 쉬운 부분입니다.

영상의학을 넘어: 동일한 기반이 나머지 R&D를 지원합니다

이것이 영상의학을 넘어 중요한 이유는 정확히 동일한 아키텍처가 나머지 R&D 데이터 자산을 흡수하기 때문입니다. 멀티오믹스(유전체학, 전사체학, 단백체학, 대사체학)는 영상 및 임상 데이터와 함께 동일한 Unity Catalog에 저장됩니다. 이는 변이체용 VCF, 정렬된 시퀀싱 판독용 BAM 및 CRAM, 상호 운용성을 유지하는 GA4GH 사양, 그리고 인구 규모 분석을 위한 Glow 및 Hail과 같은 엔진과 같은 자체적인 무거운 형식과 표준을 가져오지만, 레이크하우스 패턴은 동일합니다. 즉, 파일을 거버넌스하고, 쿼리 가능한 계층을 추출하며, 다른 모든 것과 조인합니다.

또한 BioNeMo 및 NIM과 같은 NVIDIA 스택이 시퀀스 및 구조 모델을 위해 연결되는 곳이기도 합니다. 실제 데이터 및 임상 시험 데이터, 레지스트리, 파형은 내보내기 없이 영상 코호트에 조인됩니다. 의료 업무 및 문헌은 동일한 거버넌스 및 동일한 AI/BI 및 Genie 표면 아래에서 쿼리 가능한 텍스트가 됩니다. 어떤 환자가 반응하고 왜 반응하는지에 답하는 발전하는 프로그램들은 이러한 도메인 간의 조인에 존재하며, 레이크하우스는 기가픽셀 슬라이드, 변이 호출 및 임상 시험 엔드포인트를 하나의 거버넌스 모델 아래에 보관하고 함께 쿼리할 수 있게 하는 드문 아키텍처입니다.

결론

image2.png

이러한 종류의 데이터 위에 AI 및 GenAI를 구축하는 팀은 계속해서 동일한 교훈을 얻습니다. 모델은 일주일 안에 잘 시연될 수 있습니다. 그 후 몇 달이 걸리는 것은 데이터를 깨끗하게 만들고, 연결하고, 비식별화하며, 과학자나 규제 기관 앞에서 신뢰할 수 있을 만큼 거버넌스를 적용하는 것입니다. 데이터 문제는 프로젝트의 매력적이지 않은 부분이 아닙니다. 그것이 바로 프로젝트입니다.

동일한 조직 내에서 영상, 오믹스, 임상 및 의료 업무 데이터를 종합적으로 볼 때, 결론은 간단합니다. 의료 영상 분야의 최전선은 더 나은 아키텍처가 아닙니다. 더 나은 기반입니다. 알고리즘은 존재합니다. 데이터는 어딘가에 존재합니다. 부족했던 것은 의학이 요구하는 프라이버시와 엄격함을 포기하지 않으면서 영상을 거버넌스하고, 쿼리 가능하며, 연결 가능하고, 공유 가능하게 만들고, 연구 질문이 닿는 다른 모든 것과 조인하는 방법이었습니다.

R&D에서 승리하는 팀은 모델을 먼저 쫓는 팀이 아닐 것입니다. 그들은 데이터를 먼저 올바르게 만들고 AI가 따르도록 하는 팀이 될 것입니다. 그것을 해결하면 모델은 항상 그랬듯이 쉬운 부분이 됩니다.

시작하는 방법

이를 테스트하는 가장 빠른 방법은 자체 데이터를 사용하는 것입니다.

  • 오픈 소스 Pixels 가속기(databricks-industry-solutions/pixels)로 시작하여 DICOM 폴더를 거버넌스가 적용되고 쿼리 가능한 Delta 테이블로 전환하고 메달리온 패턴이 작동하는 것을 확인하세요.
  • Databricks에서 실행하세요. 작업 영역을 시작하고, Unity Catalog 볼륨을 TCIA 또는 MIMIC-CXR과 같은 공개 데이터 세트에 연결한 다음, 보호된 데이터를 가져오기 전에 수집, 비식별화 및 OHIF 뷰어를 엔드투엔드로 설정하세요.
  • 여기에 있는 수치 뒤에 숨겨진 엔지니어링(위에 링크된 7배 수집, VLM 비식별화 및 MONAI/VISTA-3D 설명서)에 대해 더 자세히 알아보세요.
  • 하나의 코호트에서 전체 자산으로 확장하세요. 단일 연구 유형이 수집되고, 비식별화되고, 하나의 임상 테이블에 조인되면, 동일한 패턴이 멀티오믹스, 실제 데이터 및 그 위에 있는 에이전트 계층으로 확장됩니다.

귀하의 팀이 Databricks에서 의료 영상 또는 멀티모달 R&D를 구축하고 있다면, 저자들은 귀하가 어떻게 접근하고 있는지 듣고 싶습니다. 연락하거나 의견을 남겨주세요. 파일럿 단계에서 프로덕션으로 전환할 준비가 되면 Databricks 헬스케어 및 생명 과학 팀이 도움을 드릴 수 있습니다.

(이 글은 AI의 도움을 받아 번역되었습니다. 원문이 궁금하시다면 여기를 클릭해 주세요)

최신 게시물을 이메일로 받아보세요

블로그를 구독하고 최신 게시물을 이메일로 받아보세요.