TwinWeaver: An LLM-Based Foundation Model Framework for Pan-Cancer Digital Twins
저자: Nikita Makarov, Maria Bordukova, Lena Voith von Voithenberg, Estrella Pivel-Villanueva, Sabrina J Mielke, Jonathan Wickes, Hanchen Wang, Mingyu Derek Ma, Keunwoo Choi, Kyunghyun Cho, Stephen Ra, Raul Rodriguez-Esteban, Fabian Schmich, Michael Patrick Menden | 날짜: 2026 | URL: https://openreview.net/forum?id=oWqRhYpJb6📄 PDF
⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
Figure 1. The TwinWeaver framework serializes longitudinal patient histories into text to train the Genie Digital Twin (
TwinWeaver는 종단적 환자 기록을 텍스트로 직렬화해 LLM이 임상 이벤트 예측과 시계열 예측을 통합적으로 수행하도록 하는 프레임워크이며, 이를 이용해 93,054명, 20개 암종 데이터로 Genie Digital Twin(GDT)을 구축해 기존 baseline 대비 우수한 forecasting 및 risk stratification 성능을 보였다.
Motivation
Known: Cox Proportional Hazards, Random Survival Forests(RSF), deep survival model과 같은 고전적 방법들은 clinical event prediction에 사용되어 왔고, DT-GPT, EHR2Path, CLMBR-T, MOTOR, SCOPE, ETHOS 등 최근 EHR foundation model들은 dynamic trajectory forecasting과 event prediction으로 발전해왔다. 또한 Chronos, TiDE 등 time-series foundation model과 Gruver et al.의 LLM 기반 수치 시계열 예측 연구도 존재한다.
Gap: 기존 EHR foundation model들은 고정된 code 기반 vocabulary에 의존해 out-of-distribution 적응성과 유전체 데이터 같은 복합 modality 통합이 제한적이며, forecasting과 event prediction을 분리해서 다루어 정보 손실이 발생한다. 또한 GenHPF와 Foresight 같은 텍스트 기반 접근은 유연성은 있으나 수치 forecasting 능력이나 사전 정의된 outcome 분류에 국한된다.
Why: 정밀 종양학(precision oncology)에서 임상 이벤트와 궤적을 통합적으로 예측할 수 있는 모델은 희소하고 다중 모달인 실세계 임상 데이터를 다루는 데 필수적이며, 이는 환자 맞춤형 치료 결정과 임상시험 설계에 직접적인 영향을 미칠 수 있다.
Approach: longitudinal 환자 기록(정적 속성, 시계열 이벤트, 유전자 데이터 등)을 텍스트 프롬프트로 직렬화하여 LLM을 fine-tuning함으로써, 하나의 통합 모델이 연속 바이오마커 forecasting과 이산적 landmark clinical event prediction을 동시에 수행하도록 한다.
Achievement
Figure 3. GDT demonstrates improved risk stratification in predicting survival, progression, and switching therapy, whil
Forecasting 오차 감소: GDT는 median MASE 0.87을 달성해 최강 time-series baseline의 0.97 대비 유의하게(p<0.001) 낮은 오차를 보였다.
Risk stratification 개선: survival, progression, therapy switching 과제 전반에서 평균 C-index 0.703으로 최고 baseline의 0.662를 능가했다.
Out-of-distribution 일반화: 훈련되지 않은 clinical trial 데이터에 대해 zero-shot으로 기존 훈련된 baseline과 동등한 성능을, fine-tuning 후에는 이를 능가하는 성능(median MASE 0.75–0.88, 평균 C-index 0.672 vs 0.648)을 보였다.
해석 가능한 reasoning 확장: reinforcement learning 기반의 해석 가능한 clinical reasoning 확장을 통해 예측의 투명성을 높였다.
How
Figure 1. The TwinWeaver framework serializes longitudinal patient histories into text to train the Genie Digital Twin (
Flatiron Health-Foundation Medicine Clinico-Genomic Database(FH-FMI CGDB)에서 93,054명, 20개 암종의 real-world oncology 환자 데이터를 수집
환자 데이터를 정적 속성 sp와 timestamp, event, value로 구성된 관측 이력 Hp로 정의하고, therapy 시작일 등 critical time point에서 궤적을 분할해 input-target 쌍 생성
forecasting task: 관측 빈도와 volatility에 비례해 가중 샘플링된 변수 부분집합 V'에 대해 미래 시점 tforecast까지의 값을 예측 대상으로 설정, 미측정 값과 신규 competing event는 결측으로 처리
landmark events task: 이산적 임상 이벤트(사망, 신규 치료 등) 예측을 별도 과제로 설계
이 input-target 쌍을 procedurally generated 텍스트 프롬프트로 변환하여 사전학습된 LLM을 fine-tuning
학습된 GDT를 clinical trial 데이터에 대해 zero-shot 및 supervised fine-tuning(SFT)으로 평가하여 OOD 일반화 성능 검증
reinforcement learning 기반 reasoning 확장을 추가해 <thinking> 및 <prognosis_summary> 형태의 해석 가능한 출력 생성
Originality
임상 event prediction과 시계열 forecasting을 하나의 통합된 LLM 기반 프레임워크(TwinWeaver)로 결합한 최초의 시도 중 하나로, 기존 연구들이 두 과제를 분리하거나 forecast 가능한 변수 수·시간적 범위에 제약이 있던 것과 차별화됨
고정된 code 기반 vocabulary 대신 텍스트 직렬화를 통해 유전자 데이터 등 복합 modality를 유연하게 통합
pan-cancer 규모(93,054명, 20개 암종)의 real-world 데이터로 foundation model을 구축하고 이를 out-of-distribution clinical trial에 zero-shot/fine-tuning으로 일반화 검증
reinforcement learning 기반 해석 가능한 reasoning 출력을 결합해 투명성을 강화한 확장 제시
Limitation & Further Study
본문 발췌에서는 모델 아키텍처(구체적 LLM backbone), reasoning 확장의 RL 알고리즘 세부사항, 그리고 텍스트 직렬화의 구체적 프롬프트 설계가 충분히 드러나지 않아 재현성 평가가 제한적임
FH-FMI CGDB라는 특정 데이터셋에 의존하므로 다른 의료 시스템이나 국가의 EHR 데이터에 대한 일반화 가능성은 추가 검증이 필요함
LLM 기반 텍스트 forecasting의 context 길이 제약으로 변수 subsampling이 필요했는데, 이는 특정 희귀 변수나 장기 궤적 예측에서 정보 손실을 유발할 가능성이 있음
후속 연구로 다양한 의료기관 데이터에 대한 외부 검증, reasoning 출력의 임상적 신뢰도 정량 평가, 그리고 더 많은 modality(영상, 병리 등) 통합이 필요함
총평: 대규모 real-world pan-cancer 데이터를 활용해 forecasting과 event prediction을 통합한 LLM 기반 digital twin 프레임워크를 제시하고 OOD 일반화까지 검증한 견고한 연구로, precision oncology 분야에 실질적 기여를 할 것으로 판단된다.
기반 연구SPECTER2 유사도 0.93로 Clinical Time-Series Modeling와 Scientific Information Extraction and QA가 맞닿아, 'BioMedLM: A 2.7B Parameter Language Model Trained on Biomedical Text'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Clinical Time-Series Modeling와 Scientific Information Extraction and QA가 맞닿아, 'ClinicalGPT-R1: Pushing reasoning capability of generalist disease diagnosis with large language model'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Clinical Time-Series Modeling와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'MedAgentGym: A Scalable Agentic Training Environment for Code-Centric Reasoning in Biomedical Data Science'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Clinical Time-Series Modeling와 LLMs for Molecular Biology & Chemistry가 맞닿아, 'Quantifying large language model usage in scientific papers'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.