⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
Figure 1. Overview of the study. Symptom keywords are expanded into Korean search queries, converted to Naver/Google RSV
과거 환자 수 데이터 없이 온라인 증상 검색량(RSV)만으로 rhinovirus 등 호흡기 바이러스 환자 수를 예측할 수 있는지 검증한 사례 연구로, LLM 기반 증상 쿼리 확장을 통해 Naver/Google RSV 데이터셋을 구축하고 여러 time-series backbone으로 RSV-only 예측이 patient-history baseline과 비견되는 성능을 보임을 확인했다.
Motivation
Known: 공식 호흡기 바이러스 감시 데이터(KDCA sentinel surveillance)는 신뢰도가 높지만 비용이 크고 보고 지연이 존재하며, 온라인 검색 활동(RSV)은 인플루엔자 등 다른 전염병에 대해 syndromic surveillance 신호로 활용된 선례가 있다.
Gap: 기존 forecasting backbone은 대부분 target의 자기 과거값(endogenous history)을 이용해 예측하는 형태로 설계되어, 최신 환자 수 데이터가 지연되어 없는 실제 운영 상황에서는 적용이 어렵다는 operational gap이 존재한다.
Why: 환자 수 보고 지연 상황에서 검색 트렌드만으로도 조기 경보(early-warning)가 가능한지 확인하는 것은 인력 배치, 병상 배정, 감염 관리 등 실제 공중보건 의사결정에 시급성과 비용 효율성을 제공할 수 있어 중요하다.
Approach: 270주 분량의 KDCA 감시 데이터와 LLM(GPT-4o)로 확장한 증상 쿼리에 대한 Naver/Google RSV를 정렬하여 구조화 데이터셋을 구축하고, 예측 시점에 환자 이력 없이 RSV 이력만을 입력으로 사용하는 다양한 time-series backbone을 학습·평가하는 rhinovirus 사례 연구를 수행했다.
Achievement
Figure 4. Representative held-out forecasts for rhinovirus using
LLM-assisted 증상 쿼리 확장 파이프라인 구축: GPT-4o를 이용해 임상 증상 용어를 구어체·철자·띄어쓰기 변형을 포함한 3,336개의 고유 검색어로 확장하고, Naver DataLab과 Google Trends에서 RSV를 수집해 KDCA 감시 주차와 정렬했다.
RSV-to-patient 예측 프레임워크 정식화: x1:T → yT+1:T+H 형태로 문제를 정의하고, patient-history 없이 RSV 이력만을 예측 시점 입력으로 사용하는 20개 backbone(DLinear, iTransformer, Mamba, LSTM, GRU 등)을 평가했다.
조기 경보 실현 가능성 입증: 상관관계 스크리닝(ρ≥0.3)으로 선별된 rhinovirus 후보 키워드(Google 16개, Naver 97개)를 이용한 RSV-only 예측이 여러 backbone에서 patient-history baseline과 비슷하거나 더 나은 성능을 달성함을 held-out 테스트를 통해 보였다.
How
Figure 2. Example rhinovirus surveillance and search-trend time se-
KDCA 주간 호흡기 감염 감시 데이터(2019년 10월~2024년 12월, 270주)를 rhinovirus, parainfluenza, RSV(respiratory syncytial virus) 대상으로 수집하고 70%/10%/20% chronological train/validation/test split을 적용
GPT-4o를 활용해 초기 증상 키워드를 바이러스·증상 그룹별로 조직화한 뒤 동의어 및 철자/띄어쓰기 변형으로 확장하는 LLM-assisted query expansion 수행 (LLM은 쿼리 생성에만 사용, 예측·평가는 결정론적 파이프라인 사용)
Naver DataLab(일별 상대 비율을 주간으로 평균)과 Google Trends(주간 0–100 지수, 한국/한국어 로케일)에서 source-query별 RSV 시계열 수집 후 KDCA 감시 주차에 정렬하여 long-format 테이블을 구성하고 weekly matrix X(v)로 피벗
5회 이상 nonzero 관측치를 가진 시리즈만 필터링하고, 전체 기간에 대한 Pearson 상관관계(ρ≥0.3)를 이용한 retrospective screening으로 후보 키워드 풀 축소 (rhinovirus: Google 16개, Naver 97개 컬럼)
문제를 x_{t-L+1-s:t-s} (RSV) → y_{t+1:t+H} (patient count)로 정식화하고, L=48주, H∈{1,2,4,8}, lag shift s∈{0,1,2,3}에 대해 grid-search 수행
DLinear, iTransformer, Mamba, LSTM, GRU를 포함한 20개 대표 time-series backbone으로 RSV-only 예측과 patient-history baseline을 비교 평가하고, 최대 상관 lag를 이용한 descriptive keyword 분석 수행
Originality
인플루엔자 등에 국한되었던 기존 search-based syndromic surveillance 연구와 달리, 한국어 검색 환경(Naver+Google)에서 rhinovirus에 특화된 사례 연구를 수행
LLM(GPT-4o)을 활용해 임상 용어와 대중 검색 어휘 간 불일치를 해소하는 자동화된 증상 쿼리 확장 파이프라인을 제안
기존 endogenous forecasting 패러다임과 달리, 예측 시점에 patient count 이력을 전혀 사용하지 않는 RSV-only 입력 설정(x1:T→yT+1:T+H)을 명시적으로 정식화하여 조기 경보 실현 가능성을 검증
상관관계 기반 스크리닝을 retrospective filter로만 사용하고 실제 평가는 held-out forecasting error로 분리하는 방법론적 엄밀성을 제시
Limitation & Further Study
상관관계 기반 키워드 선별(ρ≥0.3)이 전체 기간 데이터를 사용한 retrospective screening이므로, 실제 prospective 운영 환경에서는 이 필터를 그대로 적용할 수 없다는 한계가 저자들도 인정하는 부분이다.
단일 국가(한국), 단일 바이러스(rhinovirus)에 국한된 사례 연구로 일반화 가능성이 제한적이며, parainfluenza·RSV는 descriptive 수준에서만 다뤄져 충분한 검증이 부족하다.
270주(약 5년)라는 비교적 짧은 기간과 두 검색 플랫폼(Naver, Google)에만 의존하여 다른 지역/플랫폼/바이러스로의 외적 타당성 검증이 필요하다.
향후 연구로 prospective 실시간 검증, 다양한 바이러스·국가로의 확장, 그리고 RSV와 patient history를 결합한 하이브리드 모델링이 제안될 수 있다.
총평: 공중보건 조기 경보라는 실용적 문제를 명확한 문제 정식화와 신중한 방법론(retrospective screening과 held-out 평가의 분리)으로 다룬 흥미로운 feasibility study이나, 단일 바이러스·단일 국가에 국한된 workshop-scale 사례 연구로서 일반화 가능성과 실제 prospective 검증이 추가로 필요하다.
기반 연구SPECTER2 유사도 0.91로 Clinical Time-Series Modeling와 Scientific AI for Physics and Environment가 맞닿아, 'Learning skillful medium-range global weather forecasting'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.90로 Clinical Time-Series Modeling와 Scientific Information Extraction and QA가 맞닿아, 'A Survey on RAG Meeting LLMs: Towards Retrieval-Augmented Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 Clinical Time-Series Modeling와 Applied Bibliometrics Across Domains가 맞닿아, 'Opinion: Research hotspots and global trends in respiratory syncytial virus over past five years'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 Clinical Time-Series Modeling와 AI-Driven Drug and Materials Discovery가 맞닿아, 'ViraHinter: A Dual-Modal Artificial Intelligence Framework for Predicting Virus-Host Interactions'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.