HEARTS: Benchmarking LLM Reasoning on Health Time Series

저자: Sirui Li, Shuhan Xiao, Mihir Joshi, Ahmed Metwally, Daniel McDuff, Wei Wang, Yuzhe Yang | 날짜: 2026 | URL: https://openreview.net/forum?id=qj4EnIvNU4 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Overview of HEARTS. We present the first diverse benchmark for health time-series reasoning, encompassing 20 s

HEARTS는 건강 관련 time series에 대한 LLM의 계층적 추론 능력을 평가하기 위한 통합 벤치마크로, 16개 실세계 데이터셋, 12개 건강 도메인, 20개 신호 모달리티를 아우르며 Perception, Inference, Generation, Deduction 4개 범주의 110개 태스크를 정의한다.

Motivation

Achievement

Figure 4

Figure 4. Performance comparison of state-of-the-art ML meth-

  1. 최초의 다양한 헬스 time series 추론 벤치마크 구축: 12개 건강 도메인, 20개 신호 모달리티, 110개 태스크를 아우르며 sequence length·frequency·time span 커버리지 측면에서 기존 벤치마크를 능가한다.
  2. 계층적 4단계 평가 체계 제안: 단순 계산부터 장기 통합·counterfactual deduction까지 MCQ를 넘어선 통합적 평가 설정을 도입했다.
  3. 16개 LLM 대규모 실험으로 핵심 한계 규명: LLM이 특화 모델 대비 크게 뒤처지고, 성능이 일반 추론 점수와 약한 상관관계만 보이며, 단순 휴리스틱에 의존하고 다단계 시간적 추론에 취약함을 보였다.
  4. 모델군에 걸친 일관된 스케일링 난제 확인: 입력 길이, 샘플링 빈도, 시간 범위가 커질수록 성능이 저하되는 model-agnostic 패턴을 규명해, 단순 scaling만으로는 문제 해결이 어렵다는 점을 실증했다.

How

Figure 2

Figure 2. Task and domain distributions in HEARTS.

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 헬스 time series 추론이라는 중요하지만 저평가된 영역에서 포괄적이고 체계적인 벤치마크를 제시해 LLM의 실질적 한계를 명확히 드러낸 의미 있는 연구이며, living benchmark로서의 확장성도 기대되나 세부 평가 방법론과 실패 원인 분석의 깊이는 추가 검증이 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.91로 Clinical Time-Series Modeling와 Scientific Information Extraction and QA가 맞닿아, 'Large Language Models are Zero Shot Hypothesis Proposers'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 Clinical Time-Series Modeling와 Scientific Information Extraction and QA가 맞닿아, 'Large language models for zero-shot inference of causal structures in biology'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 Clinical Time-Series Modeling와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'MedAgentGym: A Scalable Agentic Training Environment for Code-Centric Reasoning in Biomedical Data Science'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구zero-shot 위험 예측이라는 실제 임상 문제에 시계열 생성 모델을 적용한다.
기반 연구강화학습 기반 보상 설계를 확장한 연구이다.
기반 연구생체신호 데이터에 TSFM을 적용한 유사 응용 연구이다.
후속 연구계층적 추론 평가 프레임워크를 확장한 후속 벤치마크 연구이다.
기반 연구SPECTER2 유사도 0.92 기준으로 'HEARTS: Benchmarking LLM Reasoning on Health Time Series'의 AI4S 방법론을 'MedResearchBench: A Multi-Domain Benchmark for Evaluating AI Research Agents on Clinical Medical Research'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
다른 접근의료 음성/오디오 처리에 대한 유사한 벤치마크 접근이다.
다른 접근LLM의 건강 도메인 추론 능력을 평가하는 유사한 벤치마크 접근법을 제시한다.
다른 접근다른 도메인의 LLM 추론 벤치마크로 유사한 평가 체계를 제안한다.
다른 접근건강 관련 데이터에 대한 다중 모달 추론 벤치마크라는 유사한 평가 프레임워크를 제시한다.
다른 접근의료 신호/이미지에 대한 모델 평가라는 공통 주제를 다룬다.
다른 접근의료 도메인에서 LLM/MLLM의 실패 원인을 분석한다는 점에서 유사한 문제의식을 공유한다.
후속 연구공간 추론 벤치마크 설계의 방법론적 기반을 공유함
응용 사례건강 시계열 데이터에 대한 LLM 적용 사례를 다룬다는 점에서 관련성이 높다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드