Seizure-Semiology-Suite($S^3$): A Clinically Multimodal Dataset, Benchmark, and Models for Seizure Semiology Understanding

저자: Lina Zhang, Tonmoy Monsoor, Peizheng Li, Jiarui Cui, Xinyi Peng, Chong Han, Prateik Sinha, Siyuan Dai, Jessica Nichole Pasqua, Colin M McCrimmon, Weiting Liu, Hailey Marie Miranda, Bing Hu, Xiangting Wu, Tengyou Xu, Chunhan Li, Jiaye Tian, Jiarui Tang, Detao Ma, Lingye Kong, Junnan Lyu, Jungang Li, Yan Zan, Junhua Huang, Rajarshi Mazumder, Vwani Roychowdhury | 날짜: 2026 | URL: https://openreview.net/forum?id=MyorUlHKVc 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

발작 비디오에서 ILAE 정의 20개 semiological feature를 세밀하게 이해하고 진단까지 이어지는 능력을 평가하기 위해, 438개 발작 비디오와 35,000개 이상의 dense label로 구성된 Seizure-Semiology-Suite(S³) 데이터셋과 7-task hierarchical benchmark, 그리고 Seizure-RQI라는 임상적으로 의미 있는 report 평가 지표를 제안한다.

Motivation

Achievement

Figure 2
  1. 대규모 임상 데이터셋 구축: 116명 환자로부터 438개 발작 비디오와 35,000개 이상의 dense label(20개 ILAE semiological feature)을 갖춘 최초의 대규모 expert-supervised 발작 semiology 데이터셋을 구축했다.
  2. 7-task hierarchical benchmark 및 Seizure-RQI 제안: perception부터 clinical reasoning까지 MLLM 능력을 체계적으로 측정하는 benchmark와 report 품질을 임상적으로 평가하는 Seizure-RQI를 도입했다.
  3. 11개 open-weight MLLM 벤치마킹: laterality reasoning, temporal localization, symptom sequencing, faithful report generation에서의 체계적 실패 양상을 규명했다.
  4. Fine-tuning 및 neuro-symbolic framework를 통한 성능 개선: seizure-specific fine-tuning으로 전반적 성능을 크게 향상시켰고, two-stage neuro-symbolic framework로 epileptic vs non-epileptic seizure classification에서 F1 0.96을 달성했다.

How

Figure 2

Originality

Limitation & Further Study

Evaluation

Novelty: 5/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 5/5

총평: 임상적으로 매우 중요하지만 그동안 간과되어온 발작 semiology에 대한 MLLM 평가라는 공백을 체계적으로 메운 의미 있는 연구로, 데이터셋·benchmark·평가지표·모델 개선까지 포괄적인 기여를 담고 있어 safety-critical 의료 video understanding 분야에 실질적인 이정표가 될 것으로 평가된다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.90 기준으로 'Seizure-Semiology-Suite($S^3$): A Clinically Multimodal Dataset, Benchmark, and Models for Seizure Semiology Understanding'의 AI4S 방법론을 'MOLIERE: Automatic Biomedical Hypothesis Generation System'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구SPECTER2 유사도 0.90로 Biomedical AI Knowledge Systems와 Scientific Information Extraction and QA가 맞닿아, 'A Review on Scientific Knowledge Extraction using Large Language Models in Biomedical Sciences'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 Biomedical AI Knowledge Systems와 Scientific Information Extraction and QA가 맞닿아, 'Cchall: A novel benchmark for joint cross-lingual and cross-modal hallucinations detection in large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근LLM 환각 문제에 대한 유사한 평가 프레임워크
기반 연구SPECTER2 유사도 0.90로 Biomedical AI Knowledge Systems와 Scientific Information Extraction and QA가 맞닿아, 'Toward Reliable Scientific Hypothesis Generation: Evaluating Truthfulness and Hallucination in Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구dense label 기반 비디오 이해 데이터셋 구축의 기초를 제공하는 연구로 판단됨
다른 접근임상 멀티모달 데이터셋을 통한 세밀한 의료 라벨링이라는 유사한 접근을 다룬다.
후속 연구세밀한 라벨링 기반 진단 시스템 구축을 확장하는 후속 연구로 볼 수 있다
응용 사례임상 도메인에서의 멀티모달 데이터 활용 사례로 실제 적용 측면에서 연관성이 있다
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드