⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
Figure 1. The MMCLIMA QA generation pipeline. Textual QA pairs are created from articles and videos via scraping, transc
MMClima는 텍스트, 비디오 전사본, 과학적 figure를 아우르는 104k개 이상의 전문가 검증 QA 쌍으로 구성된 대규모 멀티모달 기후과학 QA 벤치마크로, 자동 claim extraction과 QA synthesis에 human-in-the-loop 검증을 결합해 구축되었다.
Motivation
Known: 기존 climate QA 벤치마크들(Climate-FEVER, Pirá 2.0, ClimaQA 등)은 전문가 검증을 통해 신뢰도를 확보했지만 규모가 작고 대부분 텍스트에 국한되며, 자동 생성 데이터셋(Climate Crisis QA 등)은 규모는 크지만 검증이 부족하다.
Gap: 멀티모달 자원(CPIQA 등)조차 figure의 텍스트 설명이나 RAG 방식에 의존할 뿐 픽셀 수준의 직접적인 figure 추론을 요구하지 않으며, 대규모·멀티모달·엄밀한 검증을 동시에 충족하는 climate QA 벤치마크가 부재하다.
Why: 정책과 인프라 관련 고위험 의사결정에는 수치적으로 정확하고 출처가 명확한 답변이 필요하지만, 범용 LLM/VLM은 subpanel localization, 부호/단위 충실도, event attribution과 같은 세밀한 과제에서 자주 실패하므로 표준화된 멀티모달 climate 평가 체계가 중요하다.
Approach: automated claim extraction과 QA synthesis 파이프라인에 human-in-the-loop 검증을 결합하여 텍스트, 비디오 전사본, figure로부터 5개 핵심 climate science 도메인에 걸친 104k+ QA 쌍을 구축하고, 이를 이용해 최신 멀티모달 언어모델을 벤치마킹한다.
Achievement
Figure 4. Radar plots comparing leading models on (a) textual QA and (b) visual QA. Each axis corresponds to one of the
대규모 데이터셋 구축: 5개 climate 도메인과 다양한 task 형식(MCQ, cloze, free-form, yes/no)을 아우르는 104,902개의 전문가 검증 QA 쌍을 생성했다.
멀티모달 QA 통합: figure 기반 질문을 텍스트 및 video transcription 기반 QA와 체계적으로 결합하여 모달리티 간 평가를 가능하게 했다.
QA 생성 프레임워크 공개: 신규 주제에 대해 확장 가능한 모듈형 파이프라인을 제공하여 claim extraction과 synthesis를 분리함으로써 정확성을 높이고 편향을 줄였다.
대규모 벤치마킹: 28개 LLM과 8개 VLM(오픈소스 및 상용 모델 포함)을 표준화된 프로토콜로 평가했다.
도메인 특화 베이스라인 공개: Llama 3.3 70B를 텍스트 분할에 fine-tuning한 MMCLIMA-70B-TXT가 강력한 오픈/클로즈드 소스 모델들을 텍스트 QA에서 능가함을 보였다.
How
Figure 1. The MMCLIMA QA generation pipeline. Textual QA pairs are created from articles and videos via scraping, transc
5개 climate science 도메인(대기 조성 및 대기질, 해양·연안 역학, 빙권 및 빙하 시스템, 기후 유발 극한 사건, 기후 정책·거버넌스·완화 경로)으로 코퍼스를 조직
Wikipedia 문서와 비디오(YouTube) transcription 등 텍스트 소스를 scraping, chunking하여 claim extraction 수행
추출된 claim으로부터 자동 QA synthesis를 진행하고 human 검증을 통해 신뢰도 확보
과학적 figure 및 큐레이션된 데이터셋으로부터 시각 QA를 파생시키고 human expert와 LLM으로 정제
모든 항목을 single-evidence grounded로 설계하여 출처 추적성과 auditability 보장
텍스트 분할에 대해 Llama 3.3 70B를 fine-tuning하여 MMCLIMA-70B-TXT 베이스라인 생성
Originality
기존 벤치마크와 달리 텍스트, video transcription, figure를 통합한 최초의 대규모(104k+) 멀티모달 climate QA 데이터셋을 제시
기반 연구SPECTER2 유사도 0.94로 Biomedical AI Knowledge Systems와 Scientific Information Extraction and QA가 맞닿아, 'BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.