Scidqa: A deep reading comprehension dataset over scientific papers

저자: Shruti Singh, Nandan Sarkar, Arman Cohan | 날짜: 2024 | DOI: 10.18653/v1/2024.emnlp-main.1163 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

Figure 1

Figure 1: An instance in the SciDQA dataset. The ques-

이 논문은 OpenReview의 피어 리뷰에서 추출한 질문과 저자 답변을 기반으로 2,937개의 QA 쌍으로 구성된 SCIDQA 데이터셋을 제시한다. 기존 scientific QA 데이터셋과 달리 표면적 정보가 아닌 심층적 이해를 요구하는 질문들을 포함하며, 그림·표·수식·다문서 추론 등을 포함한 복잡한 과학 문헌 이해 능력을 평가하도록 설계되었다.

Motivation

Achievement

Figure 2

Figure 2: Dataset curation pipeline for SCIDQA. LLM-

데이터셋 구축: 피어 리뷰 기반 자연 파생 QA 쌍 2,937개 구성, 기존 데이터셋 대비 평균 질문 길이 23.92 단어, 답변 길이 104.67 단어로 상당히 길고 복잡함 / 품질 관리: 7,000개 인스턴스 검토로 41% 관련성 달성, 도메인 전문가 2명이 85% inter-annotator agreement 확보 / 데이터셋 다양성: 약 11%의 질문이 다중 문서 추론 필요, 그림·표·수식 이해 포함 / LLM 평가: 여러 LLM의 성능 편차 식별 및 벤치마크 결과 제시

How

Figure 2

Figure 2: Dataset curation pipeline for SCIDQA. LLM-

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: SCIDQA는 scientific QA 벤치마킹 분야에서 의미 있는 기여를 한다. 피어 리뷰 기반의 자연 파생 데이터, domain experts 간의 실제 상호작용, 그리고 심층 이해를 요구하는 설계가 강점이다. 다만 규모가 제한적이고 ML/DL 분야에만 국한되어 있으며, annotation 비용으로 인한 완전성 부족이 약점이다. 전반적으로 high-quality 리소스로서 과학 논문 이해 연구를 촉진할 잠재력이 충분하다.

같이 보면 좋은 논문

기반 연구화학 QA 데이터셋과 모델을 확장한 연구
기반 연구의료 LLM 평가 방법을 실제 임상 시나리오에 적용한 사례이다.
기반 연구과학 QA 생성 방법을 시각적 추론 평가에 적용한다.
다른 접근표와 그림을 포함한 복잡한 과학 텍스트 이해 평가 방법론이 유사하다.
후속 연구검색 기반 과학 문헌 처리의 방법론적 기초를 제공하는 연구이다.
다른 접근건강 관련 QA의 검색 품질 개선을 위한 대안적 접근이다.
다른 접근동일하게 LMM의 과학적 이해 능력을 평가하는 유사한 벤치마크이다.
다른 접근과학 논문 기반 심층 독해 이해 QA 데이터셋이라는 동일 문제를 다룬다.
다른 접근다중 문서 추론 기반 과학 QA 벤치마크로서 확장 관계에 있다.
다른 접근과학 텍스트 심층 이해를 평가하는 QA 데이터셋으로서 밀접한 관련이 있다.
다른 접근피어리뷰 기반 QA 데이터셋 구축 방법론이 유사하다.
후속 연구SPECTER2 유사도 0.95로 Biomedical AI Knowledge Systems와 Scientific Information Extraction and QA가 맞닿아, 'Scidqa: A deep reading comprehension dataset over scientific papers'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구대규모 학술 문헌 검색 및 인용 기반 응답 생성의 기초가 되는 검색 시스템으로 보인다.
후속 연구SPECTER2 유사도 0.95로 Biomedical AI Knowledge Systems와 Scientific Information Extraction and QA가 맞닿아, 'Scidqa: A deep reading comprehension dataset over scientific papers'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드