저자: Shruti Singh, Nandan Sarkar, Arman Cohan | 날짜: 2024 | DOI: 10.18653/v1/2024.emnlp-main.1163 📄 PDF
Figure 1: An instance in the SciDQA dataset. The ques-
이 논문은 OpenReview의 피어 리뷰에서 추출한 질문과 저자 답변을 기반으로 2,937개의 QA 쌍으로 구성된 SCIDQA 데이터셋을 제시한다. 기존 scientific QA 데이터셋과 달리 표면적 정보가 아닌 심층적 이해를 요구하는 질문들을 포함하며, 그림·표·수식·다문서 추론 등을 포함한 복잡한 과학 문헌 이해 능력을 평가하도록 설계되었다.
Figure 2: Dataset curation pipeline for SCIDQA. LLM-
데이터셋 구축: 피어 리뷰 기반 자연 파생 QA 쌍 2,937개 구성, 기존 데이터셋 대비 평균 질문 길이 23.92 단어, 답변 길이 104.67 단어로 상당히 길고 복잡함 / 품질 관리: 7,000개 인스턴스 검토로 41% 관련성 달성, 도메인 전문가 2명이 85% inter-annotator agreement 확보 / 데이터셋 다양성: 약 11%의 질문이 다중 문서 추론 필요, 그림·표·수식 이해 포함 / LLM 평가: 여러 LLM의 성능 편차 식별 및 벤치마크 결과 제시
Figure 2: Dataset curation pipeline for SCIDQA. LLM-
총평: SCIDQA는 scientific QA 벤치마킹 분야에서 의미 있는 기여를 한다. 피어 리뷰 기반의 자연 파생 데이터, domain experts 간의 실제 상호작용, 그리고 심층 이해를 요구하는 설계가 강점이다. 다만 규모가 제한적이고 ML/DL 분야에만 국한되어 있으며, annotation 비용으로 인한 완전성 부족이 약점이다. 전반적으로 high-quality 리소스로서 과학 논문 이해 연구를 촉진할 잠재력이 충분하다.