⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
Figure 1. SciUnlearn Dataset generation pipeline.
본 논문은 과학 논문에서 추출된 claim이 여러 QA 형태(MCQ, T/F, FB, AR)로 표현될 때 기존 machine unlearning 기법들이 표면적 형태만 억제할 뿐 근본적인 claim-level 지식을 제거하지 못함을 보이는 새로운 태스크(Scientific Claim Unlearning)와 벤치마크(SciUnlearn)를 제안한다.
Motivation
Known: 기존 machine unlearning 연구는 TOFU, MUSE, WMDP, RWKU 등 벤치마크를 통해 개인정보나 저작권, 유해 지식 제거를 위한 forget-retain 패러다임을 확립했으며, gradient-based(GD), preference-based(NPO, SimNPO) 등 다양한 알고리즘이 instance-level 사실 삭제에 사용되어 왔다.
Gap: 과학적 claim은 구조적이고 다면적이며(paraphrase, 여러 QA 형태로 표현) 상호 연결되어 있고 시간에 따라 진화하는 특성을 가지지만, 기존 unlearning 연구는 instance-level forgetting에만 초점을 맞추어 claim-level 지식이 실제로 제거되는지, 아니면 표면적 형태만 억제되는지를 체계적으로 평가하지 못했다.
Why: 철회되거나 반박되거나 재현 불가능한 것으로 밝혀진 과학적 주장이 LLM에 내재화되어 있으면 가설 생성, 문헌 검토, claim verification 등 하위 과학 응용에서 잘못된 지식이 지속적으로 전파될 위험이 있으며, 이를 선택적으로 제거하는 능력은 신뢰할 수 있는 과학 보조 AI 구축에 필수적이다.
Approach: 저자들은 Scientific Claim Unlearning이라는 새로운 태스크를 정의하고, 동일 claim에서 파생된 서로 다른 paraphrase 기반 forget set(F1, F2)과 두 종류의 retain set(Rext, Rint)으로 구성된 SciUnlearn 벤치마크를 구축하여, 기존 unlearning 알고리즘들이 claim-level 일반화 실패를 보이는지 체계적으로 평가한다.
Achievement
Figure 3. Failure case demonstrating the persistence of invalidated scientific knowledge in language models (OLMO-3-7B-I
Scientific Claim Unlearning 태스크 정식화: forget set(F1, F2)과 retain set(Rext, Rint)을 활용해 claim이 실제로 제거되었는지, 아니면 특정 QA 형태만 억제되었는지를 교차 검증하는 평가 프레임워크(Equation 1)를 제시했다.
SciUnlearn 벤치마크 구축: Dolma 코퍼스 기반 76개 anchor 논문에서 170개 claim, 1,072개 QA 쌍(F1/F2/Rext/Rint)을 구축했으며, LLM-as-judge와 전문가 평가 간 상관관계(weighted Cohen's kappa)를 통해 claim 추출 품질을 검증했다.
기존 unlearning 알고리즘의 한계 실증: GD, NPO, NPO+RT, SimNPO 등 대표적 unlearning 방법들을 OLMo-3-7B-Instruct에 적용한 결과, 이들이 표면적 억제(surface-level suppression)에 그치고 disjoint forget set(Fj)에 대한 일반화에 실패함을 보여 claim-level unlearning이 표준 fact unlearning보다 근본적으로 더 어려움을 입증했다.
How
Figure 2. Example claim and QA in SciUnlearn dataset.
Dolma 코퍼스(Semantic Scholar 38.8M 논문)에서 2018-2022년 오픈 액세스 컴퓨터과학 논문 100편을 샘플링
GPT-5를 이용해 각 논문의 abstract, introduction, conclusion에서 1-5개의 paraphrase claim(총 219개) 추출
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Scientific Information Extraction and QA가 맞닿아, 'Investigating zero-and few-shot generalization in fact verification'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Scientific Information Extraction and QA가 맞닿아, 'Robust claim verification through fact detection'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 Scientific Information Extraction and QA가 맞닿아, 'Sciclaimhunt: A large dataset for evidence-based scientific claim verification'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.