Can Large Language Models Truly Forget Scientific Claims? A Systematic Evaluation of Claim Level Unlearning

저자: Snigdha Paul, Manasi Patwardhan, Arman Cohan | 날짜: 2026 | URL: https://openreview.net/forum?id=MSVaNxefVs 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. SciUnlearn Dataset generation pipeline.

본 논문은 과학 논문에서 추출된 claim이 여러 QA 형태(MCQ, T/F, FB, AR)로 표현될 때 기존 machine unlearning 기법들이 표면적 형태만 억제할 뿐 근본적인 claim-level 지식을 제거하지 못함을 보이는 새로운 태스크(Scientific Claim Unlearning)와 벤치마크(SciUnlearn)를 제안한다.

Motivation

Achievement

Figure 3

Figure 3. Failure case demonstrating the persistence of invalidated scientific knowledge in language models (OLMO-3-7B-I

  1. Scientific Claim Unlearning 태스크 정식화: forget set(F1, F2)과 retain set(Rext, Rint)을 활용해 claim이 실제로 제거되었는지, 아니면 특정 QA 형태만 억제되었는지를 교차 검증하는 평가 프레임워크(Equation 1)를 제시했다.
  2. SciUnlearn 벤치마크 구축: Dolma 코퍼스 기반 76개 anchor 논문에서 170개 claim, 1,072개 QA 쌍(F1/F2/Rext/Rint)을 구축했으며, LLM-as-judge와 전문가 평가 간 상관관계(weighted Cohen's kappa)를 통해 claim 추출 품질을 검증했다.
  3. 기존 unlearning 알고리즘의 한계 실증: GD, NPO, NPO+RT, SimNPO 등 대표적 unlearning 방법들을 OLMo-3-7B-Instruct에 적용한 결과, 이들이 표면적 억제(surface-level suppression)에 그치고 disjoint forget set(Fj)에 대한 일반화에 실패함을 보여 claim-level unlearning이 표준 fact unlearning보다 근본적으로 더 어려움을 입증했다.

How

Figure 2

Figure 2. Example claim and QA in SciUnlearn dataset.

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 과학적 claim의 구조적, 다면적 특성을 고려한 새로운 unlearning 태스크와 벤치마크를 제시하여 기존 unlearning 기법의 근본적 한계를 실증적으로 드러낸 의미 있는 연구이며, 향후 구조화된 지식 제거 알고리즘 개발의 토대를 제공한다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Scientific Information Extraction and QA가 맞닿아, 'Investigating zero-and few-shot generalization in fact verification'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Scientific Information Extraction and QA가 맞닿아, 'Robust claim verification through fact detection'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 Scientific Information Extraction and QA가 맞닿아, 'Sciclaimhunt: A large dataset for evidence-based scientific claim verification'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구지식 편집/제거 기법의 이론적 기반을 공유함
다른 접근machine unlearning의 한계를 다루는 유사한 문제의식을 공유한다
후속 연구claim-level 지식 제거 평가를 확장하는 후속 연구로 판단됨
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드