⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
SafeSci는 과학 분야 LLM의 안전성을 평가하고 향상시키기 위한 프레임워크로, safety knowledge와 safety risk를 명확히 구분하고 objective metric을 사용하는 대규모 벤치마크 SafeSciBench(0.25M 샘플)와 안전성 강화용 학습 데이터셋 SafeSciTrain(1.5M 샘플)로 구성된다.
Motivation
Known: 기존 연구들은 LLM의 과학 도메인 활용 능력이 뛰어남을 보였으나, 이에 따른 오남용 및 안전 위험 우려도 제기되어 여러 scientific safety benchmark(SciKnowEval, SOSBench, SciSafeEval, WMDP 등)가 제안되어 왔다.
Gap: 기존 벤치마크는 safety knowledge와 safety risk 중 한쪽에 치우쳐 있고, 전문적 과학 추론보다는 일반적 악의적 의도에 초점을 맞추며, LLM-as-a-Judge 방식으로 인한 주관적 편향과 PubChem·ChEMBL 등 학습 데이터 오염(data contamination) 문제를 안고 있어 종합적이고 객관적인 평가가 어렵다.
Why: 과학 분야에 특화된 LLM의 안전성 결함을 정확히 진단하고 개선하는 것은 실제 배포 시 오용 및 의도치 않은 피해를 방지하기 위한 필수적 과제이며, 신뢰할 수 있는 벤치마크가 이러한 진단과 향상의 토대가 된다.
Approach: SafeSci는 safety knowledge와 safety risk를 명시적으로 구분하고, MCQ·TFQ·구조화된 분자 생성 등 deterministic한 objective metric을 채택하며, database interacting과 task diversifying을 통해 data contamination을 완화하는 원칙 기반 프레임워크를 제안한다.
Achievement
SafeSciBench 구축: chemistry, biology, medicine, materialogy, engineering, physics, psychology 등 7개 분야 125개 태스크에 걸쳐 25만 개 샘플을 포함하는 다학제 안전성 벤치마크를 제안했다.
SafeSciTrain 구축: 150만 개 샘플 규모의 안전성 강화 학습 데이터셋을 구축하여 fine-tuning을 통한 안전 정렬(safety alignment) 개선 효과를 입증했다.
대규모 모델 평가: GPT-5.2, Gemini-3-Pro, Grok-4.1-reasoning, Llama-4 등 24개 최신 LLM을 평가하여 safety knowledge 정확도(0.80~0.32)와 safety rate(0.65~0.16)에서 큰 편차와 치명적 취약점을 발견했다.
과도한 거부(excessive refusal) 행동 관찰: LLM들이 안전 관련 이슈에서 서로 다른 정도의 과잉 거부 경향을 보임을 확인했다.
맥락 의존적 안전성 개념 제시: 과학적 질문의 안전 여부는 이분법적으로 분류될 것이 아니라 구체적 맥락에 의존해야 한다는 관점을 제시했다.
How
Safety knowledge와 safety risk를 두 축으로 명확히 구분하여 평가 범위를 확장
SMILES, SELFIES, amino acid sequence, nucleotide sequence 등 다양한 formatted representation을 포함한 자연어 및 구조화 데이터 활용
"공개적으로 접근 가능한 정보는 거부하지 않아야 한다"는 가설을 기반으로 knowledge/risk 질문을 분류
일반적 악의적 의도가 아닌 전문적(domain-expert) 시나리오에 집중하여 질문 설계
database interacting과 task diversifying 전략으로 data contamination 완화
MCQ, TFQ, fill-in-the-blank, 구조화된 분자 생성 등 objective metric 채택으로 judge model bias 제거
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'SafeScientist: Toward Risk-Aware Scientific Discoveries by LLM Agents'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.