SafeSci: Safety Evaluation of Large Language Models in Science Domains and Beyond

저자: Xiangyang Zhu, Yuan Tian, Qi Jia, Kaiwei Zhang, Zicheng Zhang, Chunyi Li, Zijian Chen, Lu Sun, Kaiyuan Ji, Renrui Zhang, Wei Sun, Guangtao Zhai | 날짜: 2026 | URL: https://openreview.net/forum?id=pstQMm8R1g 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

SafeSci는 과학 분야 LLM의 안전성을 평가하고 향상시키기 위한 프레임워크로, safety knowledge와 safety risk를 명확히 구분하고 objective metric을 사용하는 대규모 벤치마크 SafeSciBench(0.25M 샘플)와 안전성 강화용 학습 데이터셋 SafeSciTrain(1.5M 샘플)로 구성된다.

Motivation

Achievement

Figure 4
  1. SafeSciBench 구축: chemistry, biology, medicine, materialogy, engineering, physics, psychology 등 7개 분야 125개 태스크에 걸쳐 25만 개 샘플을 포함하는 다학제 안전성 벤치마크를 제안했다.
  2. SafeSciTrain 구축: 150만 개 샘플 규모의 안전성 강화 학습 데이터셋을 구축하여 fine-tuning을 통한 안전 정렬(safety alignment) 개선 효과를 입증했다.
  3. 대규모 모델 평가: GPT-5.2, Gemini-3-Pro, Grok-4.1-reasoning, Llama-4 등 24개 최신 LLM을 평가하여 safety knowledge 정확도(0.80~0.32)와 safety rate(0.65~0.16)에서 큰 편차와 치명적 취약점을 발견했다.
  4. 과도한 거부(excessive refusal) 행동 관찰: LLM들이 안전 관련 이슈에서 서로 다른 정도의 과잉 거부 경향을 보임을 확인했다.
  5. 맥락 의존적 안전성 개념 제시: 과학적 질문의 안전 여부는 이분법적으로 분류될 것이 아니라 구체적 맥락에 의존해야 한다는 관점을 제시했다.

How

Figure 1

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 과학 도메인에 특화된 LLM 안전성 평가와 향상을 위한 대규모이고 체계적인 벤치마크 및 학습 데이터셋을 제공하는 의미 있는 연구로, 기존 벤치마크의 한계를 다각도로 개선했다는 점에서 실용적 가치가 크다.

같이 보면 좋은 논문

기반 연구Llama 3 모델을 기반으로 성능을 확장한 후속 연구이다.
다른 접근안전성 지식과 위험을 구분하는 평가 프레임워크의 유사한 접근법임
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'SafeScientist: Toward Risk-Aware Scientific Discoveries by LLM Agents'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근LLM 안전성 평가라는 유사한 목표를 다루는 대안적 벤치마크 연구임
다른 접근과학 분야 LLM 안전성을 평가하는 또 다른 벤치마크 구축 방식
후속 연구과학 분야 특화 안전성 평가로 일반 안전성 평가를 확장함
반론/비판안전성 벤치마크의 신뢰성을 의문시하는 대조적 관점을 제시함
반론/비판벤치마크 안전성 점수의 신뢰성 문제를 지적하는 상반된 관점
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드