저자: Rui Ye, Xianghe Pang, Jingyi Chai, Jiaao Chen, Zhen-fei Yin, Zhen Xiang, Xiaowen Dong, Jing Shao, Siheng Chen | 날짜: 2024 | DOI: N/A 📄 PDF
그림 1: (a) 학술 커뮤니티가 피어 리뷰에 LLM 도입을 시작했으며, (b) 프롬프트 주입을 통한 명시적 조작, (c) LLM이 저자가 공개한 한계를 인용할 가능성이 높으며, (d) 불완전한 콘텐츠에도 부당히 높은 점수를 부여함
본 연구는 학술 피어 리뷰에 대규모 언어모델(LLM)을 활용할 때의 심각한 보안 취약점을 최초로 종합적으로 분석한 논문이다. 저자들은 명시적 조작(explicit manipulation)과 암시적 조작(implicit manipulation), 그리고 LLM의 내재적 결함을 통해 LLM 기반 리뷰어가 얼마나 쉽게 오도될 수 있는지를 실증적으로 입증한다.
그림 2: 조작 전후 리뷰 평점 비교
그림 3: 상위 30% 논문에 대한 체계적 영향
총평: 본 논문은 LLM을 피어 리뷰에 도입하려는 학술 커뮤니티에 대해 시의적절하고 중요한 경고를 제시한다. 명시적·암시적 조작과 내재적 편향을 체계적으로 입증함으로써 LLM을 단독 리뷰어가 아닌 보조 도구로만 활용해야 함을 강하게 주장한다. 다만 다양한 모델 및 학회로의 확대 검증과 방어 메커니즘 제시를 통해 영향력을 더욱 높일 수 있을 것으로 예상된다.