저자: Mourad Ouzzani, Hossam M. Hammady, Zbys Fedorowicz, Ahmed K. Elmagarmid | 날짜: 2025 | URL: https://arxiv.org/abs/2502.17086 📄 PDF
Figure 1: We introduce a focus-level evaluation frame-
LLM이 생성한 논문 리뷰가 인간 전문가 리뷰어와 동일한 중요 측면에 집중하는지 평가하기 위해 focus-level 평가 프레임워크를 제안하고, LLM들이 기술적 타당성에는 과도하게 집중하면서 새로움(novelty) 평가를 간과한다는 것을 발견했다.
Figure 4: A visualization of focus distributions by target/aspect and strength/weakness, in a descending order of
Figure 2: The overall process of automated focus-level evaluation. We first extracted strengths and weaknesses
총평: 이 논문은 LLM 리뷰 평가에 새로운 focus-level 관점을 도입하여 기존 평가의 맹점을 보완하고, 자동화된 프레임워크를 통해 대규모 분석을 가능하게 했다. 특히 LLM들의 일관된 novelty 간과 패턴 발견은 학술 리뷰 품질 문제를 구체적으로 드러내며, 공개 데이터셋은 후속 연구에 중요한 기여를 할 것으로 기대된다.