저자: Yanzheng Xiang, Hanqi Yan, Shuyin Ouyang, Lin Gui, Yulan He (King's College London | 날짜: 2025 | DOI: 10.48550/arXiv.2504.00255 📄 PDF
Figure 1:
본 논문은 연구 논문에서 알고리즘 설명을 기반으로 코드를 생성하는 LLM의 능력을 평가하기 위해 SciReplicate-Bench라는 벤치마크를 제안한다. 이는 알고리즘 이해와 코딩 전문성이라는 두 가지 핵심 역량이 필요한 복합적인 과제이다.
Figure 2: A grouped bar chart illustrating the frequency of tool usage by different models.
Figure 1:
총평: 본 논문은 LLM의 과학적 재현성 평가라는 중요하고 미개척된 영역에 첫 번째 전용 벤치마크를 제공한다. SciReplicate-Bench와 reasoning graph accuracy 메트릭은 학술적으로 가치 있으며, 실행 기반의 객관적 평가로 기존 연구의 한계를 극복했다. 다만 벤치마크 규모 확대와 overthinking 현상의 심층 분석이 향후 필요하다.