저자: Manish Bhattarai, Ismael Boureima, Nishath Rajiv Ranasinghe, Scott Pakin, Daniel O'Malley | 날짜: 2026 | URL: https://openreview.net/forum?id=OTxbJguodh 📄 PDF
라이선스: OpenReview 공개(오픈액세스)
Figure 1. Rubric-Grounded Reinforcement Learning pipeline. Offline, a corpus of scientific and technical documents is us
문서 기반 rubric을 활용해 LLM judge가 다기준(weighted criteria) 부분점수(partial-credit) 보상을 산출하고, 이를 GRPO로 최적화하는 rubric-grounded reinforcement learning 프레임워크를 제안하여 held-out rubric 성능과 외부 추론 벤치마크 일반화를 동시에 개선함을 보인다.
Figure 2. Rubric-judge benchmark comparison. In a passage-grounded rubric-judged evaluation, the RL-tuned 8B policy subs
Figure 3. Reward dynamics. Training and validation rewards
총평: Rubric 기반 부분점수 보상과 정보 비대칭 설계를 결합한 참신하고 실용적인 RL 보상 프레임워크로, held-out 및 일부 외부 벤치마크에서 유의미한 개선을 보였으나 일부 벤치마크(GSM8K)에서의 미개선과 단일 모델·도메인 검증의 한계로 추가 검증이 필요하다.