저자: Ziqi Wang, Le Hou, Tianjian Lu, Yuexin Wu, Yunxuan Li | 날짜: 2023 | DOI: N/A 📄 PDF
Figure 1: The pipeline of PIT and prompting methods (Self-Refine). Upper: PIT utilizes inputs and
이 논문은 LLM이 명시적인 rubric 설계 없이 인간 선호도 데이터로부터 자동으로 개선 목표를 학습할 수 있도록 하는 PIT(ImPlicit Self-ImprovemenT) 프레임워크를 제안한다. RLHF의 학습 목표를 재구성하여 입력만 최대화하는 대신 참조 응답 조건부 응답 품질 간격을 최대화한다.
Figure 2: Reward distribution of
Figure 1: The pipeline of PIT and prompting methods (Self-Refine). Upper: PIT utilizes inputs and
총평: 이 논문은 명시적 rubric 설계의 비용을 제거하면서도 LLM의 self-improvement를 가능하게 하는 실용적이고 혁신적인 접근을 제시한다. RLHF 재구성의 단순성과 효과성, 그리고 데이터 효율성 측면에서 가치 있는 기여이며, ICLR 수준의 출판물로 적절하다.