저자: Andy Xu, Rohan Desai, Larry Wang, Ethan T. Ritz, Gabriel Hope | 날짜: 2026 | URL: https://openreview.net/forum?id=wFThVGzmvq 📄 PDF
라이선스: OpenReview 공개(오픈액세스)
Figure 1. Overview of the PLaID++ pipeline, highlighting Wyckoff fine tuning and iterative DPO.
PLaID++는 Wyckoff 위치 기반의 대칭성 정보를 담은 텍스트 표현과 DPO 기반 강화학습(RLIP)을 결합하여 LLM이 안정적이고(stable) 고유하며(unique) 신규한(novel) 무기 결정 구조를 생성하도록 post-training하는 방법을 제안한다.
Figure 3. Evolution of S.U.N. percentage of PLaID++ variants’ over DPO iterations. Reference lines represent S.U.N. rate
Figure 1. Overview of the PLaID++ pipeline, highlighting Wyckoff fine tuning and iterative DPO.
총평: RLVR류 post-training 기법을 재료 생성이라는 다양성 중심의 과학적 문제에 적용하며 symmetry-informed 표현과 RLIP라는 새로운 강화학습 프레임워크를 통해 유의미한 성능 향상을 보여준 인상적인 연구이나, 상세한 실험적 검증(DFT, 합성 가능성)이 추가로 뒷받침되면 더욱 완성도가 높아질 것이다.