저자: Mohammed Abbas | 날짜: 2026 | URL: https://openreview.net/forum?id=4Jgmkx0HvH 📄 PDF
라이선스: OpenReview 공개(오픈액세스)
Figure 1. RBPF tracking a correct reasoning chain (T=40). Top:
LLM의 reasoning trajectory를 Normal/Insight/Backtrack 세 가지 latent mode를 가진 Switching Linear Dynamical System(SLDS)으로 모델링하고, Rao-Blackwellized Particle Filter(RBPF)로 온라인 추적하여 PRM 점수를 관측치로 활용해 label-free하게 정답 여부 확신도를 calibration까지 개선한 방법을 제안한다.
Figure 4. Prediction accuracy versus compute saved under early
총평: reasoning monitoring을 dynamical system 추정 문제로 재정의하고 RBPF를 통해 label 없이 calibration이 우수한 confidence 추정을 달성한 참신하고 실용적인 연구로, discrimination 성능은 최상위권은 아니지만 calibration과 조기 종료 능력에서 뚜렷한 실질적 이점을 보인다.