Essence
Visual chain-of-thought agent의 강화학습 훈련 과정에서 tool-use collapse 현상(도구 사용 빈도가 줄어드는데도 정확도는 오히려 상승)을 규명하고, 이를 rollout diversity 부족의 문제로 재해석하여 entropy regularization을 통한 다양성 확보가 tool 사용 빈도 자체보다 성능에 더 중요함을 보인 연구이다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: Tool 사용 빈도 자체보다 rollout diversity가 visual reasoning agent의 성능을 좌우한다는 통찰은 참신하고 실용적이며, tool-use collapse라는 현상 규명과 scaffolding 관점 제시는 향후 agentic visual reasoning 연구에 중요한 방향을 제시한다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근사후훈련 방법 비교에 대한 유사한 실증 연구이다.
기반 연구강화학습을 활용한 실제 멀티모달 에이전트 응용 사례
기반 연구volumetric 데이터 처리를 임상 이해에 응용한 사례임
기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 Scientific Information Extraction and QA가 맞닿아, 'Beyond Medical Diagnostics: How Medical Multimodal Large Language Models Think in Space'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근의료 MLLM의 특정 능력 평가를 위한 유사한 벤치마크 접근
다른 접근장시간 비디오 이해를 위한 다른 추론 전략을 제시한다.
응용 사례entropy regularization을 유사한 에이전트 훈련 문제에 적용한 연구이다.
다른 접근도구 사용 학습에서의 다른 정책 최적화 접근법을 제시한다.
다른 접근동일한 spatial reasoning 평가라는 문제를 다른 데이터 구성 방식으로 접근하는 벤치마크이다.
후속 연구tool-use collapse 현상 분석을 확장하여 rollout diversity 문제를 다룬다.
다른 접근궤적 길이를 활용한 보상 설계의 대안적 방법을 탐구한다.
후속 연구rollout diversity 문제를 확장하여 다루는 후속 연구로 추정된다.