Diversity Over Frequency: Rethinking Tool Use in Visual Chain-of-Thought Agents

저자: Dong-Hee Kim, Reuben Tan, Donghyun Kim | 날짜: 2026 | URL: https://openreview.net/forum?id=taH7v2Qy8M 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Visual chain-of-thought agent의 강화학습 훈련 과정에서 tool-use collapse 현상(도구 사용 빈도가 줄어드는데도 정확도는 오히려 상승)을 규명하고, 이를 rollout diversity 부족의 문제로 재해석하여 entropy regularization을 통한 다양성 확보가 tool 사용 빈도 자체보다 성능에 더 중요함을 보인 연구이다.

Motivation

Achievement

Figure 2
  1. Tool-use collapse 현상 규명: 사전학습된 tool-using visual agent에 vanilla RFT를 적용하면 정확도는 향상되지만 tool 사용률은 거의 0에 수렴하는 일관된 훈련 병리 현상을 발견하였다.
  2. 비대칭성 입증: tool 사용을 완전히 제거하면 성능이 저하되는 반면, reward 기반으로 tool 사용을 강하게 유도해도 사용량은 크게 늘지만 정확도 향상은 미미함을 보여, tool 빈도와 성능이 단순 비례하지 않음을 규명하였다.
  3. Diversity 저하와의 연결: vanilla training과 tool-use encouragement 모두 텍스트·시각 양쪽 modality에서 rollout diversity를 저하시키며, 이것이 tool 사용 증가가 reasoning 성능 향상으로 이어지지 않는 원인임을 실증하였다.
  4. Entropy regularization을 통한 개선: adaptive entropy regularization term을 추가해 다양한 rollout 탐색을 유도함으로써, tool 사용량이 점차 감소함에도 불구하고 최고 성능을 달성하였다.
  5. Scaffolding 관점 제시: 초기 tool-mediated exploration이 이후 tool-less inference에서도 유효한 representation을 형성한다는 훈련 시점(training-time) scaffolding 관점을 제안하고, medical VQA(VQA-RAD)로 확장 검증하였다.

How

Figure 3

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: Tool 사용 빈도 자체보다 rollout diversity가 visual reasoning agent의 성능을 좌우한다는 통찰은 참신하고 실용적이며, tool-use collapse라는 현상 규명과 scaffolding 관점 제시는 향후 agentic visual reasoning 연구에 중요한 방향을 제시한다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근사후훈련 방법 비교에 대한 유사한 실증 연구이다.
기반 연구강화학습을 활용한 실제 멀티모달 에이전트 응용 사례
기반 연구volumetric 데이터 처리를 임상 이해에 응용한 사례임
기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 Scientific Information Extraction and QA가 맞닿아, 'Beyond Medical Diagnostics: How Medical Multimodal Large Language Models Think in Space'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근의료 MLLM의 특정 능력 평가를 위한 유사한 벤치마크 접근
다른 접근장시간 비디오 이해를 위한 다른 추론 전략을 제시한다.
응용 사례entropy regularization을 유사한 에이전트 훈련 문제에 적용한 연구이다.
다른 접근도구 사용 학습에서의 다른 정책 최적화 접근법을 제시한다.
다른 접근동일한 spatial reasoning 평가라는 문제를 다른 데이터 구성 방식으로 접근하는 벤치마크이다.
후속 연구tool-use collapse 현상 분석을 확장하여 rollout diversity 문제를 다룬다.
다른 접근궤적 길이를 활용한 보상 설계의 대안적 방법을 탐구한다.
후속 연구rollout diversity 문제를 확장하여 다루는 후속 연구로 추정된다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드