ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning

저자: Chi-Pin Huang, Yueh-Hua Wu, Min-Hung Chen, Yu-Chiang Frank Wang, Fu-En Yang | 날짜: 2025-07-22 | URL: https://arxiv.org/abs/2507.16815 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 1

Figure 1: We introduce ThinkAct, a reasoning VLA framework capable of thinking before acting. Through

ThinkAct는 Vision-Language-Action 추론 작업을 위해 강화학습 기반 시각 잠재 계획을 통해 고수준 추론과 저수준 행동 실행을 연결하는 이중 시스템 프레임워크를 제안한다. 다중모달 LLM이 생성한 추론 계획을 시각 계획 잠재로 압축하여 다운스트림 행동 모델을 조건화하여 장기 계획, 소수샷 적응, 자체 수정 능력을 달성한다.

Motivation

Achievement

Figure 1

Figure 1: We introduce ThinkAct, a reasoning VLA framework capable of thinking before acting. Through

How

Figure 2

Figure 2: Overview of our ThinkAct. (a) Given observation 𝑜𝑡and instruction 𝑙, ThinkAct advances action-

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: ThinkAct는 행동 정렬 시각 보상을 기반으로 한 혁신적인 GRPO 강화학습과 시각 잠재 계획 압축을 통해 Vision-Language-Action 모델에 구조화된 추론 능력을 효과적으로 부여한다. 장기 계획, 소수샷 적응, 자체 수정 능력을 동시에 달성한 점에서 구체화된 AI 및 로봇 조작 분야에 의미 있는 기여를 한다.

같이 보면 좋은 논문

기반 연구Inner Monologue는 chain-of-thought 및 planning 기반 embodied reasoning을 다루어 ThinkAct의 추론-행동 연결 구조와 연관됨.
기반 연구ThinkAct는 reinforced visual reasoning을 통한 VLA 작업 실행을 제안해, OneTwoVLA의 adaptive reasoning & acting 접근법과 비교 가능하다.
기반 연구ThinkAct의 VLA reasoning 구조는 VLA 전반의 기본 개념과 진보를 다루는 Vision-Language-Action (VLA) Models 총설에서 이론적 토대를 제공.
기반 연구Fast-in-Slow: A Dual-System Foundation Model은 고수준 reasoning과 저수준 행동 실행을 연결하는 dual-system 구조의 이론적 기반을 제공해, ThinkAct의 이중 시스템 구조를 정당화한다.
기반 연구Ground Slow, Move Fast는 이중 시스템 구조에서 사고 계획과 행동 실행을 연결하여 ThinkAct의 고수준 추론–저수준 행동 프레임워크 설계에 이론적 영감을 제공한다.
다른 접근Moto는 latent motion token 기반으로 고수준·저수준 연결을 자동화하는 방식이므로, ThinkAct의 시각 계획·행동 policy 연계와 다른 구현 대안이 된다.
다른 접근ThinkAct 논문은 vision-language-action reasoning과 planning capability를 통합하는 또 다른 brain-style embodied 모델을 제시한다.
다른 접근ThinkAct는 reinforced visual chain-of-thought 방식으로 embodied reasoning을 수행하여, Cosmos-Reason1과 같이 멀티모달 물리상식 기반 추론을 실험적으로 구현한다.
다른 접근Parallels Between VLA Model Post-Training and Human Motor Learning은 VLA 행동 계획 구조를 인간 운동학습과 비교함으로써, ThinkAct의 강화 기반 시각 잠재 계획 접근과 다른 관점의 시사점을 준다.
다른 접근ThinkAct와 달리 TriVLA는 에피소드 기반 삼중 시스템(기억, 예측, 행동)을 통해 VLA를 구조화함.
다른 접근ThinkAct는 장기 조작을 위한 VLA 기반 계획-추론 구조로, MEM의 multi-scale memory 프레임워크와 대비됩니다.
후속 연구ThinkAct 논문은 시각 언어 계획과 강화된 행동 추론을 연결하는 multi-modal reasoning 방법론 측면에서 VLP의 계획 구조에 이론적 근거를 마련해 준다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드