Hume: Introducing System-2 Thinking in Visual-Language-Action Model

저자: Haoming Song, Delin Qu, Yuanqi Yao, Qizhi Chen, Qi Lv, Yiwen Tang, Modi Shi, Guanghui Ren, Maoqing Yao, Bin Zhao, Dong Wang, Xuelong Li | 날짜: 2025-05-27 | URL: https://arxiv.org/abs/2505.21432 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1: We present Hume, a dual-system vision-language-action model exploring human-like

Hume는 Vision-Language-Action 모델에 System-2 slow thinking을 도입한 dual-system 로봇 정책으로, value-guided 반복 샘플링과 cascaded action denoising을 통해 복잡한 로봇 제어 성능을 향상시킨다.

Motivation

Achievement

Figure 1

Figure 1: We present Hume, a dual-system vision-language-action model exploring human-like

How

Figure 2

Figure 2: Overview of Hume. Hume contains two systems working asynchronously. Given the

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 본 논문은 로봇 제어에 System-2 slow thinking을 처음으로 적용하여 중요한 conceptual contribution을 제시하며, value-guided thinking과 cascaded action denoising의 novel 조합으로 실질적인 성능 향상을 달성했다. 다만 기술적 세부사항과 design choice의 정당화가 더 보강될 필요가 있다.

같이 보면 좋은 논문

기반 연구1428의 Hume는 Vision-Language-Action 모델에 System-2(추론적 reasoning) 사고를 도입하여, Diffusion-VLA의 reasoning injection 컨셉을 이론적으로 확장한다.
기반 연구CoT-VLA의 시각적 chain-of-thought을 확장하여 System-2적 사고를 적용한 VLA 모델(Hume)과 연계해, 단계적 추론 강화를 논의할 수 있습니다.
다른 접근Fast-in-Slow는 빠른(System-1)/느린(System-2) 접근을 통합하므로 Hume의 system-2 slow thinking 아이디어와 비교해볼만 합니다.
다른 접근RationalVLA는 듀얼 기반의 의사결정 구조로 system-2 reasoning을 구현하기 때문에 Hume와 관련성이 높습니다.
다른 접근GR-3(1410)는 대규모 범용 VLA 정책을 단일 정책 구조에서 달성하는 반면 Hume(1428)은 Slow-thinking 기반 dual policy를 채택한다.
다른 접근InternVLA-M1 역시 공간적 지식과 통합적 reasoning을 통해 일반적 로봇 제어 능력을 추구하므로 Hume의 대안적 접근법으로 참고할 수 있다.
다른 접근Hume와 유사하게 dual-system 사고 방식을 적용하면서도, 'Ground Slow, Move Fast'는 다른 아키텍처로 접근해 비교적 빠른 실행과 심층적 사고를 융합한다는 점에서 대조적이다.
후속 연구Hume: Introducing System-2 Thinking 논문은 Reflection 기반 심리 모델을 VLM에 적용하는 방법론적 근간을 제공해, 1528의 reflective planning 관점에 이론적 기반을 제공한다.
후속 연구Hume 논문은 시각-언어-행동 추론에 시스템2적 사고를 도입하여, VL-Nav의 기호적 추론 기능의 이론적 토대를 마련한다.
후속 연구Hume 논문은 System-2 추론적 브레인 도입 기반 VLA 설계로, RoboCerebra의 심볼릭·계층적 플래닝 벤치마크 기초가 된다.
후속 연구TriVLA는 Hume과 유사한 multi-system 기반 VLA 모델 프레임워크를 삼중 시스템 관점에서 확장한 후속 연구이다.
후속 연구Hume 논문은 VLA의 System-2 추론과 장기 계획 메커니즘을 연구하여, MEM의 롱-호라이즌 플래닝 기반을 제공합니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드