OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning

저자: Fanqi Lin, Ruiqian Nai, Yingdong Hu, Jiacheng You, Junming Zhao, Yang Gao | 날짜: 2025-05-17 | URL: https://arxiv.org/abs/2505.11917 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 1

Figure 1: Overview. OneTwoVLA is a single unified vision-language-action model capable of both reasoning

OneTwoVLA는 단일 통합 vision-language-action 모델로서 reasoning과 acting을 모두 수행하며, 작업 실행 중 critical moment에서는 explicit reasoning을, 그 외에는 reasoning 기반 action generation으로 adaptively switch한다.

Motivation

Achievement

Figure 2

Figure 2: Task completion times on Tomato-Egg.

How

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: OneTwoVLA는 dual-system의 근본적 문제를 unified model로 해결하면서 adaptive reasoning-acting mechanism을 통해 효율성과 성능의 balance를 달성한 혁신적 접근법이다. Embodied vision-language co-training strategy와 함께 long-horizon robot control의 새로운 표준을 제시하며, ICLR 2026 발표의 significance를 충분히 입증한다.

같이 보면 좋은 논문

기반 연구PaLM-E가 reasoning과 action을 결합한 최초의 대형 모델 중 하나로, OneTwoVLA의 단일 통합 reasoning-acting 접근의 이론적/실험적 토대가 된다.
기반 연구OneTwoVLA는 RoboCat의 generalist 정책 개념을 reasoning 및 acting 통합 프레임워크로 concretize한다.
기반 연구ThinkBot은 체계적인 thought chain 기반 reasoning과 action switch 전략이 결합되어, OneTwoVLA의 adaptive reasoning approach의 이론적 배경이 된다.
기반 연구Magma는 Trace-of-Mark 등의 시공간 reasoning/acting 통합 프레임워크로 OneTwoVLA의 unified 구조에 영향을 미쳤다.
다른 접근OneTwoVLA도 멀티모달 에이전트 모델로서 reasoning과 acting을 동시에 처리하는 unified 구조이므로 Magma와 구조적/응용적 차이점을 분석할 수 있다.
기반 연구OneTwoVLA(1503)는 계층적 experts 구조를 HiMoE-VLA(1424)의 프레임워크에서 further adaptation 메커니즘까지 확장한다.
다른 접근Inner Monologue 논문은 explicit reasoning 단계 중간의 내적 계획과 action generation을 분리하여, adaptive reasoning과 acting의 다른 실현 사례를 보여준다.
다른 접근TrackVLA++ 논문은 reasoning과 acting의 효과적 결합 및 memory bottleneck 극복을 시도하며, OneTwoVLA의 adaptive reasoning 구조와 직접 비교가 가능하다.
후속 연구ThinkAct는 reinforced visual reasoning을 통한 VLA 작업 실행을 제안해, OneTwoVLA의 adaptive reasoning & acting 접근법과 비교 가능하다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드