DexGraspVLA: A Vision-Language-Action Framework Towards General Dexterous Grasping

저자: Yifan Zhong, Xuchuan Huang, Ruochong Li, Ceyao Zhang, Zhang Chen, Tianrui Guan, Fanlian Zeng, Ka Num Lui, Yuyao Ye, Yitao Liang, Yaodong Yang, Yuanpei Chen | 날짜: 2025-02-28 | URL: https://arxiv.org/abs/2502.20900 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 2

Figure 2: Overview of DexGraspVLA. A pre-trained VLM-based high-level planner (purple) decomposes prompts into object-

DexGraspVLA는 Vision-Language model을 고수준 계획자로, diffusion 기반 저수준 행동 컨트롤러를 학습하는 계층적 VLA 프레임워크로, foundation model을 통해 언어·시각 입력을 도메인 불변 표현으로 변환하여 모방 학습의 일반화를 달성한다.

Motivation

Achievement

Figure 1

Figure 1: We propose DexGraspVLA, a hierarchical VLA

How

Figure 2

Figure 2: Overview of DexGraspVLA. A pre-trained VLM-based high-level planner (purple) decomposes prompts into object-

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: DexGraspVLA는 foundation model과 imitation learning의 상보적 강점을 계층적으로 통합하여 cluttered real-world scenario에서 unprecedented 90+% 일반화 성능을 달성한 의미 있는 기여이며, 장기 task, adversarial robustness, failure recovery를 동시 달성함으로써 실용적 dexterous grasping 로봇의 실현 가능성을 크게 높였다.

같이 보면 좋은 논문

기반 연구CLIPort는 시각-언어 조합을 활용한 로봇 조작의 대표적 모델로, DexGraspVLA의 VLA 프레임워크 이론적 기반을 제공합니다.
기반 연구1434의 Inner Monologue는 체계적 계획이 필요한 Embodied Reasoning을 다루고 있어, DexGraspVLA의 VLA 기반 고수준 계획 모듈 설계에 개념적 기반을 제공한다.
다른 접근DexGraspVLA는 일반화된 로봇 조작을 위한 Multimodal VLA 아키텍처를 지향하며, Magma와 범용 에이전트 설계 측면에서 대조적입니다.
다른 접근DexGraspVLA는 GraspVLA와 같이 VLA 기반 집기 모델을 제안하지만, 합성 데이터가 아닌 실제 데이터 mixture와 transfer learning 기반 접근을 취해 방법론 차이를 보입니다.
다른 접근DexGraspVLA 역시 VLM 기반 조작 프레임워크이나, 1610의 2D 텍스트-공간 기반 설계와 차별화되는 복잡한 물체 파지에 중점을 둔다.
다른 접근1356은 grasp와 같은 구체적 매니퓰레이션에 diffused expert와 multimodal policy를 융합한 접근으로, 공간 grounding 대신 조작 affordance에 주력하여 1438과 대비된다.
다른 접근DynamicVLA는 시각-언어-행동 통합에서 환경 동적성 및 일반화 능력을 강조함으로써, DexGraspVLA의 계층적 구조와 접근법이 다릅니다.
후속 연구1622의 VoxPoser는 3D 환경에서의 조작 정책에 도메인 불변 표현을 융합한다는 점에서, DexGraspVLA가 언어-시각-행동 연계 학습을 보강하고 일반화 범위를 넓히는 데 참고가 된다.
후속 연구DexGraspVLA는 MLLM 기반 3D 행동 및 tool affordance 추론을 다루며, UniAff의 3D motion constraint 통합 접근법에 방법론적 배경이 된다.
후속 연구TraceVLA는 시각적 트레이스 프롬프트를 통한 공간-시간적 추론을 시도하여, DexGraspVLA의 시각·언어·행동 연계 방식을 확장합니다.
후속 연구DexGraspVLA도 로봇 조작에 Mixture-of-Experts 구조를 적용해 InternVLA-A1의 아키텍처 설계와 유사한 연구 기반을 이룹니다.
응용 사례From Seeing to Doing은 reasoning과 decision 모듈 간 상호작용을 실 로봇 문제에 적용하여, DexGraspVLA의 foundation 기반 추론의 응용을 보완합니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드