CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies

저자: Fan Du, Feng Yan, Jianxiong Wu, Xinrun Xu, Weiye Zhang, Weinong Wang, Yu Guo, Bin Qian, Zhihai He, Fei Wang, Heng Yang | 날짜: 2026-04-27 | URL: https://arxiv.org/abs/2604.24622 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 1

Figure 1: Teaser of CF-VLA. Standard flow matching requires multiple iterative steps to recover action structure from un

본 논문은 flow matching 기반 VLA 정책의 비효율성을 해결하기 위해 coarse-to-fine 두 단계 생성 프레임워크를 제안한다. 첫 번째 단계에서는 Gaussian 노이즈를 action-prior-guided 초기화로 변환하고, 두 번째 단계에서는 단일 스텝 국소 정교화를 수행하여 추론 지연시간을 75.4% 감소시키면서 성능을 유지한다.

Motivation

Achievement

How

Figure 3

Figure 3: Geometric view of CF-VLA. Standard flow matching starts

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: CF-VLA는 flow-based VLA 정책의 구조적 비효율성을 명확하게 파악하고, coarse-to-fine 분해를 통해 실용적이고 효과적인 해결책을 제시한다. 75.4%의 지연시간 감소와 실로봇 83.0% 성공률은 강력한 경험적 검증을 보여주며, 방법의 플러그-앤-플레이 특성으로 인해 광범위한 적용성을 가진다. 다만 이론적 분석과 더 깊은 통찰이 추가되면 더욱 완성도 있는 연구가 될 것이다.

같이 보면 좋은 논문

기반 연구flow matching 기반 행동 생성의 기반 방법론을 제공하여 본 논문의 두 단계 생성 프레임워크의 토대가 된다.
기반 연구VLA 모델의 기반 아키텍처를 제공하여 본 논문의 방법론적 토대가 된다.
다른 접근로봇 네비게이션과 탐색을 위한 다른 확산 모델 기반 정책을 제시한다.
다른 접근Vision-Language-Action 모델의 효율적인 행동 생성을 위한 방법론으로, CF-VLA와 유사한 문제를 다룬다.
다른 접근diffusion 기반 로봇 정책의 효율성 개선을 위한 접근법으로, flow matching 기반 VLA와 관련된 연구다.
다른 접근로봇 조작을 위한 효율적인 정책 생성 프레임워크로, coarse-to-fine 행동 생성과 관련된 접근법을 제시한다.
다른 접근VLA 모델의 행동 생성 효율성을 개선하는 접근법으로, coarse-to-fine 프레임워크와 유사한 목표를 가진다.
후속 연구강화학습 미세조정을 통한 생성형 제어기 학습의 이론적 기반을 제공한다.
다른 접근VLA 모델의 추론 효율성을 개선하기 위한 방법으로, CF-VLA와 유사한 기술적 도전을 공유한다.
다른 접근VLA 모델의 행동 생성 효율성을 개선하기 위한 latent 기반 접근법을 제안하는 관련 연구이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드