저자: Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti, Ted Xiao, Ashwin Balakrishna, Suraj Nair, Rafael Rafailov, Ethan Foster, Grace Lam, Pannag Sanketi, Quan Vuong, Thomas Kollar, Benjamin Burchfiel, Russ Tedrake, Dorsa Sadigh, Sergey Levine, Percy Liang, Chelsea Finn | 날짜: 2024-06-13 | URL: https://arxiv.org/abs/2406.09246 📄 PDF
Essence
Figure 1: We present OpenVLA, a 7B-parameter open-source vision-language-action model (VLA), trained
OpenVLA는 970k개의 로봇 시연 데이터로 학습된 7B 파라미터의 오픈소스 Vision-Language-Action 모델로, 폐쇄형 모델들보다 우수한 성능을 보이면서 효율적인 미세조정과 배포를 지원한다.
Evaluation
Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: OpenVLA는 폐쇄형 대규모 VLA 모델을 능가하는 성능을 더 작은 파라미터로 달성하면서 완전한 오픈소스 공개와 효율적 미세조정 방법을 제시하여 로봇 분야의 파운데이션 모델 생태계 구축에 중요한 기여를 한다.
같이 보면 좋은 논문
기반 연구OpenVLA는 Open X-Embodiment 데이터와 범용 정책을 실제 VLA 모델로 구현하여 후속 활용 사례를 제공합니다.
기반 연구Robot Learning in the Era of Foundation Models Survey는 open-source VLA 개발 및 평가의 이론적 배경과 산업 동향을 제공한다.
기반 연구H2O로 수집된 인간-로봇 상호작용 데이터가 OpenVLA와 같은 범용 VLA 모델 학습에 활용될 수 있다
기반 연구1510의 오픈 VLA 모델은
1306에서 제시한 통합 데이터 표준을 실제 범용 AI로 연결하며 활용을 고도화한다.
기반 연구OpenVLA(1510)는 오픈소스 VLA 정책에서 world model 융합 학습을 실험적으로 확대해 WHALE(1626) 적용을 위한 실용적 벤치마크 및 프레임워크를 구축한다.
기반 연구OpenVLA는 로봇 조작에 사용되는 VLA action representation을 다루어, 효율적인 action tokenization에 대한 실제 활용 사례를 제시합니다.
기반 연구OpenVLA 논문은 EO-1과 유사하게 vision-text-action 사전학습 기반의 open unified VLA 모델로 범용 embodied reasoning·제어를 지향합니다.
기반 연구VLA 아키텍처의 구성 요소와 설계 원리를 분석한 논문으로, OpenVLA의 설계 의의와 한계를 이해하는 데 도움을 줍니다.
다른 접근RT-2도 vision-language-action 모델을 활용한 실세계 로봇 제어 성능을 검증하므로, OpenVLA와 대형 폐쇄형 모델의 차이와 장단점을 알 수 있다.
다른 접근OpenVLA는 오픈소스 VLA 모델로, TraceVLA가 강조하는 효율성과 범용성 측면에서 비교할 만한 대안적인 접근법을 제시한다.
다른 접근1510은 범용적 VLA 모델의 오픈소스 구현을 제시하여,
1279의 조작 프레임워크와 다른 접근 방식의 솔루션을 탐색할 수 있다.
다른 접근둘 다 오픈소스 VLA 모델이지만 휴머노이드 전용과 범용 로봇의 설계 철학이 다릅니다.
다른 접근OpenVLA와 유사하게 오픈월드 로봇 조작을 지향하는 VLA 모델로, 다른 데이터 및 학습 전략을 사용하므로 비교가 필수적입니다.
다른 접근NORA와 같이 open-source VLA 모델을 경량 설계와 효율적 미세조정 관점에서 직접적으로 비교할 수 있다.
다른 접근OpenVLA는 공개 VLA 모델 아키텍처 및 학습 방식을 제공, RLinf-VLA와 비교해 프레임워크 확장성과 유연성을 검토할 수 있다.
다른 접근1510은 오픈소스 VLA 모델 구현 사례로,
1296의 LingBot-VLA 기초모델과 비교해 학습 구조 및 응용 범위의 차별점을 확인할 수 있다.
후속 연구Running VLAs at Real-time Speed 논문은 오픈소스 VLA 모델의 실시간 실행 최적화에 초점을 맞춰 OpenVLA를 실제 적용 측면에서 확장한다.
후속 연구OpenVLA에서는 구조 변경 없이 순수 VLM 출력 토큰만으로 action mapping을 하는 및 파생된 설계의 실제 효과를 살펴볼 수 있다.
후속 연구1510의 OpenVLA는 오픈소스 VLA 모델로, EgoScale에서 대규모 인간 비디오 토대로 사전학습한 VLA와의 벤치마킹 및 검증이 가능하다.