Vision in Action: Learning Active Perception from Human Demonstrations

저자: Haoyu Xiong, Xiaomeng Xu, Jimmy Wu, Yifan Hou, Jeannette Bohg, Shuran Song | 날짜: 2025-06-18 | URL: https://arxiv.org/abs/2506.15666 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1: Vision in Action (ViA) uses an active head

ViA는 6-DoF 로봇 넥과 VR 텔레오퍼레이션 인터페이스를 통해 인간의 능동적 지각 전략을 직접 학습하여 이중팔 조작 로봇의 성능을 향상시키는 시스템이다.

Motivation

Achievement

Figure 5

Figure 5: Policy Learning Camera Setup Comparison Results. We report stage-wise success rates across

How

Figure 2

Figure 2: VR Teleoperation Comparison. [Left] Traditional RGB streaming suffers from motion-to-photon

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: ViA는 능동적 지각, VR 텔레오퍼레이션, 이중팔 조작을 효과적으로 통합한 혁신적 시스템으로, 중간 3D 표현을 통한 지연 시간 해결과 공유 관찰 공간 개념이 특히 창의적이며, 시각적 폐색이 있는 복잡한 실제 작업에서 실질적인 성능 향상을 달성했다.

같이 보면 좋은 논문

다른 접근인간 시연에서 로봇 조작 정책을 학습하는 모방 학습 접근법이라는 공통 주제를 가진다.
다른 접근로봇의 능동적 시각 탐색을 통한 조작 작업 수행이라는 유사한 문제를 다루는 연구이다.
다른 접근원격 조종 데이터를 활용한 로봇 자율 정책 학습에서 유사한 문제를 다룬다.
다른 접근로봇 조작을 위한 능동적 지각 및 시각 정보 활용이라는 유사한 문제를 다루는 대안적 접근법이다.
다른 접근egocentric 시점에서의 로봇 조작을 위한 시각적 학습이라는 유사한 문제를 다루는 연구이다.
다른 접근egocentric 비전을 활용한 로봇 전신 조작 제어라는 공통 주제를 가진 대안적 접근법이다.
다른 접근로봇의 시각 기반 이중팔 조작에서 카메라 관점 최적화라는 공통 주제를 가진 관련 연구이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드