Essence
Figure 1: We introduce CrossFormer, a transformer-based policy trained on 900K trajectories of diverse,
CrossFormer는 20개의 서로 다른 로봇 embodiment에서 900K 궤적으로 학습된 단일 transformer 기반 정책으로, 관찰 및 행동 공간의 수동 정렬 없이 조작, 네비게이션, 보행, 항공 로봇을 모두 제어할 수 있다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: CrossFormer는 cross-embodied 로봇 학습에서 획기적인 진전을 이루었으며, 실용적인 문제(센서/액추에이터 이질성)를 우아하게 해결하고 광범위한 실제 실험으로 검증된 강력한 작업이다.
같이 보면 좋은 논문
기반 연구Robot Utility Models 논문은 범용 정책의 zero-shot deployment에 관한 이론적 기반을 제공하여 Cross-embodiment policy transfer에 대한 개념적 토대를 마련해 준다.
기반 연구π₀.₅는 다양한 embodiment에서의 VLA generalization을 강조하여, Scaling Cross-Embodied Learning 연구의 토대가 된다.
기반 연구Scaling Cross-Embodied Learning 논문은 cross-embodiment 정책 학습·확장성에 초점을 맞추어, Latent Action Diffusion의 핵심 아이디어를 대규모 실험·평가로 확장합니다.
다른 접근Latent Action Diffusion for Cross-Embodiment Manipulation 논문은 다양한 로봇 embodiment간 스킬 전이에 diffusion approach를 활용하여 CrossFormer와 비교할 수 있다.
다른 접근MetaMorph는 transformer 기반 universal controller를 cross-embodiment에 대해 제안하며, CrossFormer와 유사한 문제에 다른 아키텍처 접근을 제시한다.
다른 접근Scaling Cross-Embodied Learning 논문은 다양한 embodiment에서 단일 정책 학습을 실험하며, RoboCat과 유사한 목표를 가진 대안 방법론이다.
다른 접근ManipVQA는 다양한 로봇 형태와 물리적 환경에 대한 비주얼 질의응답 구성을 통한 정책 전이 및 일반화를 다루는 대안적 방법을 제시한다.
반론/비판Transferring Foundation Models for Generalizable Robotic Manipulation 논문은 embodiment agnostic 정책의 전이 성능과 한계를 비판적 시각에서 분석하므로 비교 시 유익하다.