In-Context Imitation Learning via Next-Token Prediction

저자: Letian Fu, Huang Huang, Gaurav Datta, Lawrence Yunliang Chen, William Chung-Ho Panitch, Fangchen Liu, Hui Li, Ken Goldberg | 날짜: 2024-08-28 | URL: https://arxiv.org/abs/2408.15980 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 1

Fig. 1: In-Context Robot Transformer (ICRT): A robot foundation model with in-context imitation learning capabilities. I

로봇이 새로운 작업을 수행할 때 정책 파라미터 업데이트 없이 입력 단계에서 제공된 문맥 정보를 해석하는 In-Context Robot Transformer (ICRT)를 제안한다. ICRT는 감각-운동 궤적에 대한 자동회귀 다음-토큰 예측을 통해 훈련 없이 새로운 작업을 유연하게 실행할 수 있다.

Motivation

Achievement

Figure 4

Fig. 4: Example inference pipeline of ICRT on the task of picking

How

Figure 3

Fig. 3: Method Overview: (Left) We encode camera observations with a pre-trained vision transformer. Additionally, we en

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: ICRT는 실제 로봇에서 처음으로 효과적인 문맥 내 학습을 보여주며, 간단한 다음-토큰 예측 프레임워크로 복잡한 시연 기반 학습을 가능하게 한다. 로봇 기초 모델의 실용성을 크게 향상시키는 의미 있는 기여이나, 일반화 범위와 기술적 깊이 면에서 추가 검증이 필요하다.

같이 보면 좋은 논문

기반 연구Learning Latent Plans from Play는 행동 시연에서 구조를 추출하는 비지도 imitation learning의 이론적 기반을 제공합니다.
기반 연구In-Context Imitation Learning via Next-Token Prediction 논문은 VoxPoser의 code-writing 및 visual trace 방식 imitation learning을 scale up 가능한 일반화된 프레임워크로 보여준다.
기반 연구In-Context Imitation Learning via Next-Token Prediction은 D3IL과 유사한 벤치마크에서 in-context imitation을 탐구함.
기반 연구In-Context Imitation Learning via Next-Token Prediction은 비디오 기반 추론과 행동 예측을 sequence modeling 프레임워크로 확장하여, Unified Video Action Model이 제시한 통합 접근과 결합할 수 있다.
다른 접근In-Context Imitation Learning은 LOTUS와 달리 시연기반 정책학습의 다양한 패러다임을 실험하여 지속적 모방학습과 대조적으로 볼 수 있다.
다른 접근Reflective Planning 논문은 프롬프트 기반 VLM planning과 행동 실행의 직접적 연계를 보여주어 in-context imitation learning과 비교해볼 가치가 있습니다.
다른 접근$π_{0.5}$는 다양한 작업에서 파라미터 업데이트 없이 문맥 정보를 해석하는 VLA 구조로, in-context learning 분야의 대체적 접근을 보여준다.
다른 접근DemoDiffusion 역시 one-shot imitation을 diffusion 기반 정책으로 해결하여 in-context imitation learning의 대체 솔루션을 제시한다.
후속 연구In-Context Imitation Learning은 실제 데모에 기반한 휴머노이드 정책 학습의 기본 베이스이므로, 실제 보행정책에 대한 이론적 근거를 제공합니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드