SPRINT: Scalable Policy Pre-Training via Language Instruction Relabeling

저자: Jesse Zhang, Karl Pertsch, Jiahui Zhang, Joseph J. Lim | 날짜: 2023-06-20 | URL: https://arxiv.org/abs/2306.11886 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 1

Fig. 1: SPRINT is a scalable approach for pre-training robot policies with a rich repertoire of skills while minimizing

SPRINT는 대규모 언어 모델(LLM)을 활용한 instruction relabeling과 offline RL 기반 cross-trajectory skill chaining을 통해 로봇 정책 사전학습을 위한 인간 주석 비용을 크게 줄이는 확장 가능한 접근법이다.

Motivation

Achievement

Figure 5

Fig. 5: ALFRED-RL evaluation results. Left: Zero shot performance on EVALINSTRUCT and EVALLENGTH. SPRINT is able

How

Figure 2

Fig. 2: SPRINT overview. We assume access to a dataset

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: SPRINT는 LLM과 offline RL을 창의적으로 결합하여 로봇 정책 사전학습의 인간 주석 비용을 획기적으로 감소시키는 실질적이고 확장 가능한 방법을 제시한다. 실험 결과도 우수하나, 생성된 instruction의 품질 보증과 다양한 도메인에서의 검증이 추가되면 더욱 강력한 기여가 될 것이다.

같이 보면 좋은 논문

기반 연구LIBERO는 lifelong robot learning을 위한 벤치마크와 데이터로, SPRINT의 skill chaining 및 정책 사전학습의 실용적 기반을 제공한다.
기반 연구DROID는 실제 환경에서 VLA 정책 학습용 대규모 데이터를 제공하며, SPRINT 모델의 대규모 오프라인 RL과 skill chaining 성능 검증에 활용될 수 있다.
기반 연구InstructVLA는 SPRINT와 유사하게 언어 주석 relabeling과 instruction 기반 정책 학습을 주제로 하여 사전학습(Pre-training) 과정의 이론적 기반을 제공한다.
다른 접근Language to Rewards for Robotic Skill Synthesis는 언어 기반 reward shaping을 통해 정책 학습 효율화를 추구하며, SPRINT의 instruction relabeling 기반 사전학습과 유사 문제에 대해 아이디어적 차별성을 제공한다.
다른 접근SPRINT는 언어 지시 기반 정책 사전학습 프레임워크로 BOSS 방식의 스킬 생성과 장기 작업 달성 전략의 차이를 비교할 수 있다.
다른 접근$π_{0.5}$: a Vision-Language-Action Model with Open-World Generalization은 라벨 효율성/범용 정책 사전학습 및 인간 코스트 절감 측면에서 SPRINT와 유사 산업적 목표를 추구한다.
다른 접근DemoDiffusion 논문은 비슷하게 diffusion을 통한 one-shot imitation learning을 제안하지만, SPRINT와 달리 instruction relabeling 대신 diffusion 기반 imitation을 강조한다.
후속 연구SPRINT는 언어 명령 기반 정책 대규모 사전학습에 대한 접근법을 제시하고, SayPlan이 다루는 LLM 확장성 연구와 상호보완적이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드