Plan-Seq-Learn: Language Model Guided RL for Solving Long Horizon Robotics Tasks

저자: Murtaza Dalal, Tarun Chiruvolu, Devendra Chaplot, Ruslan Salakhutdinov | 날짜: 2024-05-02 | URL: https://arxiv.org/abs/2405.01534 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 2

Figure 2: Method overview. PSL decomposes tasks into a list of regions and stage termination conditions

Plan-Seq-Learn (PSL)은 LLM의 고수준 계획, motion planning의 시퀀싱, RL의 저수준 제어 학습을 통합하여 사전 정의된 스킬 라이브러리 없이 장시간 로봇 작업을 해결한다.

Motivation

Achievement

Figure 3

Figure 3: Sample Efficiency Results. We plot task success rate as a function of the number of trials. PSL

How

Figure 2

Figure 2: Method overview. PSL decomposes tasks into a list of regions and stage termination conditions

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: PSL은 LLM, motion planning, RL의 상호 보완적 강점을 창의적으로 통합하여 사전 정의된 스킬 없이 장시간 로봇 작업을 효율적으로 해결하는 실질적이고 강력한 방법을 제시한다. 광범위한 실험과 명확한 설명으로 높은 가치의 기여를 입증한다.

같이 보면 좋은 논문

기반 연구LLM을 활용한 로봇 계획 및 행동 틀을 제안함으로써 Plan-Seq-Learn의 언어 기반 RL 구조 논리에 기초를 제공합니다.
기반 연구LLM-State 논문은 open world state representation 및 long-horizon reasoning을 다루어, PSL의 장시간 로봇 작업 계획 구조의 이론적 토대가 된다.
기반 연구Plan-Seq-Learn은 LLM과 RL을 결합해 장기 계획과 추론 실패 복구를 다루는 등, LLM3의 기호적 계획과 연속 모션 생성 방식의 후속 연구로 이어집니다.
기반 연구Plan-Seq-Learn은 인간-로봇 시퀀스 데이터에서 LLM 가이드 강화학습으로 unseen task 적응을 높이는 방안을 제시하여 Human2Robot의 데이터 학습/전이 과정을 확장합니다.
다른 접근MineDojo는 LLM 설명 기반 시뮬레이션 에이전트 학습에 중점을 두며 skill chaining보다는 open-ended 방식에 가깝다.
다른 접근Learning Universal Policies via Text-Guided Video Generation 논문도 LLM 기반 고수준 계획과 시퀀싱을 영상 기반 policy learning에 적용해, PSL과 task decomposition 관점에서 비교가 가능하다.
다른 접근VLA-Adapter는 LLM을 직접 agent policy로 사용하는 GLAM과 달리, 작은 VLA 모델을 효과적으로 fine-tuning/grounding하는 실용적 방법을 보여줍니다.
다른 접근VLA-Adapter는 작은 VLA 모델을 데이터 효율적으로 학습·적응하는 방법을 제시하여, LLM의 exploration guiding 접근과 대비되는 효율적 파인튜닝 사례입니다.
다른 접근Plan-Seq-Learn은 layer skipping보다는 시퀀스 기반의 LLM guiding RL 정책 학습을 통해 계산 효율성과 성능을 높이는 대체적 접근을 제시합니다.
다른 접근Fast-in-Slow는 듀얼 시스템 기반으로 고속/저속 제어를 결합하며, PSL의 시퀀스 러닝 방식과 대조적인 관점을 보여줍니다.
다른 접근Plan-Seq-Learn은 LLM 가이드 하에 RL로 장기 태스크를 학습하는 모델로, GR-3의 장기 horizon 수행 능력 강화와 대조적 접근을 보여줍니다.
다른 접근Plan-Seq-Learn은 LLM이 주도하는 navigation policy adaptation을 위한 RL 방법론을 통해, CorrectNav의 self-correction flywheel과 방식이 다르면서도 유사 목표를 지향합니다.
후속 연구Scaling Up and Distilling Down 논문은 언어 유도형 로봇 스킬의 규모 확장·지식 증류 방법론으로 PSL의 실질 확장 모델 사례다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드