Code as Policies: Language Model Programs for Embodied Control

저자: Jacky Liang, Wenlong Huang, Fei Xia, Peng Xu, Karol Hausman, Brian Ichter, Pete Florence, Andy Zeng | 날짜: 2022-09-16 | URL: https://arxiv.org/abs/2209.07753 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Fig. 1: Given examples (via few-shot prompting), robots can use code-writing

Large Language Model(LLM)을 활용하여 자연어 명령을 로봇 정책 코드로 직접 변환하는 "Code as Policies" 방식을 제안하며, few-shot prompting과 hierarchical code-gen을 통해 복잡한 로봇 행동을 실시간으로 생성한다.

Motivation

Achievement

Figure 2

Fig. 2: Code as Policies can follow natural language instructions across diverse domains and robots: table-top manipulat

How

Figure 1

Fig. 1: Given examples (via few-shot prompting), robots can use code-writing

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 이 논문은 LLM을 로봇 정책 생성에 직접 적용하는 창의적인 방식을 제시하며, hierarchical code-gen을 통한 성능 개선과 다양한 실제 로봇 플랫폼에서의 검증으로 강한 임팩트를 가진다. 다만 생성 코드의 안정성 검증과 실시간 성능 평가가 보완되면 더욱 완성도 높은 연구가 될 것이다.

같이 보면 좋은 논문

기반 연구Code as Policies는 language model 기반의 constraint-aware policy 실행이라는 차원에서, LLM grounding을 통한 embodied control에 실제로 적용 확장 가능한 설계 아이디어를 줍니다.
기반 연구Gemini Robotics 논문은 대규모 AI 기반 물리적 로봇 제어의 기반 아키텍처를 상세히 설명한다.
다른 접근Code as Policies는 언어 모델 기반 정책 실행을 제안하며, 비슷하게 LLM의 지식과 실제 실행을 연결하나 접근 방식이 다릅니다.
다른 접근Instruct2Act 논문은 LLM을 활용하여 멀티모달 지시를 순차적 로봇 행동으로 매핑하는 점에서 유사하며, 정책 코드 생성의 대안적 방법이다.
후속 연구Code as Policies 논문에서 제시한 LLM 기반 정책 코드 생성 개념이 Instruct2Act 프레임워크의 이론적 근간이다.
다른 접근Code as Policies는 LLM을 행동 정책 생성에 사용하는 또다른 방향성을 보여줌.
다른 접근LLM-State는 LLM이 이해하는 state representation을 통해 정책 의사결정을 하며, Code as Policies의 직접 코딩 방식과 통합 또는 대조적으로 적용될 수 있습니다.
다른 접근Code as Policies 논문은 언어적 지시를 실제 로봇 정책 코드로 직접 변환하는 접근법을 제안한다.
다른 접근MineDreamer는 chain-of-imagination을 활용해, 행동 생성 및 실행 코드를 더 복합적인 reasoning에 기반해 생성하는 접근으로 Code as Policies와 비교된다.
다른 접근Code as Policies 논문은 RL기반 로봇 컨트롤러의 언어프로그래밍 형태화를 시도하므로, Deep RL 성공사례 베이스와의 적용 범위 및 방식의 차이를 비교할 수 있습니다.
다른 접근Code as Policies는 LLM/VLM 기반 코드 실행과 정책 프로그래밍을 다루며, 코드를 통한 로봇제어의 또다른 방식으로 Code-as-Monitor와 비교해볼 만하다.
후속 연구Code-as-Monitor는 Code as Policies의 LLM 행동 코드 생성 방식을 실시간 constraint monitoring으로 확장하는 패러다임을 제시한다.
다른 접근Code as Policies 논문은 language model 기반 계획-실행 구조를 고려하며, diffusion 기반 동역학 결합과는 다른 직접적 정책 생성 방식을 비교할 수 있다.
후속 연구RT-2는 웹 지식 전이 기반 VLA 모델의 실환경 적용 연구로, LLM 기반 코드-행동 변환의 실 증거를 제공한다.
후속 연구CoPAL은 Code as Policies의 LLM 기반 정책 생성 구조 위에, 코드 실행 안전성과 오프라인/온라인 제약 조건을 적용한 corrective planning 모듈을 추가합니다.
후속 연구Code as Policies 논문은 LLM 기반 정책과 행동 실행 브릿징 방법론의 초기 이론적 기반을 제공하여, RoBridge의 계층적 아키텍처 이해에 도움이 된다.
후속 연구1334는 코드 기반의 embodied control을 다루어 Embodied-R1에서 '포인팅'을 embodiment-agnostic 표현으로 사용하는 이론적 기반이 됩니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드