ENPIRE: Agentic Robot Policy Self-Improvement in the Real World
저자: Wenli Xiao, Jia Xie, Tonghe Zhang, Haotian Lin, Letian "Max" Fu, Haoru Xue, Jalen Lu, Yi Yang, Cunxi Dai, Zi Wang, Jimmy Wu, Guanzhi Wang, S. Shankar Sastry, Ken Goldberg, Linxi "Jim" Fan, Yuke Zhu, Guanya Shi | 날짜: 2026 | DOI: 10.48550/ARXIV.2606.19980📄 PDF
⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
Essence
Figure 2: Overview of physical autoresearch framework ENPIRE. To solve a dexterous task in the real world,
ENPIRE는 coding agent를 활용하여 실제 로봇에서 정책을 자동으로 개선하는 폐루프 시스템이다. 환경 구성(EN), 정책 개선(PI), 롤아웃(R), 진화(E) 네 개 모듈로 구성되어 human-in-the-loop 절차를 자동화하고 로봇 팀 규모로 확장 가능한 물리적 자동 연구 프레임워크를 제시한다.
Motivation
Known: Coding agent를 사용한 자동 알고리즘 탐색은 디지털 환경에서 성공했지만, 실세계 로봇 정책 개선을 위한 자동화된 절차는 부족했다. 현존 방법들은 데이터 수집, 평가, 알고리즘 조정 과정에서 인간 감독을 크게 필요로 한다.
Gap: 실세계 정책 학습 자동화의 핵심 추상화(repeatable feedback loop)가 부재하다. Coding agent들은 물리적 폐루프 가설 검증을 위한 자동 정책 배포, 평가, 환경 리셋 인터페이스가 없으며, 로봇 플릿 규모에서의 자원 효율성 측정 방법도 정의되지 않았다.
Why: 일반적 물리 지능(general physical intelligence) 달성의 주요 병목이 인간 감독이고, 이를 자동화하면 로봇 정책 학습 속도를 근본적으로 가속화할 수 있기 때문이다. 또한 로봇 팀 규모 확장에서의 효율성 문제를 해결해야 자동 연구가 실용적이 된다.
Approach: 2단계 접근: (1) EN 단계에서 인간 피드백으로 자동 환경 인터페이스(안전 제약, 자동 리셋, 검증)를 구성하고 사전에 최적화, (2) PIRE 단계에서 실세계 보상 신호만으로 coding agent가 완전 자율적으로 정책 개선. 로봇 플릿 규모에서는 분산 agent 팀이 비동기로 훈련 레시피를 테스트하며 성공률 기반으로 가설을 선택/폐기한다.
ENPIRE 프레임워크 구현: 4개 핵심 모듈(EN, PI, R, E)을 통해 coding agent 기반 물리적 자동 연구를 가능하게 함. 실세계 정책 성공률: pin insertion, zip tie cutting, tool use 등 도전적 조작 작업에서 99% 성공률 달성. Convergence 속도: pin insertion에서 인간-in-the-loop 최신 방법보다 빠른 100% 수렴 시간. 로봇 플릿 확장성: 초기 병렬화 확장 성공, Mean Token Utilization(MTU)와 Mean Robot Utilization(MRU) 지표 제안으로 효율성 측정 가능하게 함.
총평: ENPIRE는 coding agent를 활용한 실제 로봇 정책 자동 개선의 첫 체계적 프레임워크로서 상당한 기여를 한다. 자동 환경 구성, 폐루프 정책 최적화, 로봇 플릿 확장의 세 영역에서 기술적 혁신을 제시하고, 도전적 조작 과제에서 높은 성공률과 수렴 속도를 입증했다. 다만 환경 구성 단계의 인간 의존성, 대규모 플릿 효율성 미검증, 일반화 능력 평가 부족이 제약요소다. 로봇 자동 연구 커뮤니티에 실질적 기여로 평가된다.
후속 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'ENPIRE: Agentic Robot Policy Self-Improvement in the Real World'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 Formal Proof Verification Automation와 Agentic AI for Scientific Automation가 맞닿아, 'ENPIRE: Agentic Robot Policy Self-Improvement in the Real World'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.91로 Computational Molecular Design와 Agentic AI for Scientific Automation가 맞닿아, 'ENPIRE: Agentic Robot Policy Self-Improvement in the Real World'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 Scientific Machine Learning for Dynamics와 Agentic AI for Scientific Automation가 맞닿아, 'ENPIRE: Agentic Robot Policy Self-Improvement in the Real World'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 Formal Proof Verification Automation와 Agentic AI for Scientific Automation가 맞닿아, 'ENPIRE: Agentic Robot Policy Self-Improvement in the Real World'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.