Evolutionary System Prompt Learning for Reinforcement Learning in LLMs

저자: Lunjun Zhang, Ryan Chen, Bradly C. Stadie | 날짜: 2026 | URL: https://openreview.net/forum?id=oeOAs8QiLJ 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 2

E-SPL은 LLM의 system prompt를 진화 알고리즘(mutation, crossover)으로 함께 최적화하면서 동시에 RL로 모델 가중치를 업데이트하여, 선언적 지식(prompt)과 절차적 지식(weights)을 상호 보완적으로 학습시키는 방법이다.

Motivation

Achievement

Figure 3
  1. Easy-to-hard generalization 성능 향상: AIME→BeyondAIME 설정에서 RL 성공률을 38.8%→45.1%로 향상시켰으며, 이는 reflective prompt evolution 단독 사용(40.0%)보다 우수하다.
  2. 다양한 reasoning benchmark에서 일관된 개선: DeepSeek v3.1 기반으로 AIME 2025에서 56.3%→60.6%, HMMT 2025 November test에서 50.0%→52.7%로 성능이 향상되었다.
  3. Agentic task 성능 향상: gpt-oss-120b 기반 agentic search task에서 제한된 데이터로도 RL 성능을 44.2%→48.6%로 개선했다.
  4. 해석 가능한 declarative 지식 발견: 학습된 system prompt들이 수학 문제 풀이를 위한 구체적 휴리스틱, 자기검증 전략, 실패 모드 회피 지침 등을 명시적으로 담고 있음을 보였다(Figure 4).

How

Figure 5

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: RL과 진화적 system prompt 최적화를 하나의 학습 루프에 통합하여 선언적/절차적 지식의 자연스러운 분업을 유도한다는 아이디어가 참신하고, easy-to-hard generalization 등 여러 벤치마크에서 일관된 성능 향상을 실증적으로 보여준 견고한 연구이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 Agentic AI for Scientific Automation가 맞닿아, 'HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 Agentic AI for Scientific Automation가 맞닿아, 'Hiagent: Hierarchical working memory management for solving long-horizon agent tasks with large language model'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근LLM 에이전트의 장기 작업 수행을 위한 메모리 관리 방식을 다루는 유사한 연구로 보인다.
기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구GRPO 기반 강화학습의 이론적 토대를 제공하는 선행 연구이다.
기반 연구진화 알고리즘 기반 LLM 최적화의 공통 방법론적 기초를 제공한다.
기반 연구결정 트리 기반 시각 판단 시스템의 확장 연구
기반 연구non-stationary drift를 constraint로 활용하는 아이디어의 확장
기반 연구RL과 진화 알고리즘 결합의 방법론적 기초를 제공한다.
기반 연구지식 전이 방법론을 확장한 관련 연구
기반 연구trajectory memory 및 preference learning을 활용한 LLM 협업 구조를 확장한다.
다른 접근system prompt와 모델 가중치의 공동 최적화라는 유사 문제를 다룬다.
다른 접근best-of-N sampling과 tree search의 한계를 다루는 다른 접근법을 제시한다
다른 접근LLM 에이전트가 재사용 가능한 지식을 축적하는 문제에 대해 유사한 목표를 갖지만 다른 구축 메커니즘을 제안한다.
다른 접근선언적/절차적 지식 상호보완 학습의 다른 접근을 제시한다.
후속 연구reasoning agent와 verification agent 상호작용의 기초 이론 공유
다른 접근weak supervision을 통한 강한 모델 개선의 대안적 방법
다른 접근선언적 지식과 절차적 지식을 함께 최적화하는 유사한 프레임워크이다.
다른 접근명시적 CoT 없이 내재적 추론을 분석하는 유사한 접근이다.
후속 연구reasoning 데이터 필터링의 기초적 방법론을 제공한다.
후속 연구LLM safety alignment의 이론적 배경을 제공하는 선행 연구
후속 연구vision-language model의 캘리브레이션 및 confidence 연구의 기반이 된다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드