Self-Improving Language Models with Bidirectional Evolutionary Search

저자: Guowei Xu, Zhenting Qi, Huangyuan Su, Weirui Ye, Himabindu Lakkaraju, Sham M. Kakade, Yilun Du | 날짜: 2026 | URL: https://openreview.net/forum?id=h9NkujtFI6 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Comparison of tree search and Bidirectional Evolutionary Search (BES). Left: Tree search constructs candidates

본 논문은 forward evolutionary search와 backward goal decomposition을 결합한 Bidirectional Evolutionary Search (BES)를 제안하여, best-of-N sampling과 tree search가 가진 sparse verification signal 및 autoregressive expansion에 의한 탐색 범위 제한 문제를 동시에 해결한다.

Motivation

Achievement

Figure 3

Figure 3. EMA-smoothed validation accuracy on logical reasoning.

  1. 이론적 정당화: expansion-only search로 생성된 후보들이 narrow entropy shell에 국한됨을 증명하고, evolution operator가 이 shell을 벗어날 수 있음과 backward search가 정답을 찾기 위해 필요한 샘플 수를 exponential하게 줄일 수 있음을 이론적으로 보였다.
  2. post-training 성능 향상: GRPO, MaxRL, Tree-GRPO 등 주류 post-training 알고리즘이 개선에 실패하는 어려운 logical reasoning 및 multi-hop reasoning task에서 BES가 일관되게 유효한 training sample을 발견해 base model 성능을 향상시켰다.
  3. inference-time 성능 향상: 세 가지 open problem solving benchmark에서 BES가 OpenEvolve, GEPA, ShinkaEvolve 등 기존 open-source framework 대비 평균 성능과 best-case 성능 모두에서 우수함을 보였다.

How

Figure 2

Figure 2. Forward search operators. (a) Expansion: the policy generates new steps (yellow). (b) Combination: two traject

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 생물학적 진화 개념을 search 알고리즘에 창의적으로 접목하고 이를 이론적으로 뒷받침하는 동시에 post-training과 inference 양쪽에서 실질적 성능 향상을 보인 완성도 높은 연구이나, evolution operator의 안정성과 backward decomposition의 신뢰성에 대한 추가 검증이 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 Agentic AI for Scientific Automation가 맞닿아, 'Hiagent: Hierarchical working memory management for solving long-horizon agent tasks with large language model'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 Agentic AI for Scientific Automation가 맞닿아, 'EvoScientist: Towards Multi-Agent Evolving AI Scientists for End-to-End Scientific Discovery'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구evolutionary search 기반 self-improvement의 방법론적 기반이 된다
기반 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'SEVerA: Verified Synthesis of Self-Evolving Agents'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근best-of-N sampling과 tree search의 한계를 다루는 다른 접근법을 제시한다
다른 접근다중 LLM 협업을 통한 이산 최적화 문제 해결의 다른 접근을 제시한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드