BenchEvolver: Frontier Task Synthesis Via Solution-Centric Evolution

저자: Yangzhen Wu, Aaron J. Li, Wenjie Ma, Ziheng Zhou, Li Cao, Mert Cemri, Shu Liu, Yuran Xiu, Chenxiao Yan, Haikun Zhao, Bin Yu, Ion Stoica, Dawn Song | 날짜: 2026 | URL: https://openreview.net/forum?id=qIOCYF9eVB 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

BenchEvolver는 기존의 포화된 프로그래밍 벤치마크(LiveCodeBench, SciCode)의 reference solution을 구조적으로 진화(evolve)시켜, 실행 가능한 semantics에 기반해 더 어렵지만 검증 가능한 새로운 task를 자동 생성하는 solution-centric evolutionary framework이다.

Motivation

Achievement

Figure 3
  1. BenchEvolver 프레임워크 제안: solution 공간에서 생성하고, 독립적 consistency check로 검증하며, 실증적 모델 실패율로 선택하는 3원칙 기반의 closed-loop 진화 프레임워크를 제시했다.
  2. 다중 도메인 검증: LiveCodeBench(경쟁 프로그래밍)와 SciCode(과학 코딩) 두 도메인, 여러 evolver/target 모델에 걸쳐 유효하고 다양한 evolved task를 생성하며 target model의 Pass@1을 대폭 낮췄고, 심지어 evolver 자신에게도 어려운 task를 만들어냈다.
  3. RL을 통한 self-improvement 실증: gpt-oss-20b를 evolver이자 target으로 사용해 seed+evolved 혼합 데이터로 RL 학습 시 LCB v6 Hard에서 +8.7, LCB-Pro Easy에서 +8.3 Pass@1 향상을 달성했으며, 이는 seed-only 대비 각각 70.7%, 34.8% 더 큰 개선폭이다.

How

Figure 2

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 벤치마크 포화 문제에 대해 solution-centric evolution이라는 참신하고 실행 가능한 해법을 제시하고, 이를 self-improvement RL 학습 신호로까지 연결한 점에서 의미 있는 기여이나, 검증 범위가 코딩 도메인과 단일 모델 계열에 국한되어 일반화 가능성에 대한 추가 검증이 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 Formal Proof Verification Automation와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Evaluating large language models trained on code'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구코드 에디터 및 실행 에이전트 구조를 확장한 연구이다.
기반 연구SPECTER2 유사도 0.93로 Formal Proof Verification Automation와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Autoreproduce: Automatic AI Experiment Reproduction with Paper Lineage'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Formal Proof Verification Automation와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Can language models falsify? evaluating algorithmic reasoning with counterexample creation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구그래프 생성 능력 평가 방법을 실제 LLM 진단에 적용
기반 연구다양한 과학 분야 실험에 ERA와 유사한 시스템을 적용한 사례이다.
다른 접근LLM 도구 활용 능력 평가를 위한 다른 벤치마크 시스템
다른 접근검증 가능한 코드 생성 벤치마크 확장을 위한 다른 접근법을 제시하는 연구로 보임
다른 접근코드 검증 가능한 새로운 task 합성에 대한 대안적 방법
다른 접근포화된 벤치마크 문제를 해결하는 다른 task 생성 방법론
다른 접근포화된 코딩 벤치마크 문제에 대한 유사한 task synthesis 접근법을 제시한다.
다른 접근LLM 기반 진화적 프로그램 탐색에 대한 다른 구조적 접근을 제시한다.
다른 접근코딩 벤치마크의 난이도 증가를 위한 유사한 대안적 방법론이다.
다른 접근Lean 기반 명세 실패 귀속 방법의 대안적 구현이다.
응용 사례reference solution 기반 태스크 진화 방법을 실제 벤치마크에 적용한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드