Squeeze Evolve: Unified Multi-Model Orchestration for Verifier-Free Evolution

저자: Monishwaran Maheswaran, Leon Lakhani, Zhongzhu Zhou, Shijia Yang, Junxiong Wang, Coleman Richard Charles Hooper, Yuezhou Hu, Rishabh Tiwari, Jue WANG, Harman Singh, Qingyang Wu, Yuqing Jian, Ce Zhang, Kurt Keutzer, Tri Dao, Xiaoxia Wu, Ben Athiwaratkun, James Zou, Chenfeng Xu | 날짜: 2026 | URL: https://openreview.net/forum?id=2rREyVB08Y 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 4

Figure 4. SQUEEZE EVOLVE overview. The expensive Model 2 generates the initial population; subsequent loops recombine gr

Squeeze Evolve는 verifier-free evolution에서 발생하는 다양성 붕괴(diversity collapse)와 비용 비효율 문제를 동시에 해결하기 위해, 진화 파이프라인의 각 단계(초기화, 생성, 재조합, fitness 추정)에 서로 다른 비용-성능 특성을 가진 모델을 confidence 기반으로 라우팅하는 multi-model orchestration 프레임워크이다.

Motivation

Achievement

Figure 1

Figure 1. SQUEEZE EVOLVE shifts the cost–capability frontier left by combining verifier-free evolution with multi-model

  1. 비용-성능 프론티어 개선: AIME 2025, HMMT 2025, LiveCodeBench V6, GPQA-Diamond, ARC-AGI-V2, MMMU-Pro, BabyVision 등 9개 벤치마크에서 단일 모델 진화 대비 API 비용을 최대 ~3배 절감하면서 정확도를 유지 또는 향상.
  2. ARC-AGI-V2 신기록: 코드 실행 없이 $7.74/task로 97.5%를 달성해 새로운 state-of-the-art cost-capability frontier를 세움 (GPT-5.4-Pro의 92.2%, $17.60 대비).
  3. 멀티모달 효율성 입증: 이미지 처리를 하지 않는 저비용 텍스트 전용 모델이 vision-capable 고비용 모델과 동등하거나 우수한 성능을 2.3–2.5배 저렴하게 달성, 시각 이해가 초기화 단계에서만 주로 필요함을 보임.
  4. verifier-free 방법 최초로 verifier-based 방법과 동등/우월: circle packing discovery task에서 AlphaEvolve 등 verifier-based 진화 방법의 성능을 처음으로 따라잡거나 능가.
  5. 서빙 처리량 대폭 향상: custom confidence engine으로 scoring 지연을 4–10배 줄이고, 고정 예산 서빙 처리량을 최대 ~10배 향상, 라우팅 오버헤드는 2.4–4.3%에 불과.
  6. 에이전틱 태스크 적용: Terminal-Bench 2.0에서 재실행 없는 순수 재조합 레이어로서 GPT-5.4 제출물 위에 적용해 pass@1을 81.80%에서 88.76%로 향상.

How

Figure 4

Figure 4. SQUEEZE EVOLVE overview. The expensive Model 2 generates the initial population; subsequent loops recombine gr

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: verifier-free evolution의 핵심 병목인 다양성 붕괴와 비용 비효율을 통합적 프레임워크와 경량 confidence 라우팅으로 동시에 해결한 실용적이고 임팩트 있는 연구로, 광범위한 벤치마크에서의 일관된 성능-비용 개선이 인상적이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'ShinkaEvolve: Towards Open-Ended And Sample-Efficient Program Evolution'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구evolutionary pipeline 설계의 기반이 되는 연구이다.
다른 접근실시간 안전성 모니터링을 다른 방법론으로 구현함.
기반 연구진화적 파이프라인 설계의 이론적 토대를 제공하는 선행 연구이다.
다른 접근모델 구조와 파라미터에 대한 joint posterior 추론을 위한 다른 접근법을 제시한다.
기반 연구적대적 공격 탐지 방법을 실제 시나리오에 적용한 사례이다.
다른 접근pairwise verification을 활용한 다른 검증 프레임워크를 제시한다.
다른 접근verifier-free evolution 문제에 다른 다중모델 오케스트레이션 전략으로 접근한다.
다른 접근구조화된 semantic 정보를 활용한 효율적 탐색 방법이라는 유사한 접근이다.
후속 연구테스트 스위트 검증의 기초 방법론을 제공한다.
후속 연구다양성 붕괴 문제 해결을 위한 비용-효율 전략을 확장한다.
응용 사례LLM 기반 진화 알고리즘의 실제 응용 사례를 다룬다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드