optimize anything: A Unified Framework for LLM-Based Mathematical and Scientific Optimization
저자: Lakshya A Agrawal, Donghyun Lee, Shangyin Tan, Wenjie Ma, Karim Elmaaroufi, Rohit Sandadi, Sanjit A. Seshia, Koushik Sen, Dan Klein, Ion Stoica, Joseph E. Gonzalez, Omar Khattab, Alex Dimakis, Matei Zaharia | 날짜: 2026 | URL: https://openreview.net/forum?id=iI5UOnuBGw📄 PDF
⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
Figure 1. AIME prompt evolution for GPT-4.1-mini. Validation
LLM 기반 최적화(prompt optimization, evolutionary code search, agent-architecture search, hyperparameter optimization)를 하나의 declarative framework인 optimize_anything으로 통합하고, 4개 도메인에서 기존 특화 도구들을 능가하거나 대등한 성능을 보임을 실증한다.
Motivation
Known: GEPA, MIPROv2 같은 prompt optimizer, FunSearch, AlphaEvolve 같은 evolutionary code search 시스템, ADAS, AFlow 같은 agent-architecture search 시스템, Optuna 같은 classical hyperparameter optimizer가 각각의 영역에서 강력한 성능을 보였다.
Gap: 각 프레임워크는 island topology, evolve-block marker, framework-specific feedback hook 등 자신만의 abstraction을 부과하며 설계 범위 밖의 artifact 유형으로 확장되지 않아, text artifact를 scoring function 하에 개선한다는 동일한 근본 문제를 다루면서도 카테고리를 아우르는 단일 인터페이스가 존재하지 않는다.
Why: prompt, 알고리즘 코드, agent, numerical solver를 모두 동일한 text artifact 최적화 문제로 재정의함으로써, 도메인별 전용 알고리즘 개발 없이도 다양한 수학·과학적 discovery 문제를 하나의 general-purpose paradigm으로 해결할 수 있음을 시사하기 때문이다.
Approach: seed artifact(또는 seedless 모드의 자연어 objective)와 score 및 optional Side Information(SI)을 반환하는 evaluator를 입력으로 받아, GEPA의 Pareto-based reflective mutation을 backend로 사용해 candidate selection, reflection, search, proposal을 수행하는 단일 declarative API를 제시한다.
Achievement
Figure 2. Circle packing (n=26). optimize anything reaches
통합 시스템 성능 입증: optimize_anything이 AIME-2025 prompt evolution(GPT-4.1-mini 46.67%→60.0%, MIPROv2의 51.3% 상회), circle packing n=26(AlphaEvolve의 matched-proposer rerun 대비 우수), ARC-AGI agent evolution(10줄 seed에서 300줄+ 아키텍처로 진화, Gemini 3 Flash 32.5%→89.5%), blackbox numerical solver synthesis(Optuna 대비 hard problem 10개 중 7개에서 우세) 네 가지 상이한 도메인에서 전용 도구와 대등하거나 이를 능가함을 보였다.
두 가지 최적화 모드의 단일 인터페이스화: dataset과 valset 제공 여부만으로 single-task search와 generalization을 전환하며 별도 프레임워크 교체 없이 동일 API로 처리한다.
Side Information의 일급 API 계약화: compiler error, geometric constraint violation, per-puzzle trace, rendered image 등 다양한 diagnostic feedback을 균일한 API 계약을 통해 proposer에 전달하는 방식을 제안하고, circle packing에서의 ablation으로 이 기여를 검증했다.
How
Agrawal et al.(2026)의 GEPA(Pareto-based reflective LLM mutation)를 backend로 채택하여, 기존에 prompt optimization 전용으로 연구되던 알고리즘을 임의의 text artifact로 확장
evaluator가 candidate string을 받아 score와 optional SI dictionary(에러, 출력, 런타임, 이미지 등)를 반환하는 단일 API 계약을 정의
single-task 모드에서는 SI에서 도출한 sub-metric 기반 Pareto frontier를, generalization 모드에서는 example별 score 기반 Pareto frontier를 유지하며 frontier 상의 non-dominated candidate 빈도에 비례해 mutation 대상을 샘플링
코드 블록 오류, 문법 오류 등 흔한 LLM 생성 결함을 평가 전에 걸러내는 refiner step을 추가하여 GEPA를 prompt-only 영역에서 임의의 text artifact(코드, agent, solver)로 확장
AIME-2025 prompt evolution, circle packing(n=26), ARC-AGI agent evolution, EvalSet 기반 blackbox numerical optimization 등 4개 벤치마크에서 GPT-5.1, Gemini 3 Flash 등을 proposer로 사용해 실험 수행
Originality
prompt optimization, evolutionary code search, agent-architecture search, hyperparameter optimization이라는 이질적으로 취급되던 네 영역을 "text artifact를 scoring function 하에 개선"하는 동일한 문제로 재정의하고 이를 뒷받침하는 단일 declarative 인터페이스를 처음으로 제시
side information을 gradient의 text-optimization 대응물로 개념화하고 이를 evaluator contract 차원의 일급 시민으로 승격시킨 설계
single-task search와 generalization을 dataset/valset 유무라는 단순한 신호로 전환 가능하게 한 통합 모드 설계
Limitation & Further Study
workshop paper 성격상 각 도메인별 실험이 단일 backend(GEPA)와 특정 proposer 모델(GPT-5.1, Gemini 3 Flash 등)에 의존해, backend-agnostic 주장에 대한 다양한 backend 교차 검증이 부족함
circle packing 등 일부 비교가 "matched rerun"이라는 제한된 조건 하에서 이루어져 원 논문(AlphaEvolve)과의 완전히 동일한 조건 비교인지 불명확
ARC-AGI agent가 300줄 이상으로 진화하는 과정에서 해석 가능성, 재현성, 계산 비용(토큰/시간)에 대한 정량적 분석이 본문 발췌에서는 제시되지 않음
10개 hard blackbox 문제 중 3개에서 Optuna에 뒤처지는 결과에 대한 원인 분석이 필요
후속 연구로 더 다양한 backend와의 결합, 대규모 실제 과학적 discovery 문제로의 확장, computational cost 비교가 요구됨
기반 연구SPECTER2 유사도 0.93 기준으로 'optimize anything: A Unified Framework for LLM-Based Mathematical and Scientific Optimization'의 AI4S 방법론을 'Mlr-copilot: Autonomous machine learning research based on large language models agents'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Augmenting large language models with chemistry tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.