optimize anything: A Unified Framework for LLM-Based Mathematical and Scientific Optimization

저자: Lakshya A Agrawal, Donghyun Lee, Shangyin Tan, Wenjie Ma, Karim Elmaaroufi, Rohit Sandadi, Sanjit A. Seshia, Koushik Sen, Dan Klein, Ion Stoica, Joseph E. Gonzalez, Omar Khattab, Alex Dimakis, Matei Zaharia | 날짜: 2026 | URL: https://openreview.net/forum?id=iI5UOnuBGw 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. AIME prompt evolution for GPT-4.1-mini. Validation

LLM 기반 최적화(prompt optimization, evolutionary code search, agent-architecture search, hyperparameter optimization)를 하나의 declarative framework인 optimize_anything으로 통합하고, 4개 도메인에서 기존 특화 도구들을 능가하거나 대등한 성능을 보임을 실증한다.

Motivation

Achievement

Figure 2

Figure 2. Circle packing (n=26). optimize anything reaches

  1. 통합 시스템 성능 입증: optimize_anything이 AIME-2025 prompt evolution(GPT-4.1-mini 46.67%→60.0%, MIPROv2의 51.3% 상회), circle packing n=26(AlphaEvolve의 matched-proposer rerun 대비 우수), ARC-AGI agent evolution(10줄 seed에서 300줄+ 아키텍처로 진화, Gemini 3 Flash 32.5%→89.5%), blackbox numerical solver synthesis(Optuna 대비 hard problem 10개 중 7개에서 우세) 네 가지 상이한 도메인에서 전용 도구와 대등하거나 이를 능가함을 보였다.
  2. 두 가지 최적화 모드의 단일 인터페이스화: dataset과 valset 제공 여부만으로 single-task search와 generalization을 전환하며 별도 프레임워크 교체 없이 동일 API로 처리한다.
  3. Side Information의 일급 API 계약화: compiler error, geometric constraint violation, per-puzzle trace, rendered image 등 다양한 diagnostic feedback을 균일한 API 계약을 통해 proposer에 전달하는 방식을 제안하고, circle packing에서의 ablation으로 이 기여를 검증했다.

How

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 서로 다른 전용 알고리즘이 필요하다고 여겨졌던 네 가지 최적화 문제를 하나의 declarative 프레임워크로 통합하고 이를 다각도로 실증한 점에서 실용적 가치가 크며, workshop paper로서 개념적 기여와 실험적 근거가 설득력 있게 제시되어 있다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93 기준으로 'optimize anything: A Unified Framework for LLM-Based Mathematical and Scientific Optimization'의 AI4S 방법론을 'Mlr-copilot: Autonomous machine learning research based on large language models agents'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Augmenting large language models with chemistry tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구one-shot 하이퍼파라미터 추천 워크플로우를 확장한다.
기반 연구auditable하고 실행 가능한 의료 도구 설계 방법론을 확장한다.
후속 연구declarative optimization framework를 확장하여 다양한 최적화 유형에 적용한다.
기반 연구evaluation hack 탐지 기법을 확장한다.
기반 연구basin-hopping 기법을 LLM 기반 탐색에 확장 적용한다.
기반 연구KernelBench 기반 벤치마크를 TPU 환경으로 확장한다.
기반 연구neuro-symbolic 파이프라인을 활용한 자동 발견 시스템을 확장함
다른 접근evolutionary code search를 위한 다른 최적화 접근법을 제시한다.
기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'SEVerA: Verified Synthesis of Self-Evolving Agents'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구LLM 기반 최적화 프레임워크 구축의 방법론적 기반을 공유한다.
다른 접근LLM 기반 최적화를 open-ended task discovery라는 다른 문제 설정에서 다룬다.
후속 연구조합 기하학 문제 해결의 기초 연구
응용 사례통합 최적화 프레임워크를 agent-architecture search 문제에 실제 적용한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드