Adaptive Proxy Evaluation for Autonomously Improving ML Agents

저자: Samuel Verboomen, Alesia Ivanova, Yogendra Manawat, Prannay Hebbar, Selvam Palanimalai, Kunal Bhatia, Vignesh Baskaran | 날짜: 2026 | URL: https://openreview.net/forum?id=OEmE8fF4OF 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 2

Figure 2. Method overview. An Overseer Agent runs the search in phases. Within a phase, an external harness scores every

이 논문은 자율 ML 에이전트가 후보 솔루션을 탐색할 때 사용하는 proxy evaluation(축소 학습, 서브샘플링 데이터 등)의 신뢰성 문제를 해결하기 위해, 모든 후보를 동일 조건에서 평가하고 탐색이 수렴함에 따라 fidelity를 점진적으로 높이는 외부 adaptive proxy layer를 제안한다. 이를 MLEvolve라는 Monte Carlo Graph Search 프레임워크에 구현하여 MLE-bench의 Ventilator Pressure Prediction task에서 12시간 예산 내 state-of-the-art MAE 0.1354를 달성했다.

Motivation

Achievement

Figure 1

Figure 1. State-of-the-art MAE on MLE-Bench Ventilator Pressure

  1. State-of-the-art 성능 달성: MLE-bench Ventilator Pressure Prediction task에서 12시간 예산, task-specific tuning 없이 단일 실행으로 MAE 0.1354를 달성하여 Claude Code, InternAgent, AIDE, R&D-Agent, ML-Master 2.0, AIRA-dojo, MLEvolve 등 기존 모든 방법을 능가했다.
  2. Bounded proxy evaluation: 각 phase 내 모든 후보를 동일하고 deterministic한 조건에서 채점하는 체계를 마련했다.
  3. Trajectory 기반 scoring: AUC, gain, instability를 고정 checkpoint에서 결합해 노이즈가 있는 endpoint loss보다 안정적인 학습을 보상하는 점수 체계를 도입했다.
  4. Bradley-Terry arena: proxy가 유발하는 편향(빠르게 수렴하는 architecture family에 대한 편향)을 code-only pairwise 비교를 통해 교정하는 cross-family 랭킹 메커니즘을 구현했다.
  5. Overseer Agent: 초기 proxy 설정 calibration, phase transition 스케줄링, iteration/time budget 관리를 인간 개입 없이 자동으로 수행하는 에이전트를 구현했다.

How

Figure 2

Figure 2. Method overview. An Overseer Agent runs the search in phases. Within a phase, an external harness scores every

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: evaluation을 search의 first-class 요소로 재정의하고 이를 adaptive proxy와 Bradley-Terry arena로 정교하게 구현한 실용적이고 독창적인 접근이며, 단일 task에서의 강력한 실증 결과가 인상적이지만 일반화 가능성에 대한 추가 검증이 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.91로 LLM Agent Reasoning Training와 Molecular Simulation and Generative Modeling가 맞닿아, 'ChemGymRL: A Customizable Interactive Framework for Reinforcement Learning for Digital Chemistry'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'WebThinker: Empowering Large Reasoning Models with Deep Research Capability'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Agent Reasoning Training와 Agentic AI for Scientific Automation가 맞닿아, 'DeepScientist: Advancing Frontier-Pushing Scientific Findings Progressively'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근자율 ML 에이전트 평가 문제에 대한 다른 접근법을 제시하는 연구이다.
다른 접근적응적 평가 전략을 통한 탐색 효율화라는 유사한 문제를 다룸
다른 접근동일한 proxy evaluation 신뢰성 문제에 대한 다른 해법 제시
후속 연구proxy evaluation의 신뢰성 문제를 확장하여 다룸
응용 사례ML 에이전트의 자율적 탐색 과정에 신뢰도 조정 기법을 적용함
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드