EvoMaster: A Foundational Evolving Agent Framework for Agentic Science at Scale

저자: Xinyu Zhu, Yuzhu Cai, Zexi Liu, Cheng Wang, Fengyang Li, Wenkai Jin, Wanxu Liu, Zehao Bing, Bingyang Zheng, Jingyi Chai, Shuo Tang, Rui Ye, Yuwen Du, Xianghe Pang, Yaxin Du, Tingjia Miao, Yuzhi Zhang, Ruoxue Liao, ding zhaohan, Linfeng Zhang, Yanfeng Wang, Weinan E, Siheng Chen | 날짜: 2026 | URL: https://openreview.net/forum?id=lidiprht3N 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 3

Figure 3. Overall architecture of EvoMaster.

EvoMaster는 다양한 과학 분야에서 재사용 가능한 domain-agnostic 기반 harness를 제공하면서, 반복적 자기진화(self-evolution)를 통해 가설을 정제하고 지식을 축적하는 foundational evolving agent framework를 제안한다.

Motivation

Achievement

Figure 2

Figure 2. Evolving performance improvement of EvoMaster on

  1. 폭넓은 벤치마크 우위: 10개 벤치마크(과학 연구/코딩/실험, 과학적 추론 및 정보 탐색, 실용적 과학 문제 해결) 중 9개에서 OpenHands, OpenClaw, Codex 대비 최고 점수를 달성했다.
  2. 최고 평균 성능: 네 agent 중 EvoMaster가 평균 58.0%로 가장 높은 점수를 기록해 전반적인 효능과 일반성을 검증했다.
  3. 지속적 자기진화 실증: MLE-Bench와 같은 long-horizon 과제에서 시간에 따라 점진적으로 정확도가 향상되는 self-evolution 양상을 보였다(Figure 2).
  4. 생태계 구축: EvoMaster를 기반으로 ML-Master 2.0, X-Master, Browse-Master, PhysMaster, EmboMaster 등 다양한 도메인의 SciMaster 에이전트 생태계를 육성했다.

How

Figure 3

Figure 3. Overall architecture of EvoMaster.

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: EvoMaster는 Agentic Science를 위한 domain-agnostic하고 self-evolving한 foundational agent framework로서, 폭넓은 벤치마크에서 우수한 성능과 생태계 확장성을 실증적으로 보여준 의미 있는 기여이다. 다만 self-evolution 메커니즘의 세부 기술적 근거와 단일 backend model 의존성에 대한 추가 검증이 향후 필요하다.

같이 보면 좋은 논문

기반 연구병원 시뮬레이션 환경을 다른 도메인으로 확장한 연구
기반 연구SPECTER2 유사도 0.95로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'InternAgent: When Agent Becomes the Scientist -- Building Closed-Loop System from Hypothesis to Verification'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구자기진화 기반 에이전트 프레임워크의 공통 방법론적 기반이다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'BloClaw: An Omniscient, Multi-Modal Agentic Workspace for Next-Generation Scientific Discovery'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.95로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'EvoScientist: Towards Multi-Agent Evolving AI Scientists for End-to-End Scientific Discovery'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구dual-track measurement protocol 개념을 확장한 연구이다.
다른 접근복잡한 과학적 추론 과정을 자동화하는 LLM 에이전트라는 공통 주제를 다룬다.
다른 접근인간-AI 관계를 다른 관점에서 재개념화한다.
다른 접근바이오의학 연구에서 자기진화형 AI 에이전트를 활용하는 유사한 접근법을 제시한다.
다른 접근멀티에이전트 기반 과학 발견 자동화의 유사한 접근 방식이다.
다른 접근가설 정제와 지식 축적을 위한 다른 에이전트 구조를 제시한다.
다른 접근multi-agent 시스템 실패 평가라는 공통 문제를 다룬다.
다른 접근도메인 무관 기반 harness를 활용한 유사한 evolving agent 접근이다.
다른 접근가설 정제와 지식 축적을 통한 자기진화 프레임워크라는 유사 목표를 가진다.
후속 연구LLM 에이전트 협업의 기초적 프레임워크를 제공한다.
후속 연구LLM 에이전트의 인간 유사 사회적 행동 연구의 기본 틀을 제공한다.
후속 연구semantic update direction 기반 agent 진화의 방법론적 기초를 제공한다.
반론/비판domain-agnostic self-evolving agent 프레임워크를 지향한다는 점에서 특정 도메인(문헌 검색)에 특화된 PaSaMaster와 대비되는 접근이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드