MARS: Modular Agent with Reflective Search for Automated AI Research

저자: Jiefeng Chen, Bhavana Dalvi Mishra, Jaehyun Nam, Rui Meng, Tomas Pfister, Jinsung Yoon | 날짜: 2026 | URL: https://openreview.net/forum?id=qWE13uu99a 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 2

Figure 2. Overview of the MARS Framework. MARS reformulates long-horizon coding as a search for an optimal software repo

MARS는 Budget-Aware MCTS, Modular Design-Decompose-Implement 파이프라인, Comparative Reflective Memory 세 가지 축으로 구성된 자율 AI 연구 에이전트 프레임워크로, MLE-Bench에서 오픈소스 프레임워크 중 최고 성능을 달성한다.

Motivation

Achievement

Figure 1

Figure 1. The “Aha!” moment of MARS on the challenging iMet-2020-FGVC7 task. The visualization tracks validation perform

  1. MLE-Bench 최고 성능: 오픈소스 프레임워크 중 비교 가능한 설정에서 state-of-the-art 성능을 달성했으며, 글로벌 리더보드 상위 방법들과도 경쟁력을 유지했다.
  2. 비용 대비 효율적 탐색: Budget-Aware MCTS를 통해 성능과 실행 비용을 명시적으로 균형 잡아, 유사한 성능이면 더 짧은 학습 시간을 선호하는 효율적 해를 우선시했다.
  3. "Aha!" 순간 관찰: iMet-2020-FGVC7과 같은 난제 과제에서 기존 방법이 메달권에 도달하지 못하는 반면, MARS는 경량 residual network에서 앙상블 기법으로 전략을 점진적으로 발전시켜 실버 메달 수준을 달성했다.
  4. 교훈의 교차 전이(cross-branch transfer): 활용된 전체 교훈의 63%가 서로 다른 탐색 분기(branch) 간 전이에서 비롯되어, 에이전트가 탐색 경로 전반에 걸쳐 통찰을 효과적으로 일반화함을 입증했다.

How

Figure 2

Figure 2. Overview of the MARS Framework. MARS reformulates long-horizon coding as a search for an optimal software repo

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: MARS는 MLE 작업의 고유한 제약(비용, 모듈성, credit assignment)을 체계적으로 다루는 세 가지 상호보완적 메커니즘을 통합해 자율 AI 연구 에이전트의 실용적 한계를 개선한 견고한 연구이며, MLE-Bench에서의 실증 결과와 정성적 "Aha!" 분석이 그 효과를 설득력 있게 뒷받침한다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 Agentic AI for Scientific Automation가 맞닿아, 'DeepScientist: Advancing Frontier-Pushing Scientific Findings Progressively'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 Agentic AI for Scientific Automation가 맞닿아, 'EvoScientist: Towards Multi-Agent Evolving AI Scientists for End-to-End Scientific Discovery'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구MCTS 기반 에이전트 설계의 기초 방법론을 제공한다.
기반 연구state coverage 개념을 확장하여 추론 궤적 분석에 적용한다.
기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'ResearchGym: Evaluating Language Model Agents on Real-World AI Research'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근자율 AI 연구 에이전트를 위한 다른 탐색 전략을 제안한다.
후속 연구Modular design 파이프라인을 확장한 후속 연구이다.
후속 연구Reflective Memory 개념을 확장한 자동화 연구 에이전트이다.
응용 사례MLE-Bench와 같은 벤치마크에 에이전트 프레임워크를 실제 적용한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드