AIBuildAI: An AI Agent for Automatically Building AI Models

저자: Ruiyi Zhang, Peijia Qin, Qi Cao, Li Zhang, Pengtao Xie | 날짜: 2026 | URL: https://openreview.net/forum?id=nckjXxN9WZ 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

AIBuildAI는 task description과 training data만으로 designer, coder, tuner 세 서브 에이전트를 manager agent가 조율하는 계층적 LLM 에이전트 구조를 통해 AI 모델 개발 전 과정을 자동화하며, MLE-Bench에서 63.1%의 medal rate로 1위를 달성했다.

Motivation

Achievement

Figure 2
  1. MLE-Bench 리더보드 1위 달성: AIBuildAI는 75개의 실제 Kaggle 스타일 과제로 구성된 MLE-Bench에서 medal rate 63.1%를 기록하며 AIRA-dojo, MLEvolve, ML-Master 등 26개의 기존 baseline을 모두 능가했다.
  2. 난이도별 최고 성능: low-, medium-, high-complexity 세 구간(22/38/15개 과제)에서 각각 77.27%, 61.40%, 46.67%의 medal rate를 기록했으며, 특히 가장 어려운 high-complexity split을 포함한 medium·high 구간에서 1위를 차지했다.
  3. 이미지 분류 과제 전 영역 우위: 자연 이미지, 세밀 분류, 의료 영상, 보안 관련 이미지 분류 등 10개 image classification 과제에서 MLEvolve와 AIRA-dojo 두 baseline을 모두 능가했다.

How

Figure 3

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: AutoML의 한계를 넘어 AI 모델 개발 전체 파이프라인을 계층적 멀티 에이전트 구조로 자동화하고 실제 벤치마크에서 최고 성능을 입증한 의미 있는 연구이나, high-complexity 과제에서의 한계와 비용 분석 부족은 향후 보완이 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'AutoML-GPT: Automatic Machine Learning with GPT'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근GPT 기반 AutoML 시스템의 다른 설계 방식을 제시한다.
기반 연구폐루프 플래닝 방법론을 확장하여 효율성을 개선함
기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 Agentic AI for Scientific Automation가 맞닿아, 'OWL: Optimized Workforce Learning for General Multi-Agent Assistance in Real-World Task Automation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근다중 에이전트 시스템을 위한 유사한 모듈식 프레임워크 접근이다.
기반 연구SPECTER2 유사도 0.95로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Lang-PINN: From Language to Physics-Informed Neural Networks via a Multi-Agent Framework'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근자연어에서 PINN 코드를 생성하는 다른 다중 에이전트 접근법을 제시한다.
기반 연구self-evolving 에이전트 패러다임의 비효율성을 해결하려는 공통 문제의식을 공유하며 SkillX가 이를 확장한다.
다른 접근계층적 LLM 에이전트를 통한 AI 모델 자동 개발이라는 동일한 문제를 다룸
다른 접근에이전트 기반 자동화 시스템 설계라는 공통 방법론을 공유함
후속 연구OSWorld와 같은 데스크톱 벤치마크 환경 구축의 이론적 기반을 제공함
후속 연구다중 서브에이전트 조율 구조를 확장한 연구
후속 연구designer-coder-tuner 구조를 통한 AI 모델링 자동화를 확장한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드