AblationBench: Evaluating Automated Planning of Ablations in Empirical AI Research

저자: Talor Abramovich, Gal Chechik | 날짜: 2026 | URL: https://openreview.net/forum?id=mF0itTNVyG 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Overview of AblationBench. (Top) AuthorAblation is a collection of conference papers where the task of the pla

AblationBench는 LM agent가 empirical AI 논문에서 ablation 실험을 자동으로 기획할 수 있는지 평가하는 벤치마크로, AuthorAblation(저자 관점 ablation plan 생성)과 ReviewerAblation(리뷰어 관점 누락된 ablation 탐지)이라는 두 태스크와 이를 자동 평가하는 LM-based judge를 함께 제시한다.

Motivation

Achievement

Figure 3

Figure 3. Recall@5 performance for AuthorAblation of each

  1. AblationBench 벤치마크 구축: AuthorAblation(83개 논문, 14개 conference, 230개 human-annotated ablation)과 ReviewerAblation(350개 ICLR submission과 공식 리뷰) 두 태스크로 구성된 최초의 완전 자동화 ablation planning 벤치마크를 제시했다.
  2. LM-based judge 개발 및 검증: 두 태스크 각각에 대해 gold label 대비 생성 계획을 평가하는 LM judge를 설계하고, held-out human-annotated 평가 데이터로 judge의 정확도를 정량 검증했다.
  3. baseline planner 성능 규명: frontier LM과 agent 기반 planner(SWE-agent 기반)를 baseline으로 평가한 결과, 최고 성능 시스템도 평균 45%의 원본 ablation만 식별했고, AuthorAblation 서브셋에서 human F1 0.65 대비 모델 최고 F1 0.42로 인간 수준에 미달함을 보였다.
  4. author-reviewer 역전 현상 발견: 두 태스크 간 성능이 반대 경향을 보이는 것을 관찰하고 이를 model grounding 차이로 설명했으며, agent 기반 접근보다 chain-of-thought prompting이 더 우수함을 분석했다.

How

Figure 3

Figure 3. Recall@5 performance for AuthorAblation of each

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: AI co-scientist 평가에서 상대적으로 소외되었던 ablation planning이라는 핵심 능력을 raw 논문 기반의 완전 자동화 파이프라인으로 정식화하고 신뢰성 있는 LM judge까지 함께 제공한 실용적이고 시의적절한 벤치마크 연구이다. 다만 데이터 규모와 judge의 편향 가능성은 향후 확장을 통해 보완될 필요가 있다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.96로 Biomedical AI Knowledge Systems와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Exp-bench: Can ai conduct ai research experiments? arXiv preprint arXiv:2505.24785, 2025.'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.96로 Biomedical AI Knowledge Systems와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning Research'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.95로 Biomedical AI Knowledge Systems와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'MLRC-Bench: Can Language Agents Solve Machine Learning Research Challenges?'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근저자/리뷰어 관점의 실험 계획 평가라는 유사한 벤치마크 설계
후속 연구LLM 에이전트 평가의 방법론적 기반을 제공한다
다른 접근AI 논문 기반 실험 자동 기획 평가라는 공통 문제를 다룸
다른 접근LM 에이전트의 자동화된 연구 계획 능력을 평가하는 유사한 벤치마크 접근
후속 연구LLM 기반 연구 자동화의 구조적 기반을 제공
응용 사례저자/리뷰어 관점의 실험 기획 평가를 실제 논문에 적용한 사례이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드