AgentExpt: Automating AI Experiment Design with LLM-based Resource Retrieval Agent

저자: Yu Li, Lehui Li, Lin Chen, Qingmin Liao, Fengli Xu, Yong Li | 날짜: 2026 | URL: https://openreview.net/forum?id=hJnZKtsDbe 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Overview of the research problem and our proposed

논문은 논문 작성 과정에서 baseline 및 dataset 선택이라는 실험 설계 병목을 자동화하기 위해, 108,825편의 accepted papers로부터 구축한 지식베이스를 기반으로 collective perception-enhanced retriever와 reasoning-augmented reranker를 결합한 AgentExpt 프레임워크를 제안한다.

Motivation

Achievement

Figure 2

Figure 2. Pipeline for constructing the AGENTEXPT knowledge base. We (1) download and parse papers (from flagship AI con

  1. 대규모 knowledge base 구축: 108,825편의 accepted papers를 PDF 파싱과 LLM-assisted extraction, entity normalization, source linking을 통해 baseline/dataset과 링크하여 실제 사용 패턴을 반영한 고정밀 데이터셋을 만들었다.
  2. collective perception-enhanced retriever 설계: 각 baseline/dataset에 대해 downstream 논문의 citation context를 community-level perception signal로 추출·요약하여 self-description과 결합한 dual-view representation을 구성하고, 이를 기반으로 embedding model을 fine-tuning했다.
  3. reasoning-augmented reranker 설계: P-B-P-D 및 P-D-P-B interaction chain을 reasoning trace로 구성하고 이를 reasoning prior로 삼아 LLM을 fine-tuning하여 해석 가능한 justification을 동반한 refined ranking을 생성했다.
  4. 성능 검증: 네 계열의 baseline 대비 가장 강력한 baseline 대비 평균 Recall@20 +5.85%, HitRate@5 +8.30%, HitRate@10 +7.90%의 성능 향상을 달성했으며, ablation을 통해 collective perception이 retrieval 성능 향상에, interaction-chain reasoning이 hit rate 향상에 각각 크게 기여함을 확인했다.

How

Figure 4

Figure 4. Illustration of Collective Perception Augmented Retrieval

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: baseline/dataset 추천이라는 실용적이지만 상대적으로 덜 탐구된 문제를 대규모 실제 문헌 기반 knowledge base와 collective perception, reasoning-augmented reranking이라는 두 가지 참신한 설계로 체계적으로 해결한 견실한 연구로, AI 연구 자동화 파이프라인의 중요한 공백을 메운다는 점에서 의미가 크다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 Biomedical AI Knowledge Systems와 AI-Assisted Academic Scholarly Communication가 맞닿아, 'ReviewAgents: Bridging the Gap Between Human and AI-Generated Paper Reviews'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Biomedical AI Knowledge Systems와 AI-Assisted Academic Scholarly Communication가 맞닿아, 'Surveyforge: On the outline heuristics, memory-driven generation, and multi-dimensional evaluation for automated survey writing'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 Biomedical AI Knowledge Systems와 Agentic AI for Scientific Automation가 맞닿아, 'aiXiv: A Next-Generation Open Access Ecosystem for Scientific Discovery Generated by AI Scientists'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Biomedical AI Knowledge Systems와 LLMs for Scholarly Communication가 맞닿아, 'Public Profile Matters: A Scalable Integrated Approach to Recommend Citations in the Wild'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근과학 문헌 검색 에이전트 평가라는 공통 문제를 다룸
다른 접근AI 실험 설계 자동화를 위한 다른 검색 및 추론 방법을 제안한다.
응용 사례baseline/dataset 선택 자동화를 실제 연구 파이프라인에 적용한 사례이다.
응용 사례유사한 collective perception 기법을 다른 연구 자동화 태스크에 적용한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드