Can AI Scientist Agents Learn from Lab-in-the-Loop Feedback? Evidence from Iterative Perturbation Discovery

저자: Gilles Wainrib, Barbara Bodinier, Haithem Dakhli, Josep Monserrat, Almudena Espin-Perez, Roberta Codato, John Klein | 날짜: 2026 | URL: https://openreview.net/forum?id=sZijNyjuCF 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

이 논문은 LLM 기반 agent가 Cell Painting 고함량 스크리닝 데이터(JUMP dataset)를 활용한 iterative perturbation discovery 과제에서 실제로 실험 피드백으로부터 in-context learning(ICL)을 수행하는지를 800회의 독립 반복 실험을 통해 대규모로 검증한다. 핵심 발견은 피드백 품질이 높을 때만 유의미한 성능 향상이 나타나며, 이 효과는 모델 capability(Claude Sonnet 4.5→4.6)가 충분히 높아질 때만 발현된다는 것이다.

Motivation

Achievement

Figure 4
  1. 대규모 실증적 반박: 800회의 독립 반복 실험을 통해 feedback 접근이 평균 discoveries per feature를 +53.4% 증가시킴을 통계적으로 유의하게(p=0.003) 입증하여, 기존 "ICL 무효" 주장에 반례를 제시했다.
  2. Random feedback control 검증: hit/miss 라벨을 permute한 통제 실험에서 성능 향상이 사라짐을 보여, 관찰된 개선이 prompt-induced recall이 아닌 실제 feedback quality에 기인함을 확인했다(+13.0 hits, p=0.003).
  3. 모델 capability의 임계 효과 발견: Claude Sonnet 4.5에서 4.6으로 업그레이드 시 gene hallucination 비율이 ~33-45%에서 ~3-9%로 감소하며, 이에 따라 non-significant ICL 효과(+0.8, p=0.32)가 highly significant한 효과(+11.0, p=0.003)로 전환됨을 보였다.
  4. 새로운 agent 아키텍처 제안: 표현형 시그니처와 hypothesis register를 활용하는 ICBR-EF(In-Context Belief Revision from Experimental Feedback) agent를 제시하여 단순 hit/miss를 넘어선 구조화된 신념 갱신 메커니즘을 실험했다.

How

Figure 4

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 대규모 반복 실험과 통제된 random feedback 실험을 통해 "LLM agent는 ICL을 못한다"는 기존 통념을 모델 capability라는 중요한 조절변수로 재해석한 설득력 있는 연구이며, AI Scientist agent 설계에 실질적 함의를 제공하는 값진 기여이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 Scientific Information Extraction and QA가 맞닿아, 'Large Language Models are Zero Shot Hypothesis Proposers'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 Agentic AI for Scientific Automation가 맞닿아, 'DeepScientist: Advancing Frontier-Pushing Scientific Findings Progressively'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구LLM 기반 agent의 실험 피드백 학습에 관한 공통 방법론적 기반을 공유함
기반 연구지식 주입을 통한 멀티모달 학습을 확장한다.
기반 연구held-out response 설명력 분석을 다른 조건으로 확장함
다른 접근AI agent의 반복적 실험 학습 능력을 평가하는 유사한 접근법이다
다른 접근AI agent의 과학적 발견 능력을 실험 피드백 기반으로 평가하는 유사한 벤치마크이다
다른 접근hit discovery 문제를 다른 순차적 실험 설계 기법으로 해결한다.
후속 연구PAC learning 이론의 기초를 활용하여 novelty 한계를 증명하는 이론적 토대이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드