Essence
Figure 1. OPENDISCOVERYTRACE:
OpenDiscoveryTrace는 AI scientist agent의 최종 출력물이 아니라 추론 과정 자체를 9-필드 구조로 기록한 558개 trajectory 데이터셋으로, 이를 통해 output-only 평가에서는 드러나지 않는 모델 간 행동 차이(에러 유형, 자기 수정 패턴 등)를 밝힌다.
Evaluation
Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: Output만 평가하던 AI scientist 벤치마크의 사각지대를 process trace로 메우려는 시의적절하고 실용적인 시도로, 초기 pilot 결과만으로도 흥미로운 통계적 발견을 제시했으나 아직 규모와 인간 검증이 부족한 workshop-stage 연구이다.
같이 보면 좋은 논문
기반 연구AI 도구의 실제 사용 패턴을 대규모 데이터로 분석한다는 공통 방법론을 가진다.
기반 연구SPECTER2 유사도 0.95 기준으로 'OpenDiscoveryTrace: Process Traces for Evaluating AI Scientist Workflows'의 AI4S 방법론을 'DSBench: How far are data science agents to becoming data science experts? arXiv preprint arXiv:2409.07703, 2024.'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
다른 접근데이터 분석 및 모델링 작업 평가를 위한 다른 벤치마크 접근법
기반 연구Kosmos의 구조화된 세계 모델 개념을 확장하거나 후속 연구로 이어지는 관계이다.
다른 접근AI 과학자 에이전트의 프로세스 평가라는 동일 문제를 output-only 대신 trace 기반으로 접근한다.
기반 연구inference-time reasoning 검증을 확장하는 유사 연구이다.
기반 연구구조화된 artifact 기반 워크플로우를 확장한 연구
기반 연구long-horizon agentic 프레임워크를 과학적 발견에 확장 적용함
기반 연구다중 에이전트 상호작용의 수렴 현상을 확장하여 분석함
기반 연구test-time scaling을 구조화된 추론 영역으로 확장 적용
기반 연구기존 AI 과학자 시스템의 누적 실패 문제를 해결하기 위한 진화형 메커니즘을 추가한다.
기반 연구adversarial fast-moving 도메인 개념을 확장한 연구이다.
기반 연구유사한 RL 기법을 다른 도메인 에이전트에 적용한 사례이다.
기반 연구표준화된 프레임워크를 실제 에이전트 훈련에 적용한다.
기반 연구생의학 벤치마크에 에이전트 시스템을 적용한 유사 사례이다.
기반 연구과학 실험 데이터셋을 에이전트 학습에 실제 적용한 연구이다.
기반 연구머신러닝 연구 재발견 문제에 벤치마크를 적용한 유사 사례이다.
다른 접근AI scientist agent의 성능을 평가하는 벤치마크로서 유사한 목적을 다른 접근으로 해결함
기반 연구Modular design 파이프라인을 확장한 후속 연구이다.
기반 연구SPECTER2 유사도 0.95로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'AutoSOTA: An End-to-End Automated Research System for State-of-the-Art AI Model Discovery'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근AI 에이전트의 안전성 확보를 위한 다른 방어 메커니즘을 제안한다.
다른 접근자동화된 데이터 과학 워크플로우 구축에 대한 다른 에이전틱 접근법을 제시한다.
다른 접근화학 구조 규명 문제에 대해 direct modeling이 아닌 agentic search라는 대안적 패러다임을 제시한다.
다른 접근AI agent 평가를 위한 데이터셋 구축이라는 유사 문제를 다른 방식으로 접근함
다른 접근AI 연구 자동화 시스템의 표준화된 평가라는 유사 문제를 다룬다.
다른 접근복잡도 축을 기준으로 LLM 평가를 설계하는 벤치마크라는 점에서 유사하다.
다른 접근도구 호출 및 실행 샌드박스 기반 에이전트 설계라는 유사한 문제를 다룬다.
다른 접근에이전트 기반 자동화 시스템 설계라는 공통 방법론을 공유함
다른 접근태스크 인스턴스 기반 대규모 벤치마크 구성 방법론이 유사함
다른 접근스킬 라이브러리 재사용이라는 유사 아이디어를 다른 프레임워크로 구현한다.
다른 접근AI 과학 발견 과정의 재현성과 감사 가능성을 다룬다는 점에서 밀접히 연관된다.
다른 접근AI 과학자 에이전트 구현이라는 동일 문제에 대한 대안적 접근을 제시함
후속 연구AutoResearch 에이전트 프레임워크의 기초 구조를 제공한다.
후속 연구AI agent의 추론 과정을 평가하는 프레임워크를 확장하여 적용함
후속 연구LLM 기반 인과추론 방법 선택의 이론적 기반을 제공한다.
응용 사례평가 대상이 되는 agentic AI scientist 프레임워크의 실제 사례이다.