저자: Udari Madhushani Sehwag, Elaine Lau, Haniyeh Ehsani Oskouie, Shayan Shabihi, Erich Liang, Andrea Sarai Echeverria Toledo, Guillermo A. Mangialardi, Sergio Fonrouge, Ed-Yeremai Hernandez-Cardona, Paula Vergara, Utkarsh Tyagi, Chen Bo Calvin Zhang, Pavi Bhatter, Nicholas E. Johnson, Furong Huang, Ernesto Gabriel Hernández Montoya, Bing Liu | 날짜: 2026 | URL: https://openreview.net/forum?id=61xHri3kqI 📄 PDF
Essence
Figure 1. Key findings of SciPredict. Frontier models exhibit fundamental gaps in accuracy and calibration robustness in
SciPredict는 물리·화학·생물학 33개 세부 분야에서 최근 발표된 실증 연구로부터 405개 과제를 추출하여, LLM이 과학 실험 결과를 예측하고 그 예측의 신뢰도를 스스로 판단할 수 있는지를 평가하는 벤치마크이다.
Evaluation
Novelty: 5/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 4/5
총평: 과학적 발견 가속화라는 중요한 문제에 대해 실험 결과 예측이라는 새로운 평가 축을 제시하고, 모델의 정확도뿐 아니라 신뢰도 인식 능력의 근본적 한계를 실증적으로 밝힌 의미 있는 벤치마크 연구이다. 다만 낮은 절대 정확도 수준에서의 통계적 견고성과 인간 평가자 구성에 대한 세부 정보가 추가로 뒷받침되면 더욱 설득력이 강화될 것이다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.95로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Exp-bench: Can ai conduct ai research experiments? arXiv preprint arXiv:2505.24785, 2025.'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구도메인 특화 추론 모델의 성능 향상을 확장한다.
기반 연구유동 지능 평가 프레임워크를 확장하여 적용함
기반 연구SPECTER2 유사도 0.95로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'DeepScientist: Advancing Frontier-Pushing Scientific Findings Progressively'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구verifier-friendly 벤치마크를 넘어선 다양한 도메인으로 test-time aggregation을 확장한다.
기반 연구과학 실험 결과 예측 벤치마크 설계의 기초 제공
기반 연구실행 기반 방법론적 비판이라는 개념을 공유하며 확장된 연구로 볼 수 있다.
기반 연구다중 도메인 reasoning 벤치마크를 확장한 연구이다.
다른 접근LLM의 과학 실험 결과 예측 능력 평가라는 동일한 문제를 다룸
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'Towards end-to-end automation of AI research'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근LLM 기반 과학 가설 생성의 대안적 접근법을 다룸
다른 접근가설 생성 및 검증의 유사한 접근 방식을 제시함
다른 접근계층적 검색을 통한 과학적 발견 생성이라는 유사한 문제를 다룬다.
다른 접근LLM의 과학적 추론을 논리성 관점에서 평가하는 상호 보완적 접근
다른 접근machine unlearning의 한계를 다루는 유사한 문제의식을 공유한다
다른 접근동일한 heterogeneous GNN 기반 co-usage 예측 문제를 다른 방식으로 접근한다.
다른 접근유사한 실험 결과 예측 과제를 다른 데이터셋으로 평가
후속 연구AutoResearch 에이전트의 실패 기록 관리 개념적 기반을 제공한다.