SciPredict: Can LLMs Predict the Outcomes of Scientific Experiments in Natural Sciences?

저자: Udari Madhushani Sehwag, Elaine Lau, Haniyeh Ehsani Oskouie, Shayan Shabihi, Erich Liang, Andrea Sarai Echeverria Toledo, Guillermo A. Mangialardi, Sergio Fonrouge, Ed-Yeremai Hernandez-Cardona, Paula Vergara, Utkarsh Tyagi, Chen Bo Calvin Zhang, Pavi Bhatter, Nicholas E. Johnson, Furong Huang, Ernesto Gabriel Hernández Montoya, Bing Liu | 날짜: 2026 | URL: https://openreview.net/forum?id=61xHri3kqI 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Key findings of SciPredict. Frontier models exhibit fundamental gaps in accuracy and calibration robustness in

SciPredict는 물리·화학·생물학 33개 세부 분야에서 최근 발표된 실증 연구로부터 405개 과제를 추출하여, LLM이 과학 실험 결과를 예측하고 그 예측의 신뢰도를 스스로 판단할 수 있는지를 평가하는 벤치마크이다.

Motivation

Achievement

Figure 1

Figure 1. Key findings of SciPredict. Frontier models exhibit fundamental gaps in accuracy and calibration robustness in

  1. 성능 격차 규명: SOTA 모델의 예측 정확도는 14-26%, 인간 전문가는 약 20%로, 일부 최전선 모델이 인간을 능가하지만 신뢰할 만한 실험 지침을 제공하기엔 여전히 크게 부족함을 보였다.
  2. 모델의 보정 실패 발견: 모델은 자기보고 신뢰도(confidence)나 실현가능성(feasibility) 판단과 무관하게 항상 약 20%의 정확도에 머물러, 신뢰할 수 있는 예측과 그렇지 않은 예측을 구분하지 못함을 밝혔다.
  3. 인간 전문가의 강한 보정 능력 입증: 인간 전문가는 예측 실현가능성 평가에 따라 정확도가 약 5%에서 약 80%까지 증가하는 강한 calibration을 보여, 모델과 대조되는 인간의 메타인지 능력을 확인했다.
  4. 배경지식 효과 분석: 전문가가 큐레이션한 배경지식(BK)은 평균 약 3% 정확도 향상을 가져온 반면, 모델 스스로 생성한 배경지식은 오히려 성능을 저하시키는 경향이 있음을 발견했다.
  5. 대규모 고품질 벤치마크 구축: 데이터 오염을 피하기 위해 2025년 3월 이후 논문에서 다단계 전문가 검토를 거쳐 405개 과제를 구축했으며, 이 과정에 $336k 비용과 7,380 전문가 시간이 투입되었다.

How

Figure 3

Figure 3. SciPredict curation pipeline. The benchmark construc-

Originality

Limitation & Further Study

Evaluation

Novelty: 5/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 4/5

총평: 과학적 발견 가속화라는 중요한 문제에 대해 실험 결과 예측이라는 새로운 평가 축을 제시하고, 모델의 정확도뿐 아니라 신뢰도 인식 능력의 근본적 한계를 실증적으로 밝힌 의미 있는 벤치마크 연구이다. 다만 낮은 절대 정확도 수준에서의 통계적 견고성과 인간 평가자 구성에 대한 세부 정보가 추가로 뒷받침되면 더욱 설득력이 강화될 것이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.95로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Exp-bench: Can ai conduct ai research experiments? arXiv preprint arXiv:2505.24785, 2025.'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구도메인 특화 추론 모델의 성능 향상을 확장한다.
기반 연구유동 지능 평가 프레임워크를 확장하여 적용함
기반 연구SPECTER2 유사도 0.95로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'DeepScientist: Advancing Frontier-Pushing Scientific Findings Progressively'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구verifier-friendly 벤치마크를 넘어선 다양한 도메인으로 test-time aggregation을 확장한다.
기반 연구과학 실험 결과 예측 벤치마크 설계의 기초 제공
기반 연구실행 기반 방법론적 비판이라는 개념을 공유하며 확장된 연구로 볼 수 있다.
기반 연구다중 도메인 reasoning 벤치마크를 확장한 연구이다.
다른 접근LLM의 과학 실험 결과 예측 능력 평가라는 동일한 문제를 다룸
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'Towards end-to-end automation of AI research'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근LLM 기반 과학 가설 생성의 대안적 접근법을 다룸
다른 접근가설 생성 및 검증의 유사한 접근 방식을 제시함
다른 접근계층적 검색을 통한 과학적 발견 생성이라는 유사한 문제를 다룬다.
다른 접근LLM의 과학적 추론을 논리성 관점에서 평가하는 상호 보완적 접근
다른 접근machine unlearning의 한계를 다루는 유사한 문제의식을 공유한다
다른 접근동일한 heterogeneous GNN 기반 co-usage 예측 문제를 다른 방식으로 접근한다.
다른 접근유사한 실험 결과 예측 과제를 다른 데이터셋으로 평가
후속 연구AutoResearch 에이전트의 실패 기록 관리 개념적 기반을 제공한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드