Sibyl: Temporal Backtesting for Literature-Based Scientific Discovery with Large Language Model Agents

저자: Blagoy Rangelov | 날짜: 2026 | URL: https://openreview.net/forum?id=xfLV86qoBd 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. SIBYL pipeline architecture. Stage 4.5 (red) is the provenance audit, added after initial deployment revealed

SIBYL은 다중 에이전트 LLM 파이프라인으로 과학 문헌을 자동으로 마이닝해 반증 가능한 예측을 생성하고, 이를 금융의 backtesting과 유사한 temporal backtesting 프레임워크로 검증하는 시스템이다. X-ray binary 천체물리학을 사례 연구로 적용해 14,400편의 논문에서 11,000개 이상의 구조화된 claim을 추출하고 60개의 예측을 생성했으며, 이 중 18%가 독립적인 사후 문헌에 의해 확인되었다.

Motivation

Achievement

Figure 1

Figure 1. SIBYL pipeline architecture. Stage 4.5 (red) is the provenance audit, added after initial deployment revealed

  1. 대규모 파이프라인 구축: 14,400편의 refereed 논문을 수집하고 99.9% 성공률로 full-text를 파싱해 11,000개 이상의 구조화된 claim을 추출했다.
  2. 예측 생성 및 검증: 2014년 cutoff 기준 pre-2015 문헌만으로 60개의 반증 가능한 예측을 생성했고, 이 중 11개(18%)가 시스템이 전혀 관찰하지 않은 post-2015 독립 문헌에 의해 확인되었다.
  3. 오류 유형 규명: 사후 provenance audit을 통해 corpus contamination, validation-era leakage, citation hallucination이라는 세 가지 체계적 실패 모드를 식별했고, 특히 citation hallucination은 novel cross-prediction consistency check로 탐지했다.
  4. 강건성 검증: 점진적으로 보수적인 필터를 적용해도 확인율이 12.5-18% 범위에서 안정적으로 유지됨을 sensitivity analysis로 보였다.

How

Figure 1

Figure 1. SIBYL pipeline architecture. Stage 4.5 (red) is the provenance audit, added after initial deployment revealed

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 과학적 가설 생성에 금융의 backtesting 개념을 도입한 참신한 평가 방법론과 provenance audit 프로토콜이 돋보이는 연구이나, 단일 도메인의 소규모 preliminary 결과라는 한계로 인해 향후 다양한 분야로의 확장과 더 엄밀한 검증이 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLMs for Scholarly Communication가 맞닿아, 'Understanding fine-grained distortions in reports of scientific findings'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'Automated Hypothesis Validation with Agentic Sequential Falsifications'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 AI-Assisted Academic Scholarly Communication가 맞닿아, 'ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구temporal backtesting 프레임워크의 방법론적 기반을 제공하는 연구로 보인다.
기반 연구LLM 기반 과학 방정식 발견 기법을 확장 발전시킴
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 AI-Assisted Academic Scholarly Communication가 맞닿아, 'CiteCheck: Retrieval-Grounded Detection of LLM Citation Hallucinations in Scientific Text'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근동일한 SIBYL 파이프라인의 기초가 되는 가설 생성 프레임워크 논문.
다른 접근잘 정의된 문제와 저결정 문제에서 LLM 역할 변화를 다루는 유사 연구.
다른 접근AI 보조 연구 자동화를 위한 다른 프레임워크 구조를 제시한다.
응용 사례문헌 기반 예측을 X-ray binary 천체물리학에 적용한 사례 연구로 보인다.
다른 접근과학적 예측 검증을 위한 다른 backtesting 방법론을 제시하는 것으로 추정된다.
다른 접근AI 생성 연구 결과물의 신뢰성 평가라는 유사한 문제를 다룬다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드