Essence
SciReview는 LLM이 연구자(전문가)가 작성한 실제 연구 초안 속에 자연스럽게 삽입된 개념적 오류를 peer reviewer처럼 찾아낼 수 있는지를 평가하는 벤치마크로, GPT-5.5, Gemini 3.1 Pro, Claude Opus 4.8 등 frontier model이 5% 미만의 완전 회수율(perfect recovery)만 달성함을 보인다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: 과학적 신뢰성에 직결되는 리뷰어 스타일 오류 탐지라는 중요하지만 간과되어온 능력을 정교하게 정의하고 측정하는 시의적절한 벤치마크로, frontier model들의 낮은 성능을 통해 AI-as-reviewer 활용에 대한 경각심을 효과적으로 제시한다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.94로 Biomedical AI Knowledge Systems와 Scientific Information Extraction and QA가 맞닿아, 'L-citeeval: Do longcontext models truly leverage context for responding? arXiv preprint arXiv:2410.02115, 2024.'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 Biomedical AI Knowledge Systems와 Scientific Information Extraction and QA가 맞닿아, 'Openscholar: Synthesizing scientific literature with retrieval-augmented lms'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 Biomedical AI Knowledge Systems와 AI-Assisted Academic Scholarly Communication가 맞닿아, 'DeepReview: Improving LLM-based Paper Review with Human-like Deep Thinking Process'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 Biomedical AI Knowledge Systems와 LLMs for Scholarly Communication가 맞닿아, 'Sci2Pol: Evaluating and Fine-tuning LLMs on Scientific-to-Policy Brief Generation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구멀티모달 판단 편향 완화 기법을 확장하여 적용한 연구이다.
기반 연구전문가 검증 QA 데이터셋 구축 방법론을 확장한 연구이다.
기반 연구과학 데이터 수집·정제 파이프라인을 실제 연구 환경에 적용한다
다른 접근AI 기반 과학 문헌 평가라는 유사한 벤치마크
기반 연구기존 벤치마크 평가 방법을 확장하여 불확실성을 다룸
기반 연구claim-level 지식 제거 평가를 확장하는 후속 연구로 판단됨
기반 연구embedding model의 수학적 표현 평가를 유사 도메인에 적용한 연구이다.
기반 연구코드 실행 기반 검증 방식을 세밀화된 fabrication 평가로 확장한다.
기반 연구수학 추론 벤치마크의 오류 분석을 확장
다른 접근대규모 멀티모달 모델 벤치마킹 방법론이 유사하다.
다른 접근LLM의 지식 격차를 진단하는 유사한 평가 방법론을 다룬다.
다른 접근AI의 과학적 오류 탐지 능력 평가라는 유사한 벤치마크 문제를 다룸
다른 접근연구 초안 내 오류 탐지를 다른 평가 방식으로 접근
다른 접근LLM jailbreak 탐지를 가설검정 관점에서 다르게 접근한다.
다른 접근AI 과학 연구 능력 평가라는 공통 주제
후속 연구과학 LLM 사전학습 기법의 기초를 제공하는 연구로 보임.
후속 연구자동화된 실험 재현 파이프라인 설계의 기초가 되는 연구.
후속 연구AI의 과학 콘텐츠 평가 능력을 확장하여 검증
반론/비판linear probe의 표면적 패턴 매칭 문제를 지적하는 비판적 관점을 공유