FirstPass: Grounding AI Scientific Judgment in Multi-Round Editorial Outcomes

저자: Prabhjot Singh, Somnath Luitel, Manmeet Singh, Josh Durkee | 날짜: 2026 | URL: https://openreview.net/forum?id=F6BxPrmBef 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. The FIRSTPASS three-task training curriculum. Each

FirstPass는 Nature Communications의 다섯 개 과학 분야(biology, chemistry, neuroscience, physics, earth science)에서 수집한 3,668개의 완전한 multi-round peer-review 대화를 바탕으로 Qwen2.5-7B-Instruct를 LoRA로 파인튜닝하여, review generation·reviewer updating·revision-cycle prediction 세 과제를 수행하는 데이터셋과 모델이다.

Motivation

Achievement

Figure 2

Figure 2. Revision-cycle prediction accuracy with 95% bootstrap

  1. FirstPass 데이터셋 구축: Nature Communications에서 다섯 과학 분야에 걸쳐 3,668개의 완전한 multi-round peer-review 대화를 수집하고 100% content integrity를 자동 감사로 검증했다.
  2. 결과 기반 평가(outcome-grounded evaluation): STANDARD 대 EXTENDED revision cycle을 예측하는 과제에서 80.5% 정확도와 F1-macro 78.2%를 달성하여 Gemini-3.1-flash-lite-preview zero-shot 대비 10.4%p 우수했으며, McNemar 검정으로 p < 0.001의 통계적 유의성을 확인했다.
  3. masking에 대한 핵심 발견: response-only loss masking이 긴 입력·짧은 출력 분류 과제에서 단순 최적화가 아니라 필수 전제조건임을 입증했다(마스킹 미적용 시 62.0%로 다수결 baseline 이하, 적용 시 80.5%로 18.5%p 상승).
  4. 생성 과제 성능: FirstPass가 생성한 리뷰는 평균 1,187 단어로 인간 참조(2,155 단어)에 가장 근접했으며, ROUGE-L 0.154로 Qwen 및 DeepSeek zero-shot 대비 유의미한 개선(p < 0.001)을 보였다.

How

Figure 1

Figure 1. The FIRSTPASS three-task training curriculum. Each

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 기존 AI peer review 연구의 도메인 편향, 정적 평가, 순환 논증 문제를 동시에 해결하려는 시도로서 데이터셋 구축과 masking에 관한 실증적 발견 모두 의미 있는 기여이나, 라벨링 방식의 단순함과 전향적 검증 부재가 실제 공저자(co-author) 주장을 완전히 뒷받침하기엔 아직 부족하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.95로 Biomedical AI Knowledge Systems와 AI-Assisted Academic Scholarly Communication가 맞닿아, 'OpenReviewer: A specialized large language model for generating critical scientific paper reviews'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 Biomedical AI Knowledge Systems와 AI-Assisted Academic Scholarly Communication가 맞닿아, 'Peer Review as A Multi-Turn and Long-Context Dialogue with Role-Based Interactions'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 Biomedical AI Knowledge Systems와 AI-Assisted Academic Scholarly Communication가 맞닿아, 'DeepReview: Improving LLM-based Paper Review with Human-like Deep Thinking Process'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구REMOR의 리뷰 생성 방식을 실제 논문 심사에 적용함
기반 연구동일한 FIRSTPASS 데이터셋을 구축한 기초 논문이다.
다른 접근AI 리뷰어의 역할에 대한 다른 관점을 제시하는 관련 논문
다른 접근peer review 기반 평가라는 동일 문제를 다른 방식으로 접근한다.
다른 접근과학 논문 피드백 생성을 위한 다른 신호(validity/actionability) 활용 방식을 제안한다.
후속 연구multi-round peer-review 대화를 활용한 AI 과학적 판단 평가를 심화한 연구이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드