GoodPoint: Learning Constructive Scientific Paper Feedback from Author Responses

저자: Jimin Mun, Chani Jung, Xuhui Zhou, Maarten Sap, Hyunwoo Kim | 날짜: 2026 | URL: https://openreview.net/forum?id=hDccmUkqCS 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Overview of the two feedback quality axes and our definition of constructive feedback. Reviewer feedback is ev

저자 응답(author response)에서 도출한 validity와 actionability라는 두 가지 신호를 활용해 과학 논문에 대한 건설적 피드백(constructive feedback)을 생성하도록 LLM을 훈련하고 평가하는 프레임워크 GOODPOINT를 제안한다.

Motivation

Achievement

Figure 2

Figure 2. LLM-judged feedback quality score distributions for baseline models, GOODPOINT models, and human reviewers on

  1. GOODPOINT-ICLR 데이터셋 구축: 2020-2026년 ICLR 논문 19,534편의 리뷰 논의를 feedback-response 단위로 분해하고 validity·actionability 레이블을 부여한 대규모 데이터셋을 공개함.
  2. 성능 개선: GOODPOINT로 훈련된 Qwen3-8B가 1.2K ICLR 논문 held-out 테스트셋에서 예측된 피드백 성공률(predicted feedback success rate)을 기반 모델 대비 83.7% 향상시켰음.
  3. 정밀도 우위: 다중 리뷰어 consensus feedback과의 매칭에서 GOODPOINT-SFT가 F1을 58.8% 개선했고, 훨씬 작은 규모임에도 Gemini-3-flash와 GPT-5.2를 precision에서 능가함.
  4. 인간 평가 검증: 실제 논문 저자 대상 인간 평가에서 GOODPOINT-DPO가 validity, actionability, specificity, helpfulness 전 항목에서 base 모델 대비 개선되었고 Gemini-3-flash와의 격차를 유의미하게 줄임.

How

Figure 4

Figure 4. Illustration of human consensus-based feedback evaluation with example feedback sets. Matches between human fe

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 저자 응답이라는 자연스럽고 실질적인 신호를 활용해 건설적 피드백을 정의·학습·평가하는 체계적이고 실용적인 프레임워크를 제시한 견실한 연구로, 대규모 데이터셋 공개와 인간 평가를 통한 검증이 특히 인상적이다.

같이 보면 좋은 논문

기반 연구사용자 이력 요약이라는 유사한 다중문서 처리 문제 적용
기반 연구SPECTER2 유사도 0.95로 Biomedical AI Knowledge Systems와 AI-Assisted Academic Scholarly Communication가 맞닿아, 'MARG: Multi-Agent Review Generation for Scientific Papers'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근LLM을 활용한 논문 리뷰 자동 생성 방식을 다루는 유사한 연구이다.
기반 연구SPECTER2 유사도 0.95로 Biomedical AI Knowledge Systems와 AI-Assisted Academic Scholarly Communication가 맞닿아, 'DeepReview: Improving LLM-based Paper Review with Human-like Deep Thinking Process'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.95로 Biomedical AI Knowledge Systems와 AI-Assisted Academic Scholarly Communication가 맞닿아, 'ReviewAgents: Bridging the Gap Between Human and AI-Generated Paper Reviews'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구multi-round peer-review 대화를 활용한 AI 과학적 판단 평가를 심화한 연구이다.
다른 접근과학 논문 피드백 생성을 위한 다른 신호(validity/actionability) 활용 방식을 제안한다.
다른 접근언어모델 기반 글쓰기의 다양성 및 품질을 평가하는 유사한 접근을 취한다.
다른 접근LLM의 논문 리뷰 능력을 다른 방식으로 평가한다.
다른 접근학술 글쓰기 지원을 위한 다른 LLM 기반 도구로서 유사한 문제를 다룬다.
다른 접근사용자 이력 기반 개인화의 다른 접근 방식을 제시한다.
다른 접근학술 리뷰 프로세스 분석을 위한 대안적 데이터셋을 제공한다.
다른 접근전문가 평가 기반 벤치마크 구축이라는 유사 문제의 대안적 접근이다.
후속 연구저자 응답 기반 학습 신호를 확장하여 피드백 생성 품질을 개선한다.
후속 연구author response 신호를 활용한 유사한 피드백 품질 평가를 확장한다.
후속 연구LLM 기반 리뷰 시스템의 이론적 기반을 제공하는 연구
후속 연구context-aware modeling의 방법론적 기초를 제공함
응용 사례LLM 기반 피드백 생성을 실제 논문 리뷰 프로세스에 적용한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드