V1: Unifying Generation and Self-Verification for Parallel Reasoners

저자: Harman Singh, Xiuyu Li, Kusha Sareen, Monishwaran Maheswaran, Sijun Tan, Xiaoxia Wu, Junxiong Wang, Alpay Ariyak, Qingyang Wu, Samir Khaki, Rishabh Tiwari, Long Lian, Yucheng Lu, Boyi Li, Alane Suhr, Ben Athiwaratkun, Kurt Keutzer | 날짜: 2026 | URL: https://openreview.net/forum?id=JOy3UmERXS 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. (Left) Pairwise self-verification (using V1-Infer, §3)

모델이 후보 해답을 독립적으로 채점하는 pointwise verification보다 pairwise verification에 훨씬 강하다는 관찰을 바탕으로, generation과 self-verification을 통합한 V1 프레임워크(V1-Infer 추론 알고리즘 + V1-PairRL 학습 프레임워크)를 제안한다.

Motivation

Achievement

Figure 2

Figure 2. (Top) Performance after self-verification using V1-Infer compared with pointwise self-verification across benc

  1. Pointwise 대비 pairwise verification의 우수성 입증: GPT-OSS-20B 등 여러 모델·벤치마크에서 pairwise self-verification이 pointwise보다 top-1 self-ranking 정확도가 훨씬 높음을 보였다.
  2. V1-Infer 알고리즘 개발: Swiss-system tournament 기반 불확실성 유도 pairwise ranking으로 code generation(LiveCodeBench, CodeContests), SWE/terminal agent(SWE-Bench, Terminal-Bench), math(AIME, HMMT), 비검증 도메인 의료 QA(HealthBench)에서 Pass@1을 pointwise 대비 최대 10% 개선하고, SoTA aggregation 기법(RSA)보다 적은 verification 호출로 동등 이상 성능을 달성했다.
  3. V1-PairRL 프레임워크 개발: generator와 pairwise self-verifier를 online으로 co-training하여 표준 RL 및 pointwise joint training 대비 test-time scaling 성능을 3.8–10pp 향상시키고, 기본 Pass@1을 표준 RL 대비 최대 8.7pp 개선했다.
  4. Diversity collapse 문제 규명: RSA와 같은 self-aggregation 기법이 반복 단계마다 Pass@N을 단조 감소시키는 현상을 실증적으로 밝혀 pairwise verification의 필요성을 뒷받침했다.

How

Figure 4

Figure 4. Pairwise comparison with vanilla solution generation

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: pointwise verification의 근본적 한계를 명확히 진단하고 이를 pairwise verification과 co-training이라는 통합적 해법으로 해결한, 이론과 실증이 균형 잡힌 우수한 연구이다. 다양한 도메인에서 일관된 성능 향상을 보여 test-time scaling 연구에 실질적 기여를 한다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Scientific Information Extraction and QA가 맞닿아, 'Prompt to be consistent is better than self-consistent? Few-shot and zero-shot fact verification with pre-trained language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.90로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'BiasFilter: An inference-time debiasing framework for large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.90로 LLM Reasoning and Safety Benchmarks와 Scientific Information Extraction and QA가 맞닿아, 'SurveyX: Academic survey automation via large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구generation과 verification 통합의 이론적 기반이 되는 연구이다.
다른 접근inference-time search 문제를 다른 최적화 방식으로 접근한다.
기반 연구pairwise verification의 이론적 기반이 되는 검증 방법론을 제공하는 것으로 보임
다른 접근pairwise verification을 활용한 다른 검증 프레임워크를 제시한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드