Achievement
GPT-5.4-mini는 pass@8 54.7%에서 self-best@8은 41.9%로 12.8pt 격차(36% 회복)를, Gemini-3.5-flash는 5.8pt 격차(43% 회복)를 보였으며, 더 강한 generator일수록 절대적 cliff가 더 컸다. 또한 cross-family verifier가 generator보다 강할 때만 도움이 되고(+3.5pt), 약할 때는 오히려 self-selection보다 악화됨(-2.3pt)을 보였으며, majority voting은 diverse-answer 문제에서 self-selection을 개선하지 못함을 확인했다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: 정수 정답이라는 깔끔한 오라클을 활용해 self-verification cliff라는 현상을 명료하고 설득력 있게 입증한 짧지만 임팩트 있는 workshop paper로, self-evolving agent 설계자들에게 외부 verification의 필요성에 대한 구체적 근거를 제공한다. 다만 모델 수와 문제 수의 규모가 작아 결과의 일반화에는 추가 검증이 필요하다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Minif2f: a cross-system benchmark for formal olympiad-level mathematics'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Fimo: A challenge formal dataset for automated theorem proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Deepseek-prover: Advancing theorem proving in llms through large-scale synthetic data'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구self-verification 능력의 한계를 다루는 공통된 이론적 배경을 제공한다.
기반 연구생성-검증 격차 문제를 난이도 분포 관점에서 확장함
기반 연구pass@k와 self-select 성능 차이에 대한 이론적 기반을 제공함
기반 연구grokking 현상에서의 대수적 회로 구조를 확장하여 분석한다.
기반 연구pass@k 평가의 샘플링 한계 문제를 확장하여 분석한다.
다른 접근장문 수학 추론 distillation 데이터셋 구축이라는 동일 목표를 다른 방식으로 달성하려는 연구로 보인다.
다른 접근고난도 수학 문제에서 LLM의 한계를 실증적으로 보이는 유사한 연구이다.
다른 접근모듈러 연산의 표현 학습을 위한 다른 임베딩 기반 접근법을 제시한다.
다른 접근pass@k와 self-select 성능 격차를 다른 벤치마크로 검증하는 대안적 연구이다.
다른 접근sycophancy 완화 방법을 다른 프롬프팅 전략으로 접근한다.
다른 접근수학 추론 평가의 민감도 문제를 다른 방식으로 검증함
다른 접근Hardy-Littlewood 유형의 예측과 실제 편차를 비교하는 관련 정수론 연구이다.
다른 접근수학적 추론 체인 랭킹을 위한 다른 품질 평가 방법을 제시한다.
반론/비판모델의 표면적 성능과 실제 판단 능력 간 괴리라는 유사한 문제의식을 다른 도메인에서 제기한다.
다른 접근의미적 불변성 측정을 위한 다른 프로토콜 제안
후속 연구self-verification cliff 현상을 다른 태스크로 확장하여 검증한다.
반론/비판sparse method의 covariate shift 문제에 대한 다른 시각을 제시함