Holm-Bonferroni Verification of Math Solvers: A Hessian-Mismatch Diagnostic for Benchmark-Level Failure Modes

저자: Jinze Yu, Yanping Deng | 날짜: 2026 | URL: https://openreview.net/forum?id=niWcx5mmys 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Hessian-mismatch index µ∗(left) and sigmoid-saturation

벤치마크 스위트 전반에 걸쳐 수학 솔버(math solver)를 검증할 때 발생하는 다중비교(multiple-comparison) 문제를 Holm-Bonferroni 보정과 문제 특화 구조적 진단지표인 Hessian-mismatch index $\mu_*$를 결합하여 해결하는 프로토콜을 제안하고, $\ell_2$-regularized logistic regression 사례에서 이를 검증한다.

Motivation

Achievement

Figure 2

Figure 2. Convergence of two diagnostics toward the true asymp-

  1. 검증 프로토콜 제시: 11개 데이터셋에 대해 Holm-Bonferroni 보정 paired t-test를 적용해 정확히 2개 데이터셋(Adult, Covertype)에서 iso-accuracy 귀무가설을 corrected p<0.05로 기각했으며, 4가지 보정 절차(Bonferroni, Holm-Bonferroni, Benjamini-Hochberg, 무보정)와 4가지 검정통계량(paired t, Wilcoxon, sign-test, bootstrap CI)이 모두 일치하는 결과를 보였다.
  2. 구조적 귀인 분석: $\mu_$가 두 기각 사례를 사후적으로 설명함을 보였다 — Covertype은 벤치마크 내 가장 작은 $\mu_(\approx10^{-3})$로 진짜 느린 수렴 실패이나, Adult($\mu_\approx0.09$)는 7개의 기각되지 않은 데이터셋보다 오히려 $\mu_$가 크며 10회 반복 후 잔차에 정확도가 민감해서 기각됨을 밝혔다.
  3. 사전 반복 추정치의 실패 입증: 5회 반복 후 추정치 $\hat\mu_5$가 실제 $\mu_$와 무관하게 [0.08, 0.21] 범위에 몰려있어 결정 규칙으로 사용 시 $\tau=0.05$에서 위양성률(FP rate) 100%임을 보임으로써, $\mu_$가 사전 예측 지표가 아니라 사후 설명 지표임을 명확히 했다.

How

Figure 2

Figure 2. Convergence of two diagnostics toward the true asymp-

Originality

Limitation & Further Study

Evaluation

Novelty: 3/5 Technical Soundness: 4/5 Significance: 3/5 Clarity: 4/5 Overall: 3/5

총평: 통계적 다중비교 보정과 알고리즘적 구조 진단을 결합한다는 아이디어는 벤치마크 검증 방법론에 신선한 관점을 제공하지만, 단일 convex 사례 연구에 국한되어 일반화 가능성이 추측 수준에 머물러 있어 후속 검증이 필요한 초기 단계의 연구이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92 기준으로 'Holm-Bonferroni Verification of Math Solvers: A Hessian-Mismatch Diagnostic for Benchmark-Level Failure Modes'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'LLM-SRBench: A New Benchmark for Scientific Equation Discovery with Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'AI-Researcher: Autonomous Scientific Innovation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구수학 솔버 검증의 방법론적 기반이 되는 벤치마크 평가 이론을 제공한다.
후속 연구다중비교 통계 검정 방법론이 CV 기반 벤치마크 교정의 이론적 기반이 됨
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Accelerating Scientific Research with Gemini: Case Studies and Common Techniques'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근동일하게 수학 솔버 벤치마크 검증에서 통계적 다중비교 문제를 다루는 대안적 접근을 제시한다.
다른 접근수학 솔버 성능 검증에 대한 다른 통계적 접근법을 제시한다.
후속 연구LLM 평가 프레임워크 설계의 기초 방법론을 공유한다.
후속 연구벤치마크 평가의 구조적 진단지표를 확장하여 유사한 통계적 검증 프레임워크를 제안한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드