$\text{P}^4$Bench: Contamination-Proof, Publicly Verifiable, and Privacy-Preserving LLM Evaluation via Zero-Knowledge Proofs

저자: Enhan Zhao, Yuanrui Zhang, Zhang Zhang, Wei Wu, Di He | 날짜: 2026 | URL: https://openreview.net/forum?id=SAY3zZt2my 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Comparison of benchmark data flows and their intuitive interpretation. Public benchmarks expose answers togeth

데이터 오염과 투명성이라는 상충되는 문제를 해결하기 위해, 문제만 공개하고 정답은 비공개로 유지하면서 zero-knowledge proofs(ZKPs)로 모델이 정답을 맞췄음을 공개적으로 검증 가능하게 하는 LLM 평가 프레임워크 P4Bench를 제안한다.

Motivation

Achievement

Figure 1

Figure 1. Comparison of benchmark data flows and their intuitive interpretation. Public benchmarks expose answers togeth

  1. P4Bench 프레임워크 제안: ZKP 기반으로 contamination-proof, publicly verifiable, privacy-preserving 세 가지 속성을 동시에 만족하는 benchmark 평가 프레임워크를 최초로 설계했다.
  2. SAT/DLP 태스크 구현: Boolean satisfiability(SAT)와 discrete logarithm problem(DLP)에 대해 각각 500개의 controlled-difficulty 문제 인스턴스를 구성하고 zk-SNARK circuit으로 답안 검증을 인코딩하는 전체 파이프라인(문제 생성→LLM 평가→proof 생성→공개 검증)을 구현했다.
  3. 프론티어 모델 평가: 7개의 frontier LLM(Qwen 3.5 Plus 등)을 대상으로 평가를 수행해 모델별, 난이도별 성능 차이를 효과적으로 구별할 수 있음을 보였다.
  4. 실용성 입증: proof 생성과 검증이 실제 제출 시점에 실용적으로 수행 가능함을 실험적으로 확인해 ZKP 기반 공개 감사 가능 평가의 실현 가능성을 입증했다.

How

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: contamination과 투명성 사이의 오래된 trade-off를 zero-knowledge proofs라는 암호학적 도구로 새롭게 접근한 참신하고 시의적절한 연구이나, SAT/DLP를 넘어 실제 자연어 수학 reasoning benchmark로의 확장 가능성 검증이 향후 중요한 과제로 남아있다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.90로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Through the lens of core competency: Survey on evaluation of large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'TrustLLM: Trustworthiness in Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구token-level 검증 프로토콜을 확장하는 관련 연구이다.
후속 연구공개 검증 가능한 LLM 평가 프레임워크를 확장한 연구로 판단된다.
기반 연구SPECTER2 유사도 0.90로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Verifier-Constrained Flow Expansion for Discovery Beyond the Data'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근데이터 오염 문제를 해결하기 위한 다른 검증 방식을 제안하는 벤치마크 연구로 보인다.
다른 접근formal verification 도구를 활용한 다른 정리 증명 접근법이다.
응용 사례zero-knowledge proof를 활용한 검증 가능 평가 방식을 실제 벤치마크에 적용한 사례로 보인다.
후속 연구private mechanism 설계의 이론적 배경을 제공한다.
반론/비판LLM 평가 투명성에 대해 다른 관점의 벤치마크 설계를 제안함
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드