VeriScale: Adversarial Test-Suite Scaling for Verifiable Code Generation

저자: Yifan Bai, Xiaoyang Liu, Zihao Mou, Guihong Wang, Jian Yu, Shuhan Xie, Yantao Li, Yangyu Zhang, Jingwei Liang, Tao Luo | 날짜: 2026 | URL: https://openreview.net/forum?id=5CrChyQ3Su 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Overview of the VeriScale framework for adversarial test-suite scaling. Driven by the adversarial implementati

VeriScale는 적대적 구현(adversarial implementation)을 활용해 검증 가능한 코드 생성 벤치마크의 테스트 스위트를 확장(expansion)하고 다시 축약(reduction)하는 프레임워크로, VERINA에 적용해 VERINAPLUS와 VERINALITE를 구축함으로써 기존 벤치마크가 은닉하던 LLM의 명세(SpecGen) 및 코드 생성(CodeGen) 취약점을 드러낸다.

Motivation

Achievement

Figure 5

Figure 5. Performance comparison of eight models on VERINA, VERINAPLUS, and VERINALITE. The top panel shows the Code

  1. VeriScale 프레임워크 제안: adversarial implementation을 활용해 test suite의 체계적 확장과 축약을 동시에 구동하는 새로운 프레임워크를 제시했다.
  2. VERINAPLUS/VERINALITE 구축: VERINA에 적용해 원본 test suite를 83배 이상 확장한 VERINAPLUS와 14배 규모의 경량 VERINALITE를 만들었다.
  3. 모델 취약점 노출 입증: 8개의 최신 LLM에 대해 VERINAPLUS가 SpecGen과 CodeGen에서 급격한 점수 하락을 유발함을 보였고(GPT-5.5는 SpecGen 68.78%→44.44%, CodeGen 96.83%→86.24%), 이는 기존 벤치마크의 과대평가를 드러낸다.
  4. 효율적 축약 검증: VERINALITE가 VERINAPLUS와 유사한 변별력을 훨씬 적은 평가 비용으로 유지함을 실험적으로 확인했다.

How

Figure 2

Figure 2. A full trajectory of candidate input classification.

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 검증 가능 코드 생성 벤치마크의 근본적 한계인 test-suite 품질 문제를 adversarial implementation이라는 일관된 원리로 확장과 축약 모두에 적용해 해결한 실용적이고 잘 설계된 연구로, 벤치마크 신뢰성 향상에 실질적으로 기여한다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.90로 Multimodal Biomedical Data Fusion와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Evaluating large language models trained on code'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.89로 Multimodal Biomedical Data Fusion와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Seed-coder: Let the code model curate data for itself'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.89로 Multimodal Biomedical Data Fusion와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구VERINA와 같은 코드 검증 벤치마크의 기초 프레임워크를 제공하는 연구로 보임
기반 연구테스트 스위트 검증의 기초 방법론을 제공한다.
다른 접근검증 가능한 코드 생성 벤치마크 확장을 위한 다른 접근법을 제시하는 연구로 보임
응용 사례검증기 기반 코드 생성 벤치마크에 adversarial 기법을 적용한 사례임
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드