/Users/jehyunlee/Documents/내노트북/paper-curation/docs/papers/182_Can_language_models_falsify_evaluating_algorithmic_reasoning


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

Figure 1

While standard benchmarks for algorithmic reasoning require models to generate

본 논문은 language model이 알고리즘 문제의 미묘하게 틀린 solution에 대해 counterexample(반례)을 생성할 수 있는지를 평가하는 새로운 벤치마크 REFUTE를 제안하고, 최상위 reasoning agent들도 9% 미만의 성공률에 그친다는 것을 보인다.

Motivation

Achievement

Figure 3

(Left) Distribution of Test Cases Passed by Incorrect Solutions: The median test

  1. REFUTE 벤치마크 구축: 2024-2025년 Codeforces 대회에서 수집한 324개의 problem-incorrect solution 쌍으로 구성된, 동적으로 업데이트되는 오염(contamination)-free 벤치마크를 제시했다.
  2. 자동 필터링 파이프라인: 무작위 탐색이 아닌 실제 추론을 요구하도록 샘플을 정제하는 자동화된 필터링 절차를 개발했다.
  3. 핵심 실증 결과: OpenAI o3-mini (high), DeepSeek R1 등 code execution feedback과 ReAct agent, few-shot chain-of-thought를 사용한 최상위 모델들도 REFUTE에서 9% 미만의 counterexample 생성 성공률을 보인 반면, 동일 모델들은 처음부터 문제를 최대 48%까지 풀 수 있음을 보여, generation과 falsification 능력 간의 뚜렷한 비대칭성(generator-verifier gap)을 입증했다.

How

Figure 1

While standard benchmarks for algorithmic reasoning require models to generate

Originality

Limitation & Further Study

Evaluation

Novelty: 5/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: LM의 self-verification 및 falsification 능력에 대한 근본적인 맹점을 명확한 실험으로 드러낸 시의적절하고 독창적인 연구로, 향후 reflective reasoning 및 self-improvement 연구에 중요한 초석이 될 것으로 평가된다.

같이 보면 좋은 논문

기반 연구LLM 기반 에이전트의 코드 생성 능력을 평가하는 확장된 접근이다.
후속 연구반례 생성 능력 평가를 다른 프로그래밍 문제로 확장한다.
기반 연구언어모델의 논리적 반증 능력에 대한 이론적 기초를 제공한다.
다른 접근언어모델의 알고리즘적 추론 능력을 다른 방식으로 평가한다.
다른 접근코드 검증 능력에 대한 다른 벤치마크 설계를 제시한다.
후속 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Can language models falsify? evaluating algorithmic reasoning with counterexample creation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Can language models falsify? evaluating algorithmic reasoning with counterexample creation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Can language models falsify? evaluating algorithmic reasoning with counterexample creation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 Formal Proof Verification Automation와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Can language models falsify? evaluating algorithmic reasoning with counterexample creation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 Formal Proof Verification Automation와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Can language models falsify? evaluating algorithmic reasoning with counterexample creation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Can language models falsify? evaluating algorithmic reasoning with counterexample creation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 Formal Proof Verification Automation와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Can language models falsify? evaluating algorithmic reasoning with counterexample creation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Can language models falsify? evaluating algorithmic reasoning with counterexample creation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드