No LLM Aced Yu Tsumura's 554th Problem

저자: Simon Frieder, William Hart, Leonhard Hasler | 날짜: 2026 | URL: https://openreview.net/forum?id=UqFZqwG0ub 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

저자들은 그룹 이론 문제인 Yu Tsumura's 554th problem이 IMO 수준의 증명 난이도를 가지면서도 공개된 해답이 이미 학습 데이터에 존재함에도 불구하고, 31개 최신 LLM 중 어느 것도 세 번의 시도에서 안정적으로 풀지 못함을 실증적으로 보인다.

Motivation

Achievement

  1. 진단적 문제 발굴: 300개 이상의 group theory 문제 중 IMO 수준의 증명 난이도를 가지면서도 어떤 최신 LLM도 안정적으로 풀지 못하는 유일한 문제(Yu Tsumura's 554th problem)를 식별했다.
  2. 31개 LLM에 대한 광범위한 실증 분석: 91개의 전문가 평가 증명 시도를 통해 최상위 모델들과 그 계보(intermediate version 포함)를 추적하여 성능의 spiky한 양상을 입증했다.
  3. 인간-LLM 비교 사례 연구: 그룹이론 사전지식이 없는 전직 IMO 참가자가 ChatGPT와의 상호작용만으로 문제를 해결함으로써, 문제의 난이도가 IMO 수준 인간에게는 도달 가능함을 보였다.
  4. 수학적 부산물 - 원 증명의 오류 수정: LLM 출력과 기존 해답을 비교하는 과정에서 원본 공개 증명의 기술적 오류를 발견하고, conjugation 개념 없이도 성립하는 더 나은 동기 부여의 새로운 증명을 제시했다.

How

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 단일 사례 연구라는 한계는 있지만, LLM의 수학적 추론 능력에 대한 낙관론에 대해 설득력 있는 반증 사례를 제시하고 이를 인간 비교 및 수학적 기여로까지 확장한 흥미롭고 시의적절한 연구이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 Formal Methods & Code Generation가 맞닿아, 'Mustard: Mastering uniform synthesis of theorem and proof data'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구분자 크기에 따른 diffusion 궤적 문제를 확장하여 다룬 연구이다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Advancing Mathematics Research with AI-Driven Formal Proof Search'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구형식 검증 벤치마크를 조합수학 도메인으로 확장함
기반 연구AI 기반 반례 탐색 방법론을 다른 조합론 문제로 확장한 연구이다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Accelerating Scientific Research with Gemini: Case Studies and Common Techniques'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구원소 범위 확장을 통한 MLIP 개선을 확장한다.
다른 접근고난도 수학 문제에서 LLM의 한계를 실증적으로 보이는 유사한 연구이다.
다른 접근sparse-reward 조합 문제 탐색을 위한 다른 강화학습 접근법을 제시한다.
다른 접근LLM의 수학적 추론 실패를 실증하는 유사한 벤치마크 연구
후속 연구특정 문제 사례를 통한 LLM 한계 분석을 확장
후속 연구특정 수학 문제를 통한 LLM 평가를 확장하는 유사한 방법론을 다룬다.
반론/비판LLM의 수학적 추론 능력에 대해 상반되거나 대조적인 결과를 제시할 수 있는 연구이다.
반론/비판LLM의 수학적 능력에 대해 대조적인 관점을 제시할 가능성
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드