저자: Sumeet Ramesh Motwani, Daniel Nichols, Charles London, Peggy Li, Fabio Pizzati, Acer Blake, Hasan Abed Al Kader Hammoud, Tavish Malcolm McDonald, Akshat Naik, Alesia Ivanova, Vignesh Baskaran, Ivan Laptev, Ruben Glatt, Tal Ben-Nun, Philip Torr, Ameya Prabhu, Brian R. Bartoldson, Bhavya Kailkhura, Christian Schroeder de Witt | 날짜: 2026 | URL: https://openreview.net/forum?id=47NnSXz3im 📄 PDF
Essence
LongCoT는 chemistry, mathematics, computer science, chess, logic 다섯 개 도메인에 걸쳐 2,500개의 전문가 설계 문제로 구성된 벤치마크로, 수만~수십만 개의 reasoning token을 필요로 하는 상호의존적 step들의 그래프를 탐색하는 능력, 즉 long-horizon chain-of-thought(CoT) 추론 능력을 직접 측정한다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 4/5
총평: LongCoT는 long-horizon CoT reasoning이라는 중요하지만 그동안 직접 측정되지 않았던 능력을 tool-free 설정에서 엄밀하게 격리해 측정하는 잘 설계된 벤치마크로, 프론티어 모델들의 명확한 한계를 드러내는 유의미한 기여를 한다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 AI-Driven Drug and Materials Discovery가 맞닿아, 'SciCode: A Research Coding Benchmark Curated by Scientists'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근과학적 코딩 및 문제 해결 능력을 평가하는 유사 연구이다.
기반 연구RLLMs의 추론 특성을 확장하여 분석한다.
기반 연구reasoning token 기반 평가 방법론의 기초를 제공한다.
기반 연구LoRA 기반 파인튜닝을 특정 전문 도메인에 적용한 유사 사례이다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Accelerating Scientific Research with Gemini: Case Studies and Common Techniques'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 AI-Driven Drug and Materials Discovery가 맞닿아, 'SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근LLM의 과학적 추론 능력을 평가하는 유사한 벤치마크이다.
다른 접근장기 chain-of-thought 추론 평가라는 유사 문제를 다른 벤치마크로 다룬다.
후속 연구연역 추론 벤치마크 설계의 방법론적 기반을 제공한다.
다른 접근LLM의 과학 실험 결과 예측 능력 평가라는 동일한 문제를 다룸
후속 연구다중 도메인 reasoning 벤치마크를 확장한 연구이다.
다른 접근LLM의 관계적 추론 능력을 평가하는 다른 벤치마크 접근을 제시한다.
다른 접근neuro-symbolic 프레임워크로 수학 증명 자동화라는 유사 목표에 다른 접근을 제시함
다른 접근수학적 발견 능력 평가라는 동일한 문제를 다른 벤치마크 설계로 접근한 연구이다.
후속 연구온톨로지 기반 지식 표현의 이론적 토대를 제공하여 MOFology의 EMMO 기반 설계에 기초가 된다.
후속 연구literature-grounded benchmark 구축의 방법론적 기반을 제공한다.