Reasoning Is More Than the Model: Harness-Aware Evaluation of Agents on Verifiable Reasoning Tasks

저자: Zhanke Zhou, Zongze Li, Weikai Huang, Xuan Li, Chentao Cao, Xiao Feng, Xiangyu Lu, Jinbo Hu, Menghan Lu, Yi Xie, Nico Pelleriti, Shiyang Liu, Max Zimmer, Brando Miranda, Jiangchao Yao, Bo Liu, Sanmi Koyejo, Sebastian Pokutta, Bo Han | 날짜: 2026 | URL: https://openreview.net/forum?id=4vARlk9o95 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

에이전트의 성능은 모델 하나만의 속성이 아니라 model-harness 시스템 전체의 속성이라는 관점에서, 벤치마크·모델·harness·실행 환경·scorer·budget을 표준화하여 통제된 비교를 가능케 하는 harness-aware 평가 시스템 AlphaDiana를 제안한다.

Motivation

Achievement

Figure 5
  1. AlphaDiana 시스템 구축: benchmark, model, harness, environment, scorer, budget, trajectory logging을 표준화한 통합 평가 시스템을 구축하여 모델과 harness 양쪽에 대한 통제된 비교(controlled comparison)를 가능하게 했다.
  2. Macro-level 발견: 세 가지 모델(Qwen3.5-27B, Gemma-4-31B-IT, Kimi-K2.6), 세 가지 harness(OpenClaw, ZeroClaw, OpenCode), no-harness baseline, 네 가지 benchmark(IMO-AnswerBench, HLE 검증가능 subset, AIME 26, GPQA-Diamond)에 걸쳐 harnessing 효과가 모델에 따라 다르며 균일하지 않음을 확인했다(어떤 모델에는 도움, 다른 모델에는 해가 됨).
  3. Micro-level 발견: tool 접근과 skill loading을 분리해 분석한 결과, tool과 skill이 호환되는 model-harness 설정에서는 성능을 향상시키지만 강력한 direct reasoning을 방해하거나 불안정하게 만드는 non-monotonic한 효과를 관찰했다.
  4. Trajectory-level 귀인 분석: reasoning, tool use, execution, state, budget, recovery, verification 등 여러 축에 걸쳐 성공/실패를 귀인함으로써 harness가 반복적 문제 해결(iterative problem-solving)을 가능하게 하는 동시에 체계적 오류(systematic errors)도 유발할 수 있음을 보였다.

How

Figure 2

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: Model-centric 평가에서 harness-aware 평가로의 패러다임 전환을 명확히 제시하고 이를 위한 실용적 시스템을 구축한 의미 있는 연구로, agent 평가의 재현성과 해석가능성 향상에 기여할 것으로 보이나 구체적 실험 결과의 상세한 검증이 추가로 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.95로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'From LLM Reasoning to Autonomous AI Agents: A Comprehensive Review'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근LLM 및 자율 AI 에이전트 벤치마크를 통합 정리하는 유사한 서베이 구조를 공유함
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구harness-aware 평가 프레임워크의 기초적 설계를 제공함
다른 접근Lean을 이용한 형식 증명이라는 유사한 방법론적 접근을 사용한다.
기반 연구reasoning-centric 시스템의 harness 기반 평가로 본 연구를 확장함
다른 접근reasoning-centric 과학적 발견 시스템을 다른 관점(harness 평가)에서 다룸
기반 연구sandboxed 환경에서 자율적 연구 에이전트를 실제 적용한 사례이다.
기반 연구SPECTER2 유사도 0.95 기준으로 'Reasoning Is More Than the Model: Harness-Aware Evaluation of Agents on Verifiable Reasoning Tasks'의 AI4S 방법론을 'The Story is Not the Science: Execution-Grounded Evaluation of Mechanistic Interpretability Research'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
다른 접근코드와 데이터 실행을 통한 연구 검증이라는 동일한 문제의식을 공유한다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'ENPIRE: Agentic Robot Policy Self-Improvement in the Real World'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근coding agent를 활용한 로봇 정책 자기개선이라는 유사한 목표를 다룬다.
다른 접근에이전트 시스템 성능 결정 요인을 다루는 유사 연구임
다른 접근AI 연구 자동화 시스템의 표준화된 평가라는 유사 문제를 다룬다.
다른 접근구조화된 workflow 평가라는 유사한 목표를 가진 연구이다.
다른 접근재사용 가능한 스킬 학습이라는 동일한 목표를 가진 연구이다.
다른 접근formal verification 도구를 활용한 자기진화 에이전트의 대안적 설계
다른 접근에이전트 기반 과학적 발견 자동화라는 응용 맥락을 공유한다.
다른 접근agentic research loop의 안정성을 다루는 유사한 접근법이다.
다른 접근연구 과정의 탐색 경로와 실패 실험 보존이라는 문제의식을 공유하는 AI 연구 에이전트 관련 연구.
다른 접근LLM의 과학적 도메인 지식 및 조작 능력을 평가하는 유사한 벤치마크 설계를 공유한다.
다른 접근에이전트 성능 평가를 위한 유사한 harness 기반 접근을 취한다.
다른 접근가설 정제와 지식 축적을 위한 다른 에이전트 구조를 제시한다.
다른 접근고위험 LLM 의사결정 검증을 위한 다른 신뢰도 보정 방법을 제시한다.
다른 접근JAX 기반 물리 시뮬레이션 코드의 다른 구현 사례이다.
다른 접근다중 에이전트 시스템의 협력 메커니즘을 다루는 유사 연구이다.
다른 접근안전-임계 엔지니어링 관점의 유사 평가 프레임워크임
후속 연구LLM 기반 수치 시뮬레이션의 실패 유형 연구의 기초가 된다.
후속 연구멀티에이전트 협업 및 도구 사용의 이론적 기반을 제공함
후속 연구데이터 사이언스 에이전트 평가 방법론의 기초를 제공한다.
후속 연구실험 기록 기반 데이터셋 구성의 방법론적 기초를 제공한다.
후속 연구다중 에이전트 조율 프레임워크의 방법론적 토대를 제공한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드