AMR-Bench-mini: A Diagnostic Benchmark for Agentic Mechanistic AMR Reasoning under Evidence Insufficiency

저자: Ali Ihsan Nergiz, Erva Nur Cinar | 날짜: 2026 | URL: https://openreview.net/forum?id=i2Onnie8Ao 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

이 논문은 Klebsiella pneumoniae에 국한된 924개 과제로 구성된 진단형 벤치마크 AMR-Bench-mini를 제안하여, frontier LLM 에이전트가 항생제 내성(AMR) 기전을 추론할 때 evidence sufficiency를 실제로 판단하는지, 혹은 그럴듯한 기전을 패턴매칭하는지를 검증한다. 세 모델(GPT-5.4, Gemini 3.1 Pro, Claude Opus 4.7) 모두 abstention(증거 불충분 인정) 카테고리에서 약 25%로 수렴하는 공통 실패를 보였다.

Motivation

Achievement

  1. AMR-Bench-mini 벤치마크 구축: 60개 공개 K. pneumoniae isolate로부터 924개 MechReason task(및 1,201 GenoPheno, 987 DBReconcile 페어링 트랙)를 생성하고, 50-task 균형 pilot과 evidence insufficiency, substrate-specificity decoy, intrinsic/acquired ontology, hybrid mechanism 등 7개 범주로 조직된 50-task hard split을 공개했다.
  2. Audit-and-fix gold 개선 방법론: 2라운드 계층화 감사(31개, 29개 카드)를 통해 5개의 체계적 priority 오류를 발견·수정하여 non-KEEP율을 29%에서 7%로 낮추고, heuristic gold 신뢰도를 71%에서 93%로 끌어올렸으며, 세 벤더가 모두 heuristic gold에 반대로 합의한 4개 사례를 candidate gold error로 별도 조정(adjudicated override)했다.
  3. Cross-vendor invariance 및 tool injection null 결과: GPT-5.4, Gemini 3.1 Pro, Claude Opus 4.7이 pilot에서 82–88%, hard split에서 50–64%를 기록했으며 Wilson 95% CI가 겹치는 가운데, 세 모델 모두 abstention 카테고리(C1)에서 ~25% 정확도로 수렴하는 것을 확인했고, CARD ARO substrate-context 사전 해결 도구를 Gemini 프롬프트에 주입해도 hard accuracy에 순 0%p 효과(2승 2패)만 나타남을 보였다.

How

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 3/5 Clarity: 4/5 Overall: 4/5

총평: 단일 종에 국한된 소규모 진단 벤치마크이지만, evidence insufficiency 인식이라는 핵심적이면서도 그동안 간과된 실패 모드를 정밀하게 포착하고 세 frontier 모델의 공통된 약점(abstention 정확도 ~25%)과 단순 tool injection의 무효성을 명확히 보여준 실증적으로 탄탄한 연구이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 Biomedical AI Knowledge Systems와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Bio-SIEVE: Exploring Instruction Tuning Large Language Models for Systematic Review Automation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 Biomedical AI Knowledge Systems와 Agentic AI for Scientific Automation가 맞닿아, 'Biodsa-1k: Benchmarking data science agents for biomedical research'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Biomedical AI Knowledge Systems와 AI-Driven Drug and Materials Discovery가 맞닿아, 'SciToolAgent: a knowledge-graph-driven scientific agent for multitool integration'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근LLM 에이전트의 기전 추론 능력을 진단하는 벤치마크라는 유사한 연구 목표를 공유함
다른 접근evidence sufficiency 판단 능력을 진단하는 유사한 벤치마크 접근이다.
다른 접근생물의학 도메인에서 evidence sufficiency 판단을 요구하는 에이전트형 LLM 평가라는 공통 문제를 다룸
다른 접근frontier LLM의 evidence sufficiency 판단 능력을 다른 생물학적 추론 과제로 검증하는 유사한 벤치마크 설계
후속 연구구조화된 진단 벤치마크를 임상 AI lifecycle로 확장한 연구로 보인다.
응용 사례LLM 에이전트를 특정 과학 도메인(생물학)에 적용하여 평가하는 유사한 실험 설계
반론/비판metadata 기반 예측 가능성에 대한 기존 관점과 대비되는 시각을 제시한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드