(Left) Previous benchmarks for domain-specific AI Agents either focus on the low-level
BioKGBench는 생물의학 분야 AI Scientist agent를 평가하기 위해 KGQA(Knowledge Graph Question Answering)와 SCV(Scientific Claim Verification)라는 두 원자적(atomic) 능력으로 "문헌 이해"를 분해하고, 이를 결합한 KGCheck라는 새로운 agent task를 통해 대규모 knowledge graph의 사실 오류를 탐지하는 벤치마크를 제안한다.
총평: AI Scientist를 위한 agent 평가에서 구조화·비구조화 데이터 이해를 명확히 분리하고 실제 KG 오류 발견이라는 실질적 가치를 보여준 의미 있는 벤치마크 논문으로, 생물의학 AI agent 연구에 실용적이고 재현 가능한 평가 기준을 제공한다.