ABC-Bench: An Agentic Bio-Capabilities Benchmark for Biosecurity

저자: Andrew Bo Liu, Samira Nedungadi, Bryce Cai, Alex Kleinman, Harmon Bhasin, Seth Donoughe | 날짜: 2026 | URL: https://openreview.net/forum?id=yiaf7VlPpH 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. The Liquid Handling Robot task from ABC-Bench. A. We (1) prompt the agent with task instructions; (2) provide

이 논문은 LLM 에이전트가 생물학 실험 자동화 및 이중용도(dual-use) 생물학 작업을 수행하는 능력을 측정하기 위한 ABC-Bench를 제안하고, 8개 최신 모델을 175시간 분량의 인간 전문가 기준선과 비교 평가한다.

Motivation

Achievement

Figure 2

Figure 2. ABC-Bench evaluation results. Points show refusal-corrected mean accuracy across 10 runs; segments show 95% BC

  1. 인간 전문가를 능가하는 성능: 테스트된 모든 LLM 에이전트가 세 가지 과제 모두에서 중앙값 인간 전문가 기준선을 능가했다.
  2. 작업 유형별 성능 차이 발견: 에이전트는 공개된 지식과 잘 문서화된 프로토콜에 의존하는 과제에서는 높은 성능을, 새로운 bioinformatics 추론이 필요한 과제에서는 상대적으로 약한 성능을 보였다.
  3. 실제 웹랩 검증 성공: OpenAI의 o4-mini-high가 작성한 스크립트를 OpenTrons 액체 취급 로봇에서 실행한 결과, 예상 서열대로 DNA 조립에 성공했음을 세 차례의 웹랩 검증 실험을 통해 확인했다.
  4. 산업계 채택: ABC-Bench는 주요 AI 기업들이 자사 모델 카드에서 "Screening Evasion", "Fragment Design", "Liquid Handling Robot" 평가로 인용할 만큼 실질적인 영향력을 얻었다.

How

Figure 3

Figure 3. Pipeline for generating OpenTrons protocols.

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 4/5

총평: AI 에이전트의 생물학적 능력이 실제 위해로 이어질 수 있는 실질적 위험을 실증적으로, 그리고 웹랩 검증까지 곁들여 보여준 시의적절하고 중요한 연구로, 이미 산업계에 채택된 실용적 영향력을 갖추었으나 과제 범위와 인간 기준선의 확장이 추가로 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 AI-Driven Drug and Materials Discovery가 맞닿아, 'ChemCrow: Augmenting large-language models with chemistry tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'CRISPR-GPT for agentic automation of gene-editing experiments'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근benchtop DNA synthesizer 보안 문제에 대한 관련 background 연구로 이론적 토대를 제공함
다른 접근LLM 에이전트의 생물학 이중용도 역량 평가라는 동일한 벤치마크 문제를 다룸
다른 접근바이오시큐리티 관점에서 LLM 에이전트 위험도를 측정하는 유사한 벤치마크 연구
다른 접근생물학 실험 자동화 능력 평가를 위한 관련 벤치마크
응용 사례생물보안 관련 LLM 에이전트 평가를 실제 실험 자동화 시나리오에 적용한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드