SMDD-Bench: Can LLMs Solve Real-World Small Molecule Drug Design Tasks?

저자: Kevin Han, Renfei Zhang, Kathy Y Wei, Hamed Mahdavi, Niloofar Mireshghallah, Amir Barati Farimani | 날짜: 2026 | URL: https://openreview.net/forum?id=nNi95bUe37 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

이 논문은 실제 신약 설계(small molecule drug design) 워크플로우를 반영한 멀티턴, 장기 호라이즌(long-horizon) 에이전트 벤치마크인 SMDD-Bench를 제안하고, 7개의 최신 LLM을 평가하여 최고 성능 모델(GPT5.4)조차 40.2%의 과제만 해결함을 보인다.

Motivation

Achievement

Figure 2
  1. SMDD-Bench 벤치마크 구축: 2D Pharmacophore Identification, Interaction Point Discovery, Scaffold Hopping, Lead Optimization, Fragment Assembly의 5개 과제 유형에 걸쳐 502개 과제 인스턴스와 102개 고유 단백질 타겟을 포함하는 대규모 멀티턴 에이전트 벤치마크를 제시했다.
  2. witness-aware task generation 도입: 과제 생성과 동시에 해당 과제를 해결하는 witness 분자를 생성함으로써, 사람 개입 없이도 화학적으로 유효하고 해결 가능성이 보장된 과제 인스턴스를 대규모로 자동 생성하는 방법을 고안했다.
  3. 완전 전산 평가 파이프라인 구현: RDKit, PLIP, OpenBabel, Boltz2, ADMET-AI 등의 전문 도구를 활용하여 human-in-the-loop 없이 각 과제 인스턴스를 정량적으로 평가할 수 있는 체계를 마련했다.
  4. 7개 프론티어 LLM 벤치마킹: 최소한의 agent scaffold를 이용해 오픈소스 및 클로즈드소스 LLM 7종을 평가한 결과, 간단한 lead optimization 과제에서는 최대 50%의 성공률을 보였으나 더 어려운 과제 유형에서는 성공률이 거의 0%에 가까워 LLM의 자율 의약화학자로서의 성장 여지를 명확히 드러냈다.
  5. SMDD-Bench Diversity 프레임워크 제안: SMDD-Bench의 부분집합과 함께 SMDD 에이전트 출력의 다양성을 연구하기 위한 원칙적인 프레임워크를 함께 제시했다.

How

Figure 1

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 실제 신약 설계 워크플로우를 반영한 대규모 멀티턴 에이전트 벤치마크를 제시하고 witness-aware task generation이라는 실용적 해법을 도입한 점에서 의미 있는 기여를 하며, LLM 에이전트의 자율 신약 설계 능력에 대한 현실적인 한계를 잘 드러낸 연구이다.

같이 보면 좋은 논문

기반 연구부작용을 고려한 약물 최적화라는 동일한 응용 영역을 다룬다.
기반 연구생물보안 관련 LLM 에이전트 평가를 실제 실험 자동화 시나리오에 적용한다.
기반 연구멀티턴 장기 호라이즌 에이전트 평가의 기초 프레임워크 제공
다른 접근동일한 데이터 사이언스/과학 발견 에이전트 평가 문제를 다루는 프레임워크로, DrugSAGE와 유사하게 task 수행 효율성을 다룬다.
기반 연구SPECTER2 유사도 0.94로 Computational Molecular Design와 LLMs for Molecular Biology & Chemistry가 맞닿아, 'SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 Computational Molecular Design와 Agentic AI for Scientific Automation가 맞닿아, 'MolQuest: A Benchmark for Agentic Evaluation of Abductive Reasoning in Chemical Structure Elucidation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근화학 추론 평가를 위한 대안적 벤치마크 설계 방식
다른 접근LLM의 reasoning chain 실패 지점을 진단하는 유사한 평가 방법론을 사용한다.
응용 사례멀티턴 장기 호라이즌 에이전트 평가 프레임워크를 신약 설계 도메인에 적용한 사례이다.
다른 접근실제 워크플로우 반영 벤치마크 구축을 위한 다른 접근법
후속 연구agent 기반 과학적 설계 프레임워크의 기초를 제공함.
후속 연구에이전트 평가를 위한 실행 검증 기반 프레임워크의 기초가 되는 연구이다.
응용 사례LLM 에이전트를 신약 설계 도메인에 적용한 벤치마크 연구
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드