MolOpt-Eval: Can Frontier LLMs Perform Structure-Based Hit-to-Lead Optimization?

저자: Chengzhu Li, Haichuan Tan, Wenyu Zhu, Bowen Gao, Jiqing Zheng, Ya-Qin Zhang, Wei-Ying Ma, Yanyan Lan | 날짜: 2026 | URL: https://openreview.net/forum?id=lxXKX5P8IL 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 2

Figure 2. Overview of MolOpt-Eval. MolOpt-Eval evaluates LLMs for structure-based molecular optimization by decomposing

이 논문은 frontier LLM들이 구조 기반 hit-to-lead 분자 최적화에서 실제로 어떤 능력을 갖추고 있는지, 그리고 실패가 reasoning chain의 어느 단계에서 발생하는지를 진단하기 위해 MolOpt-Eval이라는 벤치마크를 제안한다. 30개 DUD-E 단백질 타겟과 13개(발췌 초록 기준 10개) 진단 태스크를 통해 Structural Perception, Strategy Discovery, Strategy Execution 세 단계로 분해하여 14개 LLM을 평가한 결과, 3D spatial reasoning이 핵심 병목임을 규명했다.

Motivation

Achievement

Figure 1

Figure 1. End-to-end affinity optimization test. Each point denotes

  1. End-to-end 실패 입증: Boltz-2로 예측한 pIC50 변화가 음의 회귀 기울기를 보여, 개선은 저친화성 리간드에 집중되고 고친화성 리간드는 오히려 악화되어 정향적 최적화가 아닌 평균으로의 회귀 현상임을 규명.
  2. 3단계 진단 벤치마크 구축: 30개 DUD-E 타겟, 150개 active protein-ligand complex, PLIP 기반 상호작용 주석을 활용해 구조 인지-전략 발견-전략 실행을 독립적으로 평가하는 10개(초록 상 13개) 태스크 설계.
  3. 핵심 병목 식별: 2D 분자 구조(micro-F1=0.92)와 단백질 fold 분류(최대 90%)는 높은 정확도를 보이나 3D interaction perception은 F1<0.40으로 급락, 전략은 화학적으로 타당(>93%)하고 SMILES 유효성도 높지만(>95%) Boltz-2 co-folding 검증 시 의도한 상호작용 달성률은 2.5% 미만임을 규명.
  4. 모델 간 격차 소멸 및 거리 민감도 분석: 가장 어려운 태스크에서는 모델 간 성능 차이가 사라져 패러다임 자체의 한계임을 시사했고, distance sensitivity 실험으로 LLM이 공간 정보를 처리는 하지만 이를 정확한 상호작용 예측으로 전환하지 못함을 확인.

How

Figure 3

Figure 3. Radar plots compare the best-performing model from each vendor across selected metrics in Stage 1&2 (left) and

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: LLM을 구조 기반 분자 최적화에 적용할 때의 실패 원인을 reasoning chain 단계별로 분해하여 정량적으로 진단한 체계적이고 시의적절한 연구로, 3D spatial reasoning이 핵심 병목임을 설득력 있게 제시하지만 벤치마크의 외부 검증 도구(Boltz-2, PLIP) 의존성과 일반화 가능성은 추가 검토가 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'ChemCrow: Augmenting large-language models with chemistry tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93 기준으로 'MolOpt-Eval: Can Frontier LLMs Perform Structure-Based Hit-to-Lead Optimization?'의 AI4S 방법론을 'Agentic End-to-End De Novo Protein Design for Tailored Dynamics Using a Language Diffusion Model'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'PRIME: A Multi-Agent Environment for Orchestrating Dynamic Computational Workflows in Protein Engineerings'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구멀티턴 장기 호라이즌 에이전트 평가 프레임워크를 신약 설계 도메인에 적용한 사례이다.
다른 접근LLM의 reasoning chain 실패 지점을 진단하는 유사한 평가 방법론을 사용한다.
기반 연구화학 기반 벤치마크를 이용한 RL post-training 연구를 확장한다.
후속 연구LLM reasoning chain 진단이라는 평가 방법론을 확장하여 적용한다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Benchmarking and Experimental Validation of Machine Learning Strategies for Enzyme Engineering'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근구조 기반 약물 설계 태스크에서 LLM 성능을 다른 관점에서 평가한다.
다른 접근구조 기반 분자 최적화에서 LLM의 능력을 평가하는 유사한 벤치마크 접근법을 제시한다.
후속 연구제안-평가-개선 파이프라인의 방법론적 기반을 제공한다.
응용 사례LLM 기반 분자 설계 능력을 실제 hit-to-lead 최적화 문제에 적용한 사례이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드