APEX: Approximate-but-exhaustive search for ultra-large combinatorial synthesis libraries
저자: Aryan Pedawi, Jordi Silvestre-Ryan, Bradley Worley, Darren J. Hsu, Kushal S Shah, Elias Stehle, Jingrong Zhang, Izhar Wallach | 날짜: 2026 | URL: https://openreview.net/forum?id=5lIJrDCQll📄 PDF
⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
APEX는 combinatorial synthesis library(CSL)의 조합 구조를 활용하여 objective와 constraint를 synthon 단위 스칼라 기여도의 합으로 분해하는 neural network surrogate를 학습함으로써, consumer GPU 상에서 1분 이내에 수십억 개 화합물 전체를 열거·평가하여 근사 top-k 집합을 정확히(exactly) 검색하는 방법을 제안한다.
Motivation
Known: Enamine REAL과 같은 make-on-demand CSL은 수백억~수조 개 화합물을 포함하며 신약 발굴을 위한 화학 공간 탐색을 크게 확장시켰다. 그러나 docking 등 고비용 scoring function으로는 전체 라이브러리를 exhaustively 평가하는 것이 불가능해, heuristic, reinforcement learning, active learning, 생성모델 기반 방법 등 다양한 virtual screening 알고리즘이 라이브러리의 일부(보통 1% 미만)만 평가하는 방식으로 개발되어 왔다.
Gap: 기존 surrogate 기반 방법들(Deep Docking, MolPal, MEMES 등)은 라이브러리 크기에 선형적으로 비례하는 inference 비용이 들어 수십억 규모 CSL에서는 exhaustive evaluation 자체가 병목이 되며, protein-ligand embedding 방법(ConPLex, DrugCLIP, LigUnity)도 화합물을 개별적으로 인코딩해야 해 수십 시간이 소요된다. 또한 V-SYNTHES, Thompson sampling 같은 synthon 기반 방법은 iterative하며 oracle 평가를 반복적으로 필요로 하고 constraint를 자연스럽게 다루지 못하며, 객관식/제약이 캠페인 도중 바뀌면 amortization의 여지가 거의 없다.
Why: 수십억~수조 개 화합물 규모의 CSL에서 objective와 constraint를 실시간으로 바꿔가며 근사적으로 정확한 top-k를 즉시 조회할 수 있다면, 반복적인 oracle 평가 없이 declarative query 기반의 저지연 화학 공간 탐색이 가능해져 신약 발굴 워크플로우를 근본적으로 가속화할 수 있다.
Approach: CSL의 조합적 구조(reaction과 synthon 조합)를 이용해 surrogate 모델의 임베딩을 reaction 및 R-group 할당의 synthon별 스칼라 기여도 합으로 재구성하는 factorizer를 학습시키고, 이를 통해 라이브러리 전체 화합물에 대한 objective/constraint 예측을 사전 캐싱된 synthon 기여도의 조합만으로 계산하는 approximate-but-exhaustive search 프로토콜을 제안한다.
Achievement
초고속 exhaustive top-k 검색: 단일 T4 GPU에서 100억 개 화합물 CSL에 대해 k=1백만인 top-k 검색을 약 30초 만에 수행하는 것을 시연했다.
대규모 벤치마크 CSL 구축: 5개의 의학적으로 중요한 target에 대한 docking score와 RDKit 기반 물리화학적 특성이 주석된 1천만 개 이상 화합물 규모의 벤치마크 CSL을 구축하여, 임의의 objective와 constraint 조합에 대해 ground truth top-k를 계산하고 다른 알고리즘의 검색 결과와 비교 가능하게 했다.
검색 정확도와 실행 시간 모두에서 일관된 우수성: 다양한 대안 방법들과 비교하여 retrieval accuracy와 runtime 양 측면에서 지속적으로 강한 성능을 보였다.
How
1단계 (Surrogate 학습): 열거되고 라벨링된 데이터셋을 이용해 docking score 등 관심 있는 분자 특성을 예측하는 multi-task neural network를 학습한다.
2단계 (Factorizer 학습): CSL이 주어지면, reaction factorizer가 surrogate 모델의 임베딩을 reaction 및 R-group assignment 쌍으로부터 재구성하도록 학습되며, 이를 통해 top-k retrieval에 amenable한 surrogate property의 factorized 근사를 유도한다.
3단계 (Approximate-but-exhaustive search 실행): 검색 쿼리(예: 특정 target에 대한 docking score 최소화, drug-likeness 제약 조건)가 주어지면, factorized surrogate property를 CSL 내 모든 화합물에 대해 계산하고 objective와 constraint에 따라 top-k를 추출한다.
이 구조는 CUDA 기반 효율적 GPU 구현을 통해 factorized top-k 연산을 amortize하여, 반복 oracle 평가 없이 단일 GPU pass로 exhaustive search를 실현한다.
Originality
CSL의 조합적(combinatorial) 구조를 명시적으로 활용해 surrogate 예측을 synthon 단위 스칼라 기여도의 합으로 분해(factorize)하는 아이디어로, 화합물별 개별 인코딩이나 반복적 oracle 평가 없이 전체 라이브러리에 대한 exhaustive scoring을 가능하게 한 점이 독창적이다.
기존 iterative 방법(V-SYNTHES, Thompson sampling)이나 surrogate 기반 방법(Deep Docking, MolPal)과 달리, 학습이 완료된 후에는 객관식/제약이 바뀌어도 재학습이나 반복 평가 없이 즉시 재검색이 가능한 amortized, declarative query 패러다임을 제시했다.
임의의 objective와 constraint에 대해 ground truth top-k를 계산할 수 있는 완전 주석된 대규모(10M+) 벤치마크 CSL을 구축하여, virtual screening 알고리즘 간 공정한 비교를 가능케 하는 평가 인프라를 함께 제공했다.
Limitation & Further Study
발췌된 본문에서는 factorization의 근사 오차가 실제로 얼마나 큰 정보 손실을 초래하는지, 그리고 어떤 유형의 objective/constraint 조합에서 근사 성능이 저하되는지에 대한 심층 분석이 제한적으로 보인다.
벤치마크가 5개 target과 10M~12M 규모 CSL로 한정되어 있어, 실제 산업 규모인 수백억~수조 개 화합물 라이브러리 및 더 다양한 target 계열에 대한 일반화 가능성은 추가 검증이 필요하다.
co-folding score나 더 복잡한 non-additive한 scoring function(예: 상호작용 항이 강한 경우)에 대해 synthon 단위 가산적 분해 가정이 얼마나 잘 성립하는지에 대한 이론적/실증적 한계 논의가 더 필요해 보인다.
후속 연구로 DrugCLIP, LigUnity 같은 protein-ligand embedding 기반 방법과의 결합(저자들도 언급) 및 실제 wet-lab hit 검증을 통한 실용성 입증이 필요하다.
총평: 초대형 CSL에서의 virtual screening 병목을 synthon 단위 분해라는 간단하지만 강력한 아이디어로 해결하여, 실시간에 가까운 exhaustive top-k 검색을 가능케 한 실용적이고 임팩트 있는 연구이다. 다만 근사의 이론적 한계와 실제 초대형(수백억 규모) 라이브러리에서의 검증이 추가되면 더욱 설득력이 높아질 것이다.
기반 연구SPECTER2 유사도 0.90 기준으로 'APEX: Approximate-but-exhaustive search for ultra-large combinatorial synthesis libraries'의 AI4S 방법론을 'Accurate prediction of protein structures and interactions using a three-track neural network'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구SPECTER2 유사도 0.91로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Efficient Evolutionary Search Over Chemical Space with Large Language Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'On the Reliability of AI Methods in Drug Discovery: Evaluation of Boltz-2 for Structure and Binding Affinity Prediction'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Benchmarking Single-Pose Docking, Consensus Rescoring, and Supervised ML on the LIT-PCBA Library'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.