저자: | 날짜: 2026-04-23 | URL: https://arxiv.org/abs/2604.21508 📄 PDF
Figure 1. Overview of protein-ligand bioactivity extraction framework BIOMINER and benchmark BIOVISTA. (a) The whole
단백질-리간드 생물활성 데이터를 문헌에서 자동으로 추출하는 다중모달 시스템 BIOMINER를 제안한다. 생물활성 의미 해석과 리간드 구조 복원을 명시적으로 분리하여 처리하며, 16,457개 항목의 BIOVISTA 벤치마크를 구축하고 F1 0.32을 달성했다.
Figure 1. Overview of protein-ligand bioactivity extraction framework BIOMINER and benchmark BIOVISTA. (a) The whole
• BIOVISTA 벤치마크 구축: 500개 논문에서 전문가가 정제한 16,457개 생물활성 항목과 8,735개 고유 화학구조 수록. 6개 평가 작업 지원. \n• 기본 성능: 생물활성 triplet 추출에서 F1 0.32 달성. \n• 전이학습 개선: 82,262개 데이터로 구축한 사전학습 데이터베이스가 PDBbind v2016, CSAR-HiQ에서 3.9% RMSE 개선. \n• HITL 워크플로우: 26시간 내 NLRP3 생물활성 데이터 1,592개 수집(ChEMBL 대비 2배), QSAR 모델 38.6% EF1% 개선, 16개 신규 scaffold 후보 식별. \n• 구조 주석 가속화: PoseBusters 데이터셋에서 수동 작업 대비 5.59배 고속화, 정확도 96.25%(수동 90.5%).
Figure 1. Overview of protein-ligand bioactivity extraction framework BIOMINER and benchmark BIOVISTA. (a) The whole
• 문서 파싱 agent: 다중모달 소스에서 정보 추출 \n• Bioactivity agent: semantic reasoning을 통한 생물활성 값, 타입, 단위 추출 \n• Chemical structure agent: CSG-VSR 패러다임으로 MLLM이 화학 기반 시각 표현에 대해 추론한 후 domain chemistry tools로 분자 구성 \n• Integration agent: 추출된 데이터 병합 및 검증 \n• Markush 구조 열거: 자동 툴과 MLLM 추론의 반복적 개선
• 생물활성 의미 추출과 화학구조 복원을 명시적으로 분리하는 설계 \n• 복잡한 Markush 구조를 자동으로 개별 분자로 열거하는 CSG-VSR 메커니즘(기존 미해결 과제) \n• MLLM과 domain-specific 도구 결합을 통한 정확한 기호 표현 생성 \n• 다중모달 agent 기반 분해 아키텍처
• 성능 제약: F1 0.32는 아직 실제 운영 기준으로 낮아 HITL 워크플로우 필수. \n• 벤치마크 규모: 16,457개는 주요 데이터베이스(ChEMBL 수백만)에 비해 제한적이고, 500개 논문만 대상. \n• Markush 처리 한계: 복잡한 R-group 구조나 특수 화학 조건에서의 정확성 미검증. \n• 일반화 불확실성: PDBbind 기반 논문에 특화되어 다른 학문 영역 적용성 미명확. \n• 비용-효율: MLLM API 호출 비용, chemistry tools 의존성 등 실운영 복잡도. \n\n후속연구: 더 큰 벤치마크 수집, F1 개선, 다른 과학 도메인 확장, end-to-end 성능 향상.
총평: BIOMINER는 다중모달 생물활성 데이터 추출이라는 정의되지 않은 문제를 명확히 정의하고, CSG-VSR을 통해 Markush 열거 같은 기술적 과제를 창의적으로 해결했다. BIOVISTA 벤치마크는 향후 연구를 위한 소중한 자산이며, 세 가지 응용 시나리오(사전학습, HITL, 구조 주석)가 실질적 가치를 입증했다. 다만 절대 성능(F1 0.32)과 벤치마크 규모 제약이 광범위한 산업 적용에는 한계가 있으므로 지속적 개선이 필요하다.