저자: Khachik Smbatyan, Tsolak Ghukasyan, Tigran Aghajanyan, Hovhannes Dabaghyan, Sergey Adamyan | 날짜: 2025 | DOI: N/A 📄 PDF
Figure 2. The components of the Deep Thought agentic system. The optional agents are colored gray. The arrows
본 논문은 AI 에이전트가 약물 발견 파이프라인을 설계하고 구현할 수 있는지 평가하기 위해 DO Challenge라는 벤치마크를 제안한다. 이는 백만 개의 분자 구조 중에서 유망한 후보를 식별하는 virtual screening 과제를 통해 에이전트의 전략적 의사결정, 모델 선택, 코드 개발 능력을 종합적으로 평가한다.
Figure 3. The runtime and total LLM token usage during the different runs of the Deep Thought agentic
Figure 2. The components of the Deep Thought agentic system. The optional agents are colored gray. The arrows
총평: 본 논문은 약물 발견에서 AI 에이전트의 종합적 능력을 평가하는 첫 번째 벤치마크를 제시하고 competitive deep thought agentic system을 구현하여 의미 있는 기여를 한다. 다만 시간 무제한 조건에서의 현저한 성능 격차, 높은 불안정성, 단일 문제 기반 평가의 한계가 실무 적용 가능성을 제한한다. 그럼에도 불구하고 이 연구는 agentic AI의 과학 응용 가능성을 구체적으로 보여주는 선도적 작업이다.