저자: Qianqian Xie, Qingheng Xiong, He Zhu, Tiantian Xia, Xueming Han, Fanyu Meng, Jiakai Wang, Zhiqi Bai, 姜成康, Zhaohui Wang, Yubin Guo, Yuqing Wen, 茅嘉阳, Zijie Zhang, Shihao Li, Yanghai Wang, Yuxiang Ren, Junlan Feng, Jiaheng Liu | 날짜: 2026-04-16 | DOI: 10.48550/arxiv.2604.14683 📄 PDF
Figure 1: Comparison of deep research benchmarks. Given raw
DR³-Eval은 Deep Research Agent의 평가를 위한 현실적이고 재현 가능한 벤치마크로, 사용자 제공 다중 모달 파일과 정적 샌드박스 코퍼스를 결합하여 리포트 생성 작업을 평가한다.
Figure 2: Overview of the DR3-Eval framework. (1) Data construction synthesizes search paths from
Figure 2: Overview of the DR3-Eval framework. (1) Data construction synthesizes search paths from
총평: DR³-Eval은 Deep Research Agent 평가에 현실성과 재현성을 동시에 확보한 혁신적인 벤치마크이며, 역방향 구축, 다중 모달 파일 지원, 다차원 평가 프레임워크를 통해 기존 벤치마크의 한계를 효과적으로 해결했다. 광범위한 실험을 통해 현재 LLM 기반 DRA의 검색 견고성과 환각 제어라는 핵심 약점을 노출하여 향후 개선 방향을 제시한다.