Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models

저자: Wei Liu, Peijie Yu, Michele Orini, Yali Du, Yulan He | 날짜: 2026 | URL: https://openreview.net/forum?id=NooBkSo7oz 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Left: Compared with previous tasks, DDR maximises exploration openness and agency, focusing on the direct eval

본 논문은 사전에 정해진 질문 없이 구조화된 데이터베이스로부터 스스로 탐색 목표를 설정하고 통찰을 추출하는 능력, 즉 investigatory intelligence를 평가하는 Deep Data Research(DDR) 과제와 이를 검증 가능하게 측정하는 대규모 벤치마크 DDR-Bench를 제안한다.

Motivation

Achievement

Figure 4

Figure 4. Inference-time scaling performance in DDR-Bench across different dimensions. The y-axis reports checklist accu

  1. DDR 과제 정형화: 질문·목표·상호작용 제한 없이 구조화 데이터베이스만 주어진 상태에서 에이전트가 가설 생성, 검증, 탐색 종료 판단까지 스스로 수행하는 open-ended 과제(DDR)를 최초로 정식화했다.
  2. DDR-Bench 구축: 실제 대규모 데이터베이스를 기반으로 message-wise 및 trajectory-wise insight를 체크리스트 기반으로 검증 가능하게 평가하는 대규모 벤치마크를 제시했다.
  3. 프런티어 모델 분석: Claude Sonnet 4.5 등 최신 모델들이 초기 agency는 보이지만 long-horizon 탐색에서 여전히 한계를 보이며, 성능이 단순 스케일링이나 scaffolding보다 모델 고유의 탐색 전략(intrinsic strategy)에 크게 의존함을 실증했다.

How

Figure 2

Figure 2. A case of Claude Sonnet 4.5’s trajectory and evaluation checklist in the MIMIC scenario of DDR-Bench. Verified

Originality

Limitation & Further Study

Evaluation

Novelty: 5/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: Agentic LLM 평가에서 간과되어 온 investigatory intelligence라는 개념을 명확히 정의하고 이를 검증 가능하게 측정하는 벤치마크를 제시한 점에서 시의적절하고 독창적인 기여이며, 다만 체크리스트 방식의 근본적 한계와 도메인 일반화 검증이 향후 과제로 남는다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.95로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Blade: Benchmarking language model agents for data-driven science'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'DSBench: How far are data science agents to becoming data science experts? arXiv preprint arXiv:2409.07703, 2024.'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구LLM 기반 에이전트의 실제 데이터 작업 적용이라는 공통 주제를 공유한다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'BrowseComp: A simple yet challenging benchmark for browsing agents'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근웹 탐색 능력을 평가하는 유사한 벤치마크로서 다른 접근 방식을 제시한다.
기반 연구provenance 및 schema 관리를 확장한 데이터 인프라 연구이다.
다른 접근구조화된 데이터베이스에서의 자율적 탐색 능력을 평가하는 유사한 벤치마크 접근이다.
기반 연구복잡도 축을 세분화하여 평가 프레임워크를 확장한다.
기반 연구DeepSeek 등 AI 모델을 수학 문제 해결에 적용한 실제 사례이다.
다른 접근구조화된 데이터에서 탐색적 통찰 추출 능력을 평가하는 유사한 벤치마크 접근법을 다룬다.
다른 접근에이전트 기반 연구 평가의 대안적 방법론을 제시한다
후속 연구구조화된 결정 트리 기반 방법 선택의 방법론적 기반을 공유함
후속 연구investigatory intelligence 평가를 위한 벤치마크 설계를 확장한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드