Mobus: Data Infrastructure for Researchers and Autonomous Scientific Agents

저자: Harry Ilanyan, Hrant Virabyan | 날짜: 2026 | URL: https://openreview.net/forum?id=4jaAiMkihZ 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Mobus는 자율 연구 에이전트가 과학 데이터를 수집·정제·분석하는 과정에서 provenance, license, schema, transformation history를 첫 번째 계층(first-class)으로 유지하는 data infrastructure로, 104개 질문 벤치마크에서 기존 agentic baseline 대비 훨씬 높은 task completion과 낮은 license false-clean rate를 달성한다.

Motivation

Achievement

Figure 2
  1. 높은 task completion: 8개 과학 분야에 걸친 104개 질문 벤치마크에서 Mobus는 95% task completion을 달성해, 가장 강력한 agentic baseline인 GPT-Researcher의 62%를 크게 상회했다.
  2. license false-clean rate 대폭 감소: retrieval 기반 baseline들의 41~58%였던 license false-clean rate(LFCR)를 Mobus는 4%까지 낮췄으며, 이는 acquisition 시점에 license 메타데이터를 직접 검증하는 아키텍처 덕분이다.
  3. 높은 citation integrity: judge 평가 기준 0.99의 citation integrity를 기록했다.
  4. manipulation toolkit 검증: schema reconciliation, unit harmonization, key-matched join 등 3개 manipulation tool에 대한 60개 unit test를 모두 통과했고, 11개의 adversarial out-of-distribution 입력에서도 조용히 강제 변환(coerce)하지 않고 실패를 명시적으로 알렸다(fail loudly).
  5. discovery-only Mobus로 substrate 기여도 분리: substrate만 있는 discovery-only 버전이 이미 모든 retrieval 기반 baseline보다 license safety에서 우수해, safety 향상의 대부분이 substrate 자체에서 나옴을 보였고, loop와 manipulation layer는 task completion과 analysis-ready assembly에 기여함을 확인했다.

How

Figure 1

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 자율 과학 연구 에이전트의 신뢰성과 감사 가능성이라는 중요하지만 간과되기 쉬운 문제를 정면으로 다루며, license·provenance·schema 무결성을 acquisition 시점에 강제하는 실용적 인프라를 제시하고 이를 뒷받침하는 자체 벤치마크로 명확한 정량적 개선을 보였다는 점에서 의미 있는 workshop 논문이다.

같이 보면 좋은 논문

기반 연구LLM 기반 발견 방법을 실제 데이터셋에 적용한 사례이다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'DSBench: How far are data science agents to becoming data science experts? arXiv preprint arXiv:2409.07703, 2024.'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'Kosmos: An AI Scientist for Autonomous Discovery'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구관계 인지형 검색 평가를 확장한 후속 연구
기반 연구연구 평가를 위한 LLM 및 검색 시스템 응용이라는 공통 주제를 다룬다
기반 연구연구 평가 시스템을 실제 응용 사례에 적용한 연구이다
기반 연구자율 연구 에이전트를 위한 데이터 인프라 설계의 기반이 되는 연구이다.
다른 접근AI 기반 과학 문헌 평가라는 유사한 벤치마크
응용 사례과학 데이터 수집·정제 파이프라인을 실제 연구 환경에 적용한다
다른 접근증명 보조기 및 검증기 기반 agent의 신뢰성 문제를 다루는 유사 접근
다른 접근다른 방식의 대규모 데이터베이스 구축 접근
다른 접근구조화된 데이터베이스에서의 자율적 탐색 능력을 평가하는 유사한 벤치마크 접근이다.
후속 연구provenance 및 schema 관리를 확장한 데이터 인프라 연구이다.
후속 연구과학 데이터 인프라 구축의 기초를 제공하는 연구이다.
후속 연구데이터 인프라를 확장하여 멀티모달 연구 지원에 적용한다.
후속 연구에이전트 메모리 관리의 이론적 토대
응용 사례과학 데이터 수집·정제 파이프라인에 실제 적용된 사례를 다룬다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드