저자: Ludovico Mitchener, Angela Yiu, Benjamin Chang, Mathieu Bourdenx, Tyler Nadolski, Arvis Sulovari, Eric C. Landsness, Daniel L. Barabasi, Siddharth Narayanan, Nicky Evans, Shriya Reddy, Martha Foiani, Aizad Kamal, Leah P. Shriver, Fang Cao, Asmamaw T. Wassie, Jon M. Laurent, Edwin Melville-Green, Mayk Caldas, Albert Bou, Kaleigh F. Roberts, Sladjana Zagorac, Timothy C. Orr, Miranda E. Orr, Kevin J. Zwezdaryk, Ali E. Ghareeb, Laurie McCoy, Bruna Gomes, Euan A. Ashley, Karen E. Duff, Tonio Buonassisi, Tom Rainforth, Randall J. Bateman, Michael Skarlinski, Samuel G. Rodriques, Michaela M. Hinks, Andrew D. White | 날짜: 2025 | DOI: 10.48550/ARXIV.2511.02824 📄 PDF
Essence
Figure 1: Kosmos workflow and performance. a) Overall workflow for Kosmos. (left) Kosmos is provided with an initial
Kosmos는 structured world model을 활용하여 data analysis agent와 literature search agent 간에 정보를 공유함으로써 data-driven scientific discovery를 자동화하는 AI scientist 시스템이다. 200개 이상의 agent rollout을 통해 평균 42,000줄의 코드와 1,500편의 논문을 처리하며, 79.4%의 정확도로 과학 보고서를 생성한다.
Achievement
Figure 1: Kosmos workflow and performance. a) Overall workflow for Kosmos. (left) Kosmos is provided with an initial
Kosmos 성능: 평균 42,000줄의 코드 실행(Robin 대비 9.8배 증가), 1,500편의 논문 처리, 79.4% statement 정확도(data analysis 85%, literature review 82%, interpretation 58%); 임상적 영향: 20-cycle 실행이 전문가 6개월 연구와 동등한 가치; 발견의 확장성: cycle 수에 따라 유용한 발견이 선형적으로 증가(최대 20 cycle 검증); 7가지 발견: metabolomics, materials science, neuroscience, statistical genetics 영역에서 3건은 미발표 논문과 독립적으로 재현, 4건은 신규 기여.
Limitation & Further Study
한계: Interpretation statement의 낮은 정확도(58%)는 complex reasoning에서의 한계를 시사; Agent 간 collaboration 효율성 분석 부족; World model 설계의 scalability에 대한 명확한 평가 부재; 7가지 발견만 제시되어 통계적 검증 부족; 후속 연구: Interpretation accuracy 개선을 위한 reinforcement learning 또는 fact-checking 메커니즘 필요; 더 많은 과학 분야와 데이터 유형에 대한 평가; Agent 간 task allocation 최적화 알고리즘 개발
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: Kosmos는 structured world model을 통해 다중 agent 간 정보 공유를 실현하여 기존 AI scientist 시스템의 장시간 일관성 문제를 해결한 중요한 기여를 제시한다. 7가지 실제 발견과 79.4% 정확도는 실용성을 입증하며, 특히 미발표 논문 독립 재현과 신규 기여는 시스템의 신뢰성을 강화한다. 다만 interpretation accuracy 개선과 더 광범위한 검증이 필요하다.
같이 보면 좋은 논문
기반 연구문헌 검색 에이전트의 이론적 기반을 제공함
기반 연구물리 기반 시뮬레이션과 ML 통합이라는 유사한 응용 방식을 다룸
기반 연구LLM 에이전트를 실제 과학 연구 워크플로우에 적용한 사례
기반 연구제안된 벤치마크를 실제 데이터 과학 에이전트 평가에 적용함
기반 연구Kosmos는 AI4SoS 프레임워크가 제안하는 AI 기반 과학 연구 자동화를 실제 구현한 사례임
후속 연구AI4SoS가 제안한 AI 기반 과학 자동화 프레임워크를 실제 시스템으로 구현한 확장 연구임
기반 연구실제 과학 문제 탐색에 유사한 방법론을 적용한 사례다.
기반 연구과학적 발견을 위한 AI 패러다임 전환이라는 유사한 주제를 다루며 확장된 논의를 제공한다
기반 연구[1033]에서 정리한 LLM 기술(프롬프트 엔지니어링, RAG, 파인튜닝)은
[9098]의 Kosmos AI 과학자 시스템이 자율 발견에 활용하는 핵심 기술 스택이다.
기반 연구Kosmos와 같은 AI 과학자 자동화 시스템을 의료 연구 도메인에 특화하여 평가하는 벤치마크임
기반 연구Kosmos와 같은 AI 과학자 시스템이 CrossTrace의 과학적 추론 데이터셋으로 학습되거나 평가될 수 있음
기반 연구GraphInstruct에서 평가하는 LLM 능력이 Kosmos와 같은 AI 과학자 시스템의 기반 역량과 관련됨
기반 연구관련 선행 연구로서 Kosmos 시스템 설계의 방법론적 기반을 제공함
다른 접근과학적 발견을 위한 LM 에이전트 평가의 다른 방식을 다룬다.
다른 접근과학 발견 자동화를 위한 다른 접근법을 제시한다.
다른 접근생물학적 발견 태스크를 위한 다른 평가 프레임워크를 제시한다.
다른 접근AI 에이전트의 자율적 과학 파이프라인 설계 능력을 평가하는 다른 벤치마크를 제시한다.
다른 접근LLM 환각 문제 해결을 위한 다른 접근법을 제시하는 연구이다.
다른 접근특정 도메인(지구관측)에 대한 LLM 에이전트 적용의 유사한 시도
다른 접근SciSciGPT도 계층적 다중 에이전트로 과학 연구를 지원하지만 Kosmos와 다른 구조적 세계 모델 접근을 사용함
다른 접근구조화된 세계 모델을 활용한 유사한 AI 과학자 접근법임
다른 접근test-time aggregation 효과를 다른 도메인에서 검증하는 대안적 연구
다른 접근자율 과학 발견을 위한 AI 과학자 시스템을 구축한
[9098]과
[9097]은 모두 AI가 특정 도메인 지식을 자율적으로 탐색하는 방법을 다루지만, 접근 방식에서 차이가 있다.
다른 접근자율 과학 발견을 위한 AI 시스템의 다른 아키텍처 접근을 제시함
다른 접근AI 연구 자동화 시스템이라는 유사 목표를 가지지만 Kosmos는 데이터 분석과 문헌 검색을 통합한 다른 접근법을 사용함
다른 접근[9098]의 Kosmos AI 과학자가 literature search agent를 활용한 자율 발견을 수행하는 것과 달리,
[2853]은 특정 실험 도메인에 특화된 RAG 기반 질의응답 시스템을 구축하여 과학문헌 활용의 다른 접근을 보여준다.
다른 접근유사한 목적의 과학적 발견 자동화 시스템으로 다른 아키텍처 접근을 보인다.
후속 연구LVLM 기반 에이전트 평가 방법론의 기초를 제공함
후속 연구자율 연구 시스템의 설계 및 평가 방법론에 대한 기초를 제공한다.
후속 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'Kosmos: An AI Scientist for Autonomous Discovery'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구다중 AI 에이전트 협업 시스템의 기초 아키텍처를 공유함
후속 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'Kosmos: An AI Scientist for Autonomous Discovery'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93 기준으로 'ReasFlow: Assisting Reasoning-Centric Scientific Discovery in Applied Mathematics via a Knowledge-Based Multi-Agent System'의 AI4S 방법론을 'Kosmos: An AI Scientist for Autonomous Discovery'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'Kosmos: An AI Scientist for Autonomous Discovery'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'Kosmos: An AI Scientist for Autonomous Discovery'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 Biomedical AI Knowledge Systems와 Agentic AI for Scientific Automation가 맞닿아, 'Kosmos: An AI Scientist for Autonomous Discovery'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구구조화된 world model 기반 AI 과학자 시스템을 확장하는 유사 연구이다.
후속 연구엔드투엔드 자동화 연구 시스템 설계의 방법론적 기초를 제공한다.