Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning

저자: , , Alisson Azzolini, Junjie Bai, Hannah Brandon, Jiaxin Cao, Prithvijit Chattopadhyay, Huayu Chen, Jinju Chu, Yin Cui, Jenna Diamond, Yifan Ding, Liang Feng, Francesco Ferroni, Rama Govindaraju, Jinwei Gu, Siddharth Gururani, Imad El Hanafi, Zekun Hao, Jacob Huffman, Jingyi Jin, Brendan Johnson, Rizwan Khan, George Kurian, Elena Lantz, Nayeon Lee, Zhaoshuo Li, Xuan Li, Maosheng Liao, Tsung-Yi Lin, Yen-Chen Lin, Ming-Yu Liu, Xiangyu Lu, Alice Luo, Andrew Mathau, Yun Ni, Lindsey Pavao, Wei Ping, David W. Romero, Misha Smelyanskiy, Shuran Song, Lyne Tchapmi, Andrew Z. Wang, Boxin Wang, Haoxiang Wang, Fangyin Wei, Jiashu Xu, Yao Xu, Dinghao Yang, Xiaodong Yang, Zhuolin Yang, Jingxu Zhang, Xiaohui Zeng, Zhe Zhang | 날짜: 2025-03-18 | URL: https://arxiv.org/abs/2503.15558 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1: An overview of Cosmos-Reason1. Cosmos-Reason1 contains two multimodal large language models of

NVIDIA에서 제시한 Cosmos-Reason1은 비디오를 입력으로 받아 물리적 상식과 구체화된 추론(embodied reasoning)을 통해 자연언어로 신체적 의사결정을 생성하는 멀티모달 LLM입니다. 계층적 온톨로지 기반 데이터 큐레이션과 Physical AI SFT 및 RL 학습으로 물리적 AI 추론 능력을 강화합니다.

Motivation

Achievement

Figure 1

Figure 1: An overview of Cosmos-Reason1. Cosmos-Reason1 contains two multimodal large language models of

How

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: Cosmos-Reason1은 물리적 AI 추론의 근본적인 개념화에서부터 벤치마크 구축, 모델 학습까지 일관성 있게 접근한 포괄적 연구입니다. 물리 상식과 embodied reasoning을 위한 첫 체계적 온톨로지 정의와 rule-based RL 보상의 자동 생성이라는 두 가지 주요 기여가 돋보이며, 오픈소스 공개로 물리적 AI 커뮤니티에 즉각적인 영향을 미칠 가능성이 높습니다.

같이 보면 좋은 논문

기반 연구Cosmos-Reason1은 LLM 기반 신체화 추론과 물리적 상식 grounding을 확장적으로 구현하므로, Do As I Can, Not as I Say에서 제시한 affordance grounding 아이디어의 실제 대규모 구현 사례로 볼 수 있다.
기반 연구Structured World Models from Human Videos 논문은 인간 비디오 기반 world modeling을 통해 물리적 상식 및 추론의 데이터 기반을 제공하므로 Cosmos-Reason1의 데이터 및 학습 전략의 이론적 기반이 된다.
기반 연구Generative AI in Robotic Manipulation 논문은 물리적 추론을 포함한 생성형 AI 기반 로봇 조작 및 reasoning의 이론적, 실험적 기반을 제공한다.
다른 접근Cosmos-Reason1은 공간적 상식 및 심층 추론이 결합된 embodied reasoning 모델로서, LVLM의 공간 이해 측정을 위한 또다른 실험적 체계를 제시합니다.
다른 접근Embodied-Reasoner는 vision, reasoning, action의 통합적 chain-of-thought 구조를 사용하여 Cosmos-Reason1의 물리 기반 reasoning과 다른 아키텍처를 보여줍니다.
다른 접근ThinkAct는 reinforced visual chain-of-thought 방식으로 embodied reasoning을 수행하여, Cosmos-Reason1과 같이 멀티모달 물리상식 기반 추론을 실험적으로 구현한다.
다른 접근IPR-1: Interactive Physical Reasoner는 embodied physical reasoning에 초점을 두어 Cosmos-Reason1의 물리적 상식 추론과 대비해볼 수 있다.
후속 연구Cosmos-Reason1 논문은 다양한 물리적 commonsense reasoning을 통합한 foundation VLA 모델로, VIMA의 멀티모달 프롬프트 기반 정책 생성 이론을 뒷받침함.
후속 연구Cosmos-Reason1은 물리적 상식 reasoning을 통한 embodied AI 의사결정의 기초 모델로, CANVAS의 상식적 네비게이션 설계에 이론적 배경을 제공합니다.
후속 연구JanusVLN은 semantics와 spatiality를 분리하는 dual architecture 설계로, Cosmos-Reason1의 embodied reasoning framework에 공간-의미 처리 기법을 확장합니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드