From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation

저자: Yifu Yuan, Haiqin Cui, Yibin Chen, Zibin Dong, Fei Ni, Longxin Kou, Jinyi Liu, Pengyi Li, Yan Zheng, Jianye Hao | 날짜: 2025-05-13 | URL: https://arxiv.org/abs/2505.08548 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1 Overview of FSD. FSD unlocks visual aids reasoning and generation through Spatial Relationship

FSD는 Vision-Language Model에 spatial relationship reasoning을 통한 중간 표현(visual aids) 생성을 추가하여, 로봇 조작에서 zero-shot 일반화 성능을 획기적으로 향상시키는 모델이다.

Motivation

Achievement

Figure 1

Figure 1 Overview of FSD. FSD unlocks visual aids reasoning and generation through Spatial Relationship

How

Figure 3

Figure 3 Inspired by the process of human reasoning, FSD uses a spatial relationship graph as an anchor to derive

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: FSD는 spatial reasoning을 통한 visual aids 생성으로 로봇 조작의 일반화 문제를 창의적으로 해결하며, 다양한 벤치마크와 실제 로봇 환경에서 검증된 우수한 성과를 보여준다. ICLR 2026 발표 논문으로서 embodied AI의 중요한 진전을 제시한다.

같이 보면 좋은 논문

기반 연구From Seeing to Doing 논문은 VLM에 spatial reasoning을 결합함으로써, affordance 개념의 실용적 확장과 고차원 reasoning을 동시에 달성하려는 시도를 보여줍니다.
기반 연구Robotic Control via Embodied Chain-of-Thought Reasoning 논문은 Chain-of-Thought를 활용한 embodied reasoning을 다루어, FSD의 reasoning 기반 중간 표현 생성의 핵심 이론적 동기를 제공합니다.
기반 연구From Seeing to Doing은 reasoning과 decision 모듈 간 상호작용을 실 로봇 문제에 적용하여, DexGraspVLA의 foundation 기반 추론의 응용을 보완합니다.
기반 연구CoT-VLA 논문은 Chain-of-Thought 기반 시각·언어 추론 구조를 제시하여, 중간 reasoning representation 설계에 이론적 기반을 제공합니다.
후속 연구From Seeing to Doing 논문은 시각적 reasoning과 행동 생성의 연계를 방법론적으로 정리하여, CoT-VLA의 chain-of-thought reasoning 메커니즘의 이론적 기반을 확실히 제공합니다.
기반 연구From Seeing to Doing 논문은 perception-action gap을 중간 visual aids로 메워주는 방식을 제안하여 Embodied-R1의 접점과 후속 연구 사례를 보여줍니다.
다른 접근From Seeing to Doing 논문은 시각 정보 기반의 chain-of-reasoning이 실제 행동과 어떻게 연결되는지 탐구하여, Video Language Planning의 text-to-video + tree search 중심 plan generation과 비견된다.
다른 접근TraceVLA는 시각적 추적(prompting) 기반의 공간-시간적 관계 reasoning을 통해 From Seeing to Doing과 유사하게 zero-shot 로봇 조작 일반화를 시도합니다.
다른 접근From Seeing to Doing(1399)는 고차원 시각-언어-행동 추론을 강화하는 VLA 구조를 설계하여, 1630에서의 메모리 활용 기반 reasoning과 비교할 수 있다.
다른 접근From Seeing to Doing은 추론–행동 연결을 강조한 VLA 모델을 제시하며, SpecPrune-VLA의 효율성 중심과 대비되는 reasoning 중심의 대안적 액션 생성 방법을 제시한다.
다른 접근IPR-1 논문은 embodied spatial reasoning을 위한 인터랙티브 피지컬 리저닝 아키텍처를 제안하여 중간적 표현 및 reasoning 측면에서 FSD와 차별화됩니다.
다른 접근From Seeing to Doing 논문은 reasoning-driven VLA 아키텍처로, NORA-1.5의 diffusion 기반 행동 예측과 다른 접근법을 탐구합니다.
후속 연구From Seeing to Doing 논문은 reasoning-injection을 포함한 VLA 시스템 설계에서, DiffusionVLA의 추론 통합 정책학습에 이론적 토대를 제공한다.
응용 사례LOVON 논문은 zero-shot open-vocabulary navigation 상황에서 spatial reasoning 및 visual affordance의 실질적 성능을 평가하므로 FSD 모델의 적용 사례로 적합합니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드