저자: Zhenyang Liu, Yongchong Gu, Sixiao Zheng, Yanwei Fu, Xiangyang Xue, Yu-Gang Jiang | 날짜: 2025-07-02 | URL: https://arxiv.org/abs/2507.01424 📄 PDF
라이선스: arXiv 비독점 라이선스
Figure 1: TriVLA is a unified Vision-Language-Action framework that adopts a triple-system ar-
인지신경과학의 에피소딕 메모리 이론에서 영감을 받아, 과거 경험의 축적·회상과 미래 동역학 예측을 통합하는 에피소딕 월드 모델을 VLA 프레임워크에 처음 도입한 TriVLA를 제안한다. Vision-Language Model, Video Diffusion Model, Policy 네트워크의 삼중 시스템 아키텍처로 구현되어 긴 지평의 조작 작업에서 문맥-인식적 행동 생성을 가능하게 한다.
Figure 1: TriVLA is a unified Vision-Language-Action framework that adopts a triple-system ar-
Figure 3: The pipeline of TriVLA. TriVLA is a unified Vision-Language-Action framework built
총평: TriVLA는 인지신경과학의 에피소딕 메모리 개념을 체계적으로 로봇 제어에 도입한 혁신적인 연구로, 삼중 시스템 아키텍처를 통해 temporal reasoning과 문맥-인식적 행동 생성을 통합하여 기존 VLA 모델의 한계를 명확히 극복한다. 벤치마크 및 실세계 작업에서의 우수한 성능과 함께 개념적 명확성을 제시하는 높은 질의 논문이다.