저자: Jiahang Liu, Yunpeng Qi, Jiazhao Zhang, Minghan Li, Shaoan Wang, Kui Wu, Hanjing Ye, Hong Zhang, Zhibo Chen, Fangwei Zhong, Zhizheng Zhang, He Wang | 날짜: 2025-10-08 | URL: https://arxiv.org/abs/2510.07134 📄 PDF
Essence
Fig. 2: The pipeline of TrackVLA++. Given a video stream and a language instruction, TrackVLA++ predicts a tracking traj
TrackVLA++는 Vision-Language-Action 모델에 Polar-CoT 공간 추론과 Target Identification Memory(TIM)를 통합하여 장시간 추적과 폐색 상황에서의 강건한 embodied visual tracking을 실현한다.
Evaluation
Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: TrackVLA++는 효율적인 spatial reasoning과 confidence-aware memory update로 embodied visual tracking의 실제 도전(폐색, distractors)을 우아하게 해결하며, 시뮬레이션과 실환경에서 모두 강력한 성능을 입증한 매우 우수한 연구이다.
같이 보면 좋은 논문
기반 연구Inner Monologue는 언어 Chain-of-Thought 기반 embodied reasoning의 모델로, TrackVLA++의 공간적 reasoning 및 memory와 접목 가능하다.
기반 연구Perceiver-Actor는 memory 및 attention 기반 정책을 통해 장기 시계열 추론과 행동 결정을 다루며, TrackVLA++의 memory 통합 및 polar spatial reasoning과 연결된다.
기반 연구TrackVLA++는 시공간적 기억 및 추론 능력을 강화하는 VLA 모델로, entanglement와 관련된 배경장 효과의 동적 처리를 다르게 접근한다.
기반 연구Ground Slow, Move Fast: A Dual-System Foundation Model은 reasoning과 memory 시스템의 결합이 embodied agent에서 어떻게 작동하는지에 대한 이론 기반을 제공한다.
기반 연구TrackVLA++는 OneTwoVLA 및 MEM의 memory/trace 구조를 강화하여 장기 작업 reasoning 능력을 증대시키는 최신 트렌드를 따른다.
다른 접근TrackVLA++는 오픈어휘 기반 장면 표현 대신 메모리 및 장기 추론에 기반한 네비게이션 강점을 부각시켜, 다른 시맨틱 메모리 방식의 잠재적 이점을 보여줍니다.
다른 접근Hi Robot은 open-ended instruction following과 memory 기반 정책을 다루어, TrackVLA++의 reasoning과 memory-aware target 추적 방법과 다른 접근을 제공한다.
다른 접근TrackVLA++ 논문은 reasoning과 acting의 효과적 결합 및 memory bottleneck 극복을 시도하며, OneTwoVLA의 adaptive reasoning 구조와 직접 비교가 가능하다.
다른 접근OmniVLA: An Omni-Modal Vision-Language-Action Model은 다중 모달리티와 memory system 통합을 통해 장기적인 embodied 추적 및 reasoning을 구현하여, TrackVLA++의 memory 기반 지속 추적 성능과 다른 접근법을 제공한다.
후속 연구DeeR-VLA는 멀티모달 대언어모델 기반 memory & reasoning 메커니즘을 소개해 TrackVLA++의 추론 메모리 확장에 참고할 수 있다.
후속 연구TrackVLA++는 VLA 모델의 추론 및 메모리/리즌잉 구조를 분석해, What Matters 논문의 아키텍처/데이터정책 분석에 이론적 기반을 제공한다.