Essence
Figure 3: LLaVA is capable of recognizing the visual content following the user’s intent, without
언어 전용 GPT-4를 활용해 멀티모달 instruction-following 데이터를 생성하고, 이를 이용해 CLIP 비전 인코더와 Vicuna LLM을 연결한 end-to-end 멀티모달 모델 LLaVA를 instruction tuning함으로써 범용 visual assistant를 구축한 연구이다.
Evaluation
Novelty: 5/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 5/5
총평: 멀티모달 instruction tuning이라는 새로운 연구 방향을 개척하고 데이터·모델·벤치마크를 모두 오픈소스로 공개하여 이후 멀티모달 LLM 연구 전반에 지대한 영향을 미친 선구적이고 중요한 연구이다.
같이 보면 좋은 논문
기반 연구Visual Instruction Tuning은 장기 플래닝을 위한 비주얼-랭귀지 instruction 기반 튜닝 기법을 접목하여 VLP의 장기 계획 구현 패러다임을 확장함.
기반 연구DreamDojo는 대규모 인간 시연 데이터를 활용한 상식 기반 시각-언어-행동 데이터 생성 방법론을 통해 instruction tuning에 텍스트-비전-액션 연결의 기반을 마련한다.
다른 접근Visual Instruction Tuning은 다양한 이미지-텍스트 쌍을 통한 Instruction Tuning을 다루며, 사전학습 기반 VLN 모델 발전에 상호참조가 가능합니다.
다른 접근Open X-Embodiment는 대규모 로봇 데이터셋과 RT-X 모델을 활용하여 시각-언어-행동 모델의 훈련 및 전이 방법에서 다른 전략을 제시한다.
다른 접근Discrete Diffusion VLA는 instruction-guided action generation에 대해 전혀 다른 접근(decoder/diffusion 기반)을 제공한다.
후속 연구Learning Universal Policies via Text-Guided Video Generation 논문은 시각-언어-행동 명령어 데이터 생성 방식의 확장 사례로, Visual Instruction Tuning 이후 파생 응용을 보여준다.
후속 연구Visual Instruction Tuning 논문은 instruction-tuned VLM 성능과 디자인 결정의 영향을 실질적으로 분석, Prismatic VLMs에 사전연구 지식을 제공한다.
후속 연구InstructVLA는 비전-언어-액션 모델의 instruction tuning 분야에서 Visual Instruction Tuning 논문의 기법을 발전시킨다.