Visual Instruction Tuning

저자: Haotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae Lee | 날짜: 2023.04 | DOI: N/A 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 3

Figure 3: LLaVA is capable of recognizing the visual content following the user’s intent, without

언어 전용 GPT-4를 활용해 멀티모달 instruction-following 데이터를 생성하고, 이를 이용해 CLIP 비전 인코더와 Vicuna LLM을 연결한 end-to-end 멀티모달 모델 LLaVA를 instruction tuning함으로써 범용 visual assistant를 구축한 연구이다.

Motivation

Achievement

Figure 2

Figure 2: LLaVA generates HTML/JS code for an interactive website based on user sketch inputs.

  1. 최초의 GPT-4 기반 멀티모달 instruction 데이터 생성: 언어 전용 GPT-4를 이용해 캡션과 bounding box 정보를 텍스트로 인코딩, COCO 이미지 기반의 158K 규모 멀티모달 instruction-following 데이터셋(대화·상세설명·복잡추론)을 생성했다.
  2. LLaVA 모델 개발: CLIP 비전 인코더와 Vicuna 언어 디코더를 프로젝션 레이어로 연결한 end-to-end 대형 멀티모달 모델을 제안하고 생성 데이터로 instruction tuning했다.
  3. 성능 검증: 합성 멀티모달 instruction-following 평가에서 GPT-4 대비 85.1%의 상대 점수를 달성했으며, GPT-4와 앙상블 시 ScienceQA에서 92.53%로 새로운 state-of-the-art를 기록했다.
  4. LLaVA-Bench 벤치마크 제안: 다양한 이미지·지시문·상세 주석으로 구성된 두 가지 도전적인 멀티모달 instruction-following 평가 벤치마크를 공개했다.
  5. 오픈소스 공개: 생성 데이터, 코드, 모델 체크포인트, 데모를 모두 공개하여 후속 연구를 촉진했다.

How

Originality

Limitation & Further Study

Evaluation

Novelty: 5/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 5/5

총평: 멀티모달 instruction tuning이라는 새로운 연구 방향을 개척하고 데이터·모델·벤치마크를 모두 오픈소스로 공개하여 이후 멀티모달 LLM 연구 전반에 지대한 영향을 미친 선구적이고 중요한 연구이다.

같이 보면 좋은 논문

기반 연구Visual Instruction Tuning은 장기 플래닝을 위한 비주얼-랭귀지 instruction 기반 튜닝 기법을 접목하여 VLP의 장기 계획 구현 패러다임을 확장함.
기반 연구DreamDojo는 대규모 인간 시연 데이터를 활용한 상식 기반 시각-언어-행동 데이터 생성 방법론을 통해 instruction tuning에 텍스트-비전-액션 연결의 기반을 마련한다.
다른 접근Visual Instruction Tuning은 다양한 이미지-텍스트 쌍을 통한 Instruction Tuning을 다루며, 사전학습 기반 VLN 모델 발전에 상호참조가 가능합니다.
다른 접근Open X-Embodiment는 대규모 로봇 데이터셋과 RT-X 모델을 활용하여 시각-언어-행동 모델의 훈련 및 전이 방법에서 다른 전략을 제시한다.
다른 접근Discrete Diffusion VLA는 instruction-guided action generation에 대해 전혀 다른 접근(decoder/diffusion 기반)을 제공한다.
후속 연구Learning Universal Policies via Text-Guided Video Generation 논문은 시각-언어-행동 명령어 데이터 생성 방식의 확장 사례로, Visual Instruction Tuning 이후 파생 응용을 보여준다.
후속 연구Visual Instruction Tuning 논문은 instruction-tuned VLM 성능과 디자인 결정의 영향을 실질적으로 분석, Prismatic VLMs에 사전연구 지식을 제공한다.
후속 연구InstructVLA는 비전-언어-액션 모델의 instruction tuning 분야에서 Visual Instruction Tuning 논문의 기법을 발전시킨다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드