Mind-Omni: A Unified Multi-Task Framework for Brain-Vision-Language Modeling via Discrete Diffusion

저자: Yizhuo Lu, Changde Du, Qingyu Shi, Hang Chen, Jie Peng, Liuyun Jiang, Shuangchen Zhao, Huiguang He | 날짜: 2026 | URL: https://openreview.net/forum?id=3gCdh3u2GK 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 2

Mind-Omni은 fMRI 신호와 image, text를 discrete diffusion 패러다임으로 통합해 7가지 encoding/decoding task를 단일 모델로 수행하는 최초의 통합 BCI 프레임워크이며, 새로운 Brain Tokenizer를 통해 이질적인 연속 뇌 신호를 discrete token으로 변환함으로써 modality 간 token-level 상호작용을 가능하게 한다.

Motivation

Achievement

Figure 4
  1. 통합 멀티태스크 프레임워크 제안: brain, image, text 간 7가지 encoding/decoding task(I→B, T→B, I&T→B, B→I, B→T, B→I&T, BQA)를 단일 discrete diffusion 아키텍처로 통합한 최초의 프레임워크를 제시했다.
  2. Brain Tokenizer 개발: 이질적이고 연속적인 fMRI 신호를 image·text와 공유된 semantic space 내 discrete token으로 변환하는 novel Brain Tokenizer를 도입하여 modality 간 직접적인 token-level 상호작용을 가능하게 했다.
  3. BQA instruction-tuning 데이터셋 구축: Qwen2-VL(7B)와 LLaVA-Instruct-150K를 활용해 Brain Question Answering 전용 instruction-tuning 데이터셋을 curate하여 고급 추론 능력을 이끌어냈다.
  4. Multi-task synergy 실증: encoding task 내 vision-language 간 상호보완 효과 및 B→T와 B→I 같은 decoding task 간 동시 학습·추론이 서로의 성능을 향상시키는 시너지 효과를 실증적으로 규명했다.
  5. SOTA 성능 달성: 통합 프레임워크 중 새로운 state-of-the-art를 확립했을 뿐 아니라, 더 큰 규모의 특화 모델들과 경쟁력 있거나 이를 능가하는 성능을 보였다.

How

Figure 2

Originality

Limitation & Further Study

Evaluation

Novelty: 5/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 단일 task 특화 모델이 지배적이던 BCI 분야에서 brain-vision-language를 아우르는 최초의 통합 discrete diffusion 프레임워크를 제시하고 multi-task synergy를 실증했다는 점에서 참신성과 의의가 크며, foundation model 방향으로의 중요한 전환점을 제시하는 연구이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 Multimodal Biomedical Data Fusion와 Scientific Information Extraction and QA가 맞닿아, 'BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Multimodal Biomedical Data Fusion와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Gemini: a family of highly capable multimodal models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Multimodal Biomedical Data Fusion와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'GPT-4 Technical Report'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구graph transformer 구조를 활용한 표현학습을 확장하여 적용한다.
기반 연구discrete diffusion 기반 멀티모달 통합의 이론적 기반을 공유한다.
다른 접근RLVR에서 advantage 재가중 방식에 대한 다른 접근법을 제안한다.
다른 접근생물학적 신호 처리를 위한 신경망 아키텍처 탐색이라는 유사한 목표를 가진다.
다른 접근fMRI 신경 데이터 기반 디코딩이라는 공통 목표를 가진다.
후속 연구통합 BCI 멀티태스크 프레임워크를 확장하는 연구이다.
다른 접근brain decoding을 위한 다른 통합 모델링 접근
다른 접근fMRI 기반 통합 멀티태스크 프레임워크를 다른 방식으로 구현한다.
후속 연구MEG 신호 기반 언어 디코딩의 기초 방법론을 제공함
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드