VT-Bench: A Unified Benchmark for Visual-Tabular Multi-Modal Learning

저자: Ziyi Jia, Zi-Jian Cheng, Xinyue Zhang, Kun-Yang Yu, Zhi Zhou, Yu-Feng Li, Lan-Zhe Guo | 날짜: 2026 | URL: https://openreview.net/forum?id=4oZDo5v9zt 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

VT-Bench는 visual-tabular multi-modal learning을 위한 최초의 통합 벤치마크로, discriminative prediction과 generative reasoning 두 패러다임을 동시에 아우르며 9개 도메인, 14개 데이터셋, 756K개 이상의 샘플로 23개 대표 모델을 평가한다.

Motivation

Achievement

Figure 4
  1. 통합 벤치마크 구축: discriminative prediction과 generative reasoning을 모두 포괄하는 14개 데이터셋, 9개 도메인, 756K+ 샘플 규모의 VT-Bench를 구축하고, 임상 예측·테이블 구조 인지·제약적 수치 추론의 평가 공백을 메우기 위한 4개 신규 데이터셋을 추가했다.
  2. 새로운 진단 지표 제안: 표준 6개 지표 외에 Modality Contribution Ratio(MCR)와 Modality Informativeness Ratio(MIR)라는 modality별 진단 지표를 도입해 fusion 동역학과 modality 의존도를 세밀하게 분석할 수 있게 했다.
  3. 핵심 경험적 발견 도출: 기존 fusion 전략이 negative transfer를 유발하는 fusion bottleneck 문제와, VLM이 visual grounding·제약적 통계 계산·program generation에서 겪는 reasoning deficit(특히 open-source 모델의 tabular structure perception 부족)을 규명했다.

How

Figure 5

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: VT-Bench는 그동안 상대적으로 소외되었던 visual-tabular multi-modal learning 영역에서 discriminative와 generative 과제를 아우르는 최초의 통합 벤치마크를 제시하며, 새로운 진단 지표와 폭넓은 모델 평가를 통해 fusion bottleneck과 VLM의 reasoning deficit이라는 실질적 통찰을 제공하는 의미 있는 기여로 평가된다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 Multimodal Biomedical Data Fusion와 Scientific Information Extraction and QA가 맞닿아, 'BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Multimodal Biomedical Data Fusion와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Gemini: a family of highly capable multimodal models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구visual-tabular 학습의 방법론적 기반을 제공
기반 연구테이블-비전 통합 학습의 방법론적 기반을 제공한다.
다른 접근multi-modal 벤치마크 구축에서 유사한 접근법을 취함
다른 접근멀티모달 학습에서 결측 데이터에 대응하는 다른 견고성 확보 전략을 제시한다.
다른 접근visual-tabular 데이터 통합을 위한 다른 벤치마크 접근
다른 접근멀티모달 벤치마크 구축에 있어 다른 도메인 조합을 사용하는 대안적 접근이다.
응용 사례multi-modal 벤치마크를 실제 도메인 데이터에 적용
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드