P1-VL: Bridging Visual Perception and Scientific Reasoning in Physics Olympiads

저자: Yun Luo, Futing Wang, Qianjia Cheng, Fangchen Yu, Haodi Lei, Jianhao Yan, Chenxi Li, Jiacheng Chen, Yufeng Zhao, Haiyuan Wan, Yuchen Zhang, Shenghe Zheng, Junchi Yao, Qingyang Zhang, Haonan He, Wenxuan Zeng, Li Sheng, Chengxing Xie, Yuxin Zuo, Yizhuo Li, Yulun Wu, Rui Huang, Dongzhan Zhou, Kai Chen, Yu Qiao, LEI BAI, Yu Cheng, Ning Ding, Bowen Zhou, Peng Ye, Ganqu Cui | 날짜: 2026 | URL: https://openreview.net/forum?id=GSl7lw8HhD 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 2

P1-VL은 물리 올림피아드 문제 해결을 위해 Curriculum Reinforcement Learning과 Agentic Augmentation을 결합한 open-source vision-language model 계열로, HiPhO 벤치마크에서 오픈소스 최초로 12개 금메달을 획득하고 전 세계 2위 성적을 달성했다.

Motivation

Achievement

Figure 2
  1. 오픈소스 최초 12개 금메달 달성: 플래그십 모델 P1-VL-235B-A22B가 HiPhO의 13개 물리 올림피아드 시험에서 12개 금메달과 1개 은메달을 획득하여 오픈소스 VLM 최초 기록을 세웠다.
  2. 전 세계 2위 성적: PhysicsMinions agent로 증강된 P1-VL 시스템이 Gemini-3-Pro에만 뒤지는 글로벌 종합 2위를 달성했다.
  3. 텍스트 기반 agent 베이스라인 능가: 단독 P1-VL 모델이 agent로 증강된 텍스트 전용 베이스라인(P1-235B-A22B+PhysicsMinions)을 능가하며 전체 3위를 기록했다.
  4. 경량 모델의 성능: P1-VL-30B-A3B가 9개 금메달을 획득해 대부분의 오픈소스 모델 평균을 상회했다.
  5. 타 도메인으로의 일반화: FrontierScience-Olympiad의 생물, 화학, 물리 영역과 수학·멀티모달 STEM 추론 과제에서도 베이스라인 대비 각각 8.0점, 9.1점의 유의미한 성능 향상을 보였다.

How

Figure 4

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 4/5

총평: 물리 올림피아드라는 고난도 멀티모달 과학 추론 과제에서 open-source VLM으로 최초로 금메달 수준의 성과를 달성한 의미 있는 연구로, curriculum RL과 agentic augmentation의 결합이 실질적 성능 향상을 보여주지만 상세 기술적 검증은 본문 전체를 통해 추가로 확인할 필요가 있다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 AI-Driven Drug and Materials Discovery가 맞닿아, 'SciCode: A Research Coding Benchmark Curated by Scientists'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구curriculum RL과 agentic augmentation 기법의 기반이 되는 연구로 판단됨
다른 접근물리 시뮬레이션 데이터를 활용한 RL 기반 LLM 학습이라는 유사한 접근.
기반 연구텍스트 지식 주입을 통한 시각적 추론 향상 방법을 확장한 연구이다.
기반 연구학습 가능한 추론 능력의 도메인 전이성을 확장하여 검증한다.
기반 연구다수결 투표 기반 후보 제안 방식을 확장하여 적용한 후속 연구이다.
다른 접근유사한 오픈소스 과학 추론 VLM을 다른 학습 전략으로 구축함
다른 접근강화학습 기반 LLM 학습 방법의 대안적 접근을 제시함
후속 연구과학적 추론을 위한 vision-language 모델을 확장한 후속 연구로 보임
다른 접근고품질 reasoning 데이터 구축을 위한 필터링 기법이라는 확장된 접근을 제시한다.
다른 접근visual-tabular 데이터 통합을 위한 다른 벤치마크 접근
다른 접근물리 문제 해결을 위한 다른 VLM 접근법 제시
응용 사례과학 문제 해결에 특화된 추론 모델 응용 사례로 관련됨
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드