Qwen2.5 technical report

저자: Qwen An Yang, Baosong Yang, Beichen Zhang, Binyuan Hui, Bo Zheng, Bowen Yu, Chengyuan Li, Dayiheng Liu, Fei Huang, Guanting Dong, Haoran Wei, Huan Lin, Jian Yang, Jianhong Tu, Jianwei Zhang, Jianxin Yang, Jiaxin Yang, Jingren Zhou, Junyang Lin, Kai Dang | 날짜: 2024 | DOI: 아직 미정 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

Figure 1

Qwen 시리즈의 반복적 개발 과정에서 데이터 스케일링의 중요성을 시각화. Qwen2.5는 18조 토큰으로 사전학습되어 수학, MBPP, BBH, MMLU 벤치마크에서 우수한 성능을 보임.

본 논문은 Qwen2.5 대규모 언어 모델(LLM) 시리즈를 소개하며, 사전학습 데이터를 7조에서 18조 토큰으로 확대하고, 감독 미세조정(SFT), 직접 선호도 최적화(DPO), 그룹 상대 정책 최적화(GRPO) 등 고도화된 후학습 기법을 적용하여 이전 버전 대비 대폭 향상된 성능을 달성했다.

Motivation

Achievement

Figure 2

Qwen2.5-Turbo의 100만 토큰 길이 Passkey Retrieval 작업 성능. 초장문 처리 능력을 입증.

  1. 데이터 스케일링의 효과: 사전학습 데이터를 18조 토큰으로 확대함으로써 수학, 코딩, 상식 및 전문 지식에서 현저한 향상 달성. 특히 MMLU, BBH, MBPP 벤치마크에서 이전 버전 대비 큰 성능 향상.
  2. 경쟁력 있는 오픈 가중치 모델: Qwen2.5-72B-Instruct가 약 5배 큰 Llama-3-405B-Instruct와 경쟁 가능한 성능 달성. 0.5B부터 72B까지 7가지 사이즈로 다양한 배포 시나리오 지원.
  3. MoE 기반 API 모델: Qwen2.5-Turbo와 Qwen2.5-Plus가 각각 GPT-4o-mini, GPT-4o와 경쟁 가능한 비용-효율성 제공.
  4. 초장문 처리 능력: Qwen2.5-Turbo가 1M(100만) 토큰 문맥 길이 지원. 생성 길이를 2K에서 8K 토큰으로 확대.
  5. 구조화된 데이터 처리 개선: 표, JSON 등 구조화된 입력/출력에 대한 더 나은 지원.

How

사전학습 데이터 개선

하이퍼파라미터 스케일링 법칙

장문맥 사전학습

Figure 3

Qwen2.5-Turbo와 Qwen2.5-7B의 TTFT(첫 토큰까지의 시간) 비교. 완전 어텐션 대비 최적화된 구현의 효율성을 보여줌.

아키텍처 특징

후학습(Post-training)

Originality

Limitation & Further Study

Evaluation

Novelty: 3/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 본 논문은 데이터 스케일링과 후학습 기법의 체계적 적용을 통해 다양한 규모의 경쟁력 있는 오픈 가중치 모델 시리즈를 구축한 실질적 기여를 제시하며, 특히 1M 토큰 초장문 처리와 0.5B~72B 모델 생태계 구성으로 LLM의 접근성과 배포 가능성을 크게 향상시켰다. 그러나 기술 보고서로서 개별 개선 사항에 대한 절제 연구가 부재하고, 데이터셋 상세정보와 알고리즘의 신규성이 제한적이며, API 기반 MoE 모델의 기술적 투명성이 낮아 재현성과 이론적 통찰 측면에서의 한계가 있다. 실무적 영향력은 높으나 학술적 창의성과 혁신성은 기대에 미치지 못하는 공학 중심의 보고서로 평가된다.

같이 보면 좋은 논문

기반 연구BERT를 특정 다운스트림 태스크에 적용하여 실제 성능을 검증한 연구
기반 연구대규모 교차언어 학습을 확장한 연구
기반 연구생성-검증 반복 학습 패러다임을 확장하여 다른 테이블 작업에 적용한다.
기반 연구MoE 아키텍처의 효율성을 확장하여 개선한 연구
다른 접근유사한 시기의 대규모 언어모델 기술보고서로 비교 가능한 접근
기반 연구사전학습 및 후학습 기법의 이론적 기반을 공유
다른 접근유사한 파라미터 규모의 오픈소스 언어모델을 다루어 Gemma 2와 경쟁적 위치에 있다.
기반 연구고품질 합성 데이터 기반 언어 모델 학습 방법론을 확장한다.
다른 접근대규모 LLM 시리즈 개발이라는 유사한 목표를 가진 경쟁 모델 연구
기반 연구LLM 기반 역번역 기법을 확장하여 다른 언어에 적용한다.
기반 연구사전학습 및 후학습 기법의 이론적 기초가 되는 연구
기반 연구가설 생성 기법을 실제 과제에 적용한 평가 사례이다.
기반 연구체계적 프레임워크를 확장한 후속 연구
다른 접근AI 기반 스토리 작성 지원에 대한 다른 접근법 제시
다른 접근일관성 정규화와 유사한 학습 전략을 다른 태스크에 적용한 대안적 접근을 제시한다.
다른 접근도구 사용 학습이라는 동일 문제를 다른 데이터 구축 방식으로 해결한다.
다른 접근포스트프로세싱 기반 편향 완화라는 동일한 문제를 다룬다.
다른 접근탐색-활용 전략을 활용한 다른 가설 생성 방법을 다룬다.
다른 접근합성 데이터의 노이즈 문제를 해결하는 유사한 접근법을 공유한다.
다른 접근대규모 LLM 훈련 파이프라인에 대한 대안적 기술보고서
다른 접근안전 탐지를 위한 다른 방법론적 접근을 제시한다.
후속 연구대규모 언어 모델의 스케일링 법칙에 대한 기초 이론을 제공한다
후속 연구언어모델의 외부 도구 활용이라는 개념적 기초를 공유한다.
후속 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 Scientific Information Extraction and QA가 맞닿아, 'Qwen2.5 technical report'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 Scientific Information Extraction and QA가 맞닿아, 'Qwen2.5 technical report'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SFT-RFT-DPO 학습 파이프라인의 방법론적 토대 제공
후속 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Scientific Information Extraction and QA가 맞닿아, 'Qwen2.5 technical report'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 Multimodal Biomedical Data Fusion와 Scientific Information Extraction and QA가 맞닿아, 'Qwen2.5 technical report'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Scientific Information Extraction and QA가 맞닿아, 'Qwen2.5 technical report'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.91로 Multimodal Biomedical Data Fusion와 Scientific Information Extraction and QA가 맞닿아, 'Qwen2.5 technical report'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 Scientific Information Extraction and QA가 맞닿아, 'Qwen2.5 technical report'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 Scientific Information Extraction and QA가 맞닿아, 'Qwen2.5 technical report'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드