저자: Qwen An Yang, Baosong Yang, Beichen Zhang, Binyuan Hui, Bo Zheng, Bowen Yu, Chengyuan Li, Dayiheng Liu, Fei Huang, Guanting Dong, Haoran Wei, Huan Lin, Jian Yang, Jianhong Tu, Jianwei Zhang, Jianxin Yang, Jiaxin Yang, Jingren Zhou, Junyang Lin, Kai Dang | 날짜: 2024 | DOI: 아직 미정 📄 PDF
Essence
Qwen 시리즈의 반복적 개발 과정에서 데이터 스케일링의 중요성을 시각화. Qwen2.5는 18조 토큰으로 사전학습되어 수학, MBPP, BBH, MMLU 벤치마크에서 우수한 성능을 보임.
본 논문은 Qwen2.5 대규모 언어 모델(LLM) 시리즈를 소개하며, 사전학습 데이터를 7조에서 18조 토큰으로 확대하고, 감독 미세조정(SFT), 직접 선호도 최적화(DPO), 그룹 상대 정책 최적화(GRPO) 등 고도화된 후학습 기법을 적용하여 이전 버전 대비 대폭 향상된 성능을 달성했다.
Evaluation
Novelty: 3/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: 본 논문은 데이터 스케일링과 후학습 기법의 체계적 적용을 통해 다양한 규모의 경쟁력 있는 오픈 가중치 모델 시리즈를 구축한 실질적 기여를 제시하며, 특히 1M 토큰 초장문 처리와 0.5B~72B 모델 생태계 구성으로 LLM의 접근성과 배포 가능성을 크게 향상시켰다. 그러나 기술 보고서로서 개별 개선 사항에 대한 절제 연구가 부재하고, 데이터셋 상세정보와 알고리즘의 신규성이 제한적이며, API 기반 MoE 모델의 기술적 투명성이 낮아 재현성과 이론적 통찰 측면에서의 한계가 있다. 실무적 영향력은 높으나 학술적 창의성과 혁신성은 기대에 미치지 못하는 공학 중심의 보고서로 평가된다.
같이 보면 좋은 논문
기반 연구BERT를 특정 다운스트림 태스크에 적용하여 실제 성능을 검증한 연구
기반 연구생성-검증 반복 학습 패러다임을 확장하여 다른 테이블 작업에 적용한다.
기반 연구MoE 아키텍처의 효율성을 확장하여 개선한 연구
다른 접근유사한 시기의 대규모 언어모델 기술보고서로 비교 가능한 접근
기반 연구사전학습 및 후학습 기법의 이론적 기반을 공유
다른 접근유사한 파라미터 규모의 오픈소스 언어모델을 다루어 Gemma 2와 경쟁적 위치에 있다.
기반 연구고품질 합성 데이터 기반 언어 모델 학습 방법론을 확장한다.
다른 접근대규모 LLM 시리즈 개발이라는 유사한 목표를 가진 경쟁 모델 연구
기반 연구LLM 기반 역번역 기법을 확장하여 다른 언어에 적용한다.
기반 연구사전학습 및 후학습 기법의 이론적 기초가 되는 연구
기반 연구가설 생성 기법을 실제 과제에 적용한 평가 사례이다.
기반 연구체계적 프레임워크를 확장한 후속 연구
다른 접근AI 기반 스토리 작성 지원에 대한 다른 접근법 제시
다른 접근일관성 정규화와 유사한 학습 전략을 다른 태스크에 적용한 대안적 접근을 제시한다.
다른 접근도구 사용 학습이라는 동일 문제를 다른 데이터 구축 방식으로 해결한다.
다른 접근포스트프로세싱 기반 편향 완화라는 동일한 문제를 다룬다.
다른 접근탐색-활용 전략을 활용한 다른 가설 생성 방법을 다룬다.
다른 접근합성 데이터의 노이즈 문제를 해결하는 유사한 접근법을 공유한다.
다른 접근대규모 LLM 훈련 파이프라인에 대한 대안적 기술보고서
다른 접근안전 탐지를 위한 다른 방법론적 접근을 제시한다.
후속 연구대규모 언어 모델의 스케일링 법칙에 대한 기초 이론을 제공한다
후속 연구언어모델의 외부 도구 활용이라는 개념적 기초를 공유한다.
후속 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 Scientific Information Extraction and QA가 맞닿아, 'Qwen2.5 technical report'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 Scientific Information Extraction and QA가 맞닿아, 'Qwen2.5 technical report'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SFT-RFT-DPO 학습 파이프라인의 방법론적 토대 제공
후속 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Scientific Information Extraction and QA가 맞닿아, 'Qwen2.5 technical report'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 Multimodal Biomedical Data Fusion와 Scientific Information Extraction and QA가 맞닿아, 'Qwen2.5 technical report'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Scientific Information Extraction and QA가 맞닿아, 'Qwen2.5 technical report'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.91로 Multimodal Biomedical Data Fusion와 Scientific Information Extraction and QA가 맞닿아, 'Qwen2.5 technical report'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 Scientific Information Extraction and QA가 맞닿아, 'Qwen2.5 technical report'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 Scientific Information Extraction and QA가 맞닿아, 'Qwen2.5 technical report'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.