StarCoder 2 and the Stack v2: The next generation

저자: Anton Lozhkov, Raymond Li, Loubna Ben Allal 외 다수 (Hugging Face, ServiceNow Research, Nvidia 등) | 날짜: 2024 | DOI: arXiv:2402.19173 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

Figure 2

Figure 2: The distribution of the top 20 programming languages in our crawled documentation collection.

StarCoder 2와 The Stack v2는 BigCode 프로젝트의 일환으로 개발된 차세대 코드 LLM 및 데이터셋이다. Software Heritage 아카이브를 기반으로 619개 프로그래밍 언어를 포함하는 4배 규모의 훈련 데이터를 구성하고, 3B, 7B, 15B 파라미터 모델을 3.3~4.3조 토큰으로 훈련하여 기존 모델들을 능가하는 성능을 달성했다.

Motivation

Achievement

Figure 1

Figure 1: File-level license assignment logic.

StarCoder2-3B 성과: 유사 규모 다른 Code LLM (StableCode-3B, DeepSeekCoder-1.3B)을 대부분의 벤치마크에서 능가하며 StarCoderBase-15B와 동등 이상의 성능 달성. StarCoder2-15B 성과: CodeLlama-13B를 크게 능가하고 CodeLlama-34B와 동등 이상 성능. DeepSeekCoder-33B와 비교 시 저자원 프로그래밍 언어(D, Julia, Lua, Perl)에서 동등 이상, 코드 실행 추론 및 수학 추론 벤치마크에서 우수. StarCoder2-7B 성과: CodeLlama-7B 능가하나 DeepSeekCoder-6.7B 미달. 900B+ 고유 토큰의 훈련 데이터셋으로 4배 규모 확대 성취.

How

Figure 1

Figure 1: File-level license assignment logic.

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 5/5 Significance: 5/5 Clarity: 4/5 Overall: 5/5

총평: 이 논문은 대규모 코드 LLM 개발에 있어 데이터 투명성과 책임 있는 개발의 표준을 제시한다. StarCoder2 모델들은 다양한 크기와 다양한 프로그래밍 언어 환경에서 경쟁력 있는 성능을 달성하며, Software Heritage 기반의 데이터 인프라와 SWHIDs 공개는 과학적 재현성을 크게 향상시킨다. 다만 StarCoder2-7B의 예상 외 성능 미달에 대한 분석이 부재한 점이 아쉽다.

같이 보면 좋은 논문

기반 연구대규모 오픈소스 코드 데이터셋 구축의 기초 방법론을 제공함
기반 연구GitHub 이슈 해결 능력 평가에 LLM을 적용한 유사 연구
기반 연구다중 라이브러리 코드 디버깅 평가를 확장한 벤치마크이다.
기반 연구실제 프로덕션 환경에서 AI 코드 생성 도구의 적용 사례를 다룸
다른 접근오픈소스 코드 생성 모델의 다른 접근 방식
다른 접근연구 논문 기반 코드 생성 평가라는 공통 주제를 다루는 관련 연구이다.
응용 사례StarCoder2 모델을 실제 코드 생성 작업에 응용함
후속 연구코드 생성 모델의 기초가 되는 사전학습 방법론을 제공하는 연구로 판단된다.
후속 연구이전 버전인 StarCoder를 확장한 후속 연구
후속 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'StarCoder 2 and the Stack v2: The next generation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'StarCoder 2 and the Stack v2: The next generation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드