Code llama: Open foundation models for code

저자: Baptiste Rozière, Jonas Gehring, Fabian Gloeckle, Sten Sootla, Itai Gat, Xiaoqing Tan, Yossi Adi, Jingyu Liu, Tal Remez, J. Rapin, Artyom Kozhevnikov, I. Evtimov, Joanna Bitton, Manish P Bhatt, Cristian Canton Ferrer, Aaron Grattafiori, Wenhan Xiong, Alexandre D'efossez, Jade Copet, Faisal Azhar | 날짜: 2023 | DOI: - 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

Figure 2: Code Llama 특화 파이프라인. 다양한 미세조정(fine-tuning) 단계를 거쳐 기반 모델에서 Instruct 모델로 발전

Code Llama는 Llama 2 기반의 오픈소스 코드 생성 대규모언어모델(Large Language Model, LLM) 계열로, 코드 인필링(infilling), 장문맥 처리, 명령어 추종 능력을 갖춘 차세대 코드 생성 모델이다. 7B부터 70B 파라미터까지 4가지 크기의 모델과 3가지 변형(기본, Python 특화, Instruct)을 제공하며, 공개 모델 중 최고 수준의 성능을 달성한다.

Motivation

Achievement

  1. 벤치마크 성능: HumanEval에서 최고 67%, MBPP에서 65% 달성(공개 모델 기준 최우수). Code Llama-Python 7B가 Llama 2 70B를 HumanEval과 MBPP에서 초과. MultiPL-E(다언어) 벤치마크에서 모든 공개 모델 초과.
  2. 모델 다양성: 기본 모델(Code Llama), Python 특화 모델(Code Llama-Python), 명령어 추종 모델(Code Llama-Instruct)로 상이한 사용 사례 커버. 7B, 13B, 34B, 70B 크기로 배포 확장성 제공.
  3. 핵심 기능: 인필링 가능 모델(7B, 13B, 70B)은 문서 중간의 코드 완성 지원. 최대 100K 토큰까지 처리 가능(16K 학습 후 fine-tuning). 자동생성 지도 데이터로 안전성과 진실성 개선.

How

Figure 2: Code Llama 특화 파이프라인. 기초 모델에서 출발하여 코드 학습(500B 토큰), 인필링, Python 특화(100B), 장문맥 미세조정, 명령어 미세조정(~5B) 단계 거침

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4.5/5 Significance: 5/5 Clarity: 4/5 Overall: 4.5/5

총평: Code Llama는 체계적인 다단계 특화 전략으로 공개 코드 생성 LLM의 실용성과 성능을 동시에 달성한 견고한 연구이다. 특히 인필링과 장문맥 지원, 다양한 모델 가족으로 실제 개발 환경의 요구사항에 부응하는 점이 핵심 강점이며, 상업용 라이선스 공개를 통해 산업 활용도 높다.

같이 보면 좋은 논문

기반 연구Llama 2와 같은 기반 언어모델 아키텍처를 계승하는 관련 연구로 보인다.
다른 접근오픈소스 코드 LLM의 다른 구현 방식
기반 연구차트를 코드로 변환하는 작업에 특화된 응용 연구이다.
기반 연구전문 도메인 MLLM을 기상 예보에 적용
다른 접근Codegen과 Code Llama는 모두 코드 생성 LLM으로서 유사한 목표를 다른 아키텍처로 달성한다.
다른 접근자기지도 방식의 도구 학습이라는 공통 주제를 다룸
다른 접근대규모 API 활용을 위한 다른 지시튜닝 접근법임
다른 접근유사한 코드 LLM 아키텍처를 제시하는 경쟁 모델이다.
후속 연구Llama 기반 코드 모델을 확장한 후속 연구이다.
후속 연구SPECTER2 유사도 0.90로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Code llama: Open foundation models for code'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
반론/비판linear probe의 성능이 실제로는 표면적 패턴에 의존한다는 비판적 관점을 공유한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드