The Llama 3 Herd of Models

저자: Grattafiori, Aaron, Dubey, Abhimanyu, Jauhri, Abhinav 외 다수 (Meta AI) | 날짜: 2024.07.23 | DOI: arXiv:2407.21783 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

Meta가 발표한 Llama 3는 8B, 70B, 405B 파라미터 규모의 대규모 언어모델 계열로, 15T 다국어 토큰으로 사전학습되었으며 128K 토큰 컨텍스트 윈도우를 지원하는 고성능 기반모델(foundation model)이다. GPT-4 수준의 성능을 달성하면서 다국어, 코딩, 추론, 도구 사용 능력을 기본적으로 지원한다.

Motivation

Achievement

  1. 최고 성능 달성:
    • 405B 모델이 MMLU(87.3), HumanEval(89.0), GSM8K(96.8), ARC Challenge(96.9)에서 GPT-4 대비 동등 이상의 성능 달성
    • 8B, 70B 소형 모델도 동급 파라미터 모델 중 최고 성능(8B: MMLU 69.4, HumanEval 72.6)
  2. 다국어 및 장문맥 지원:
    • 8개 이상 언어 지원 (MGSM 91.6)
    • 128K 토큰 컨텍스트 윈도우 (ZeroSCROLLS/QuALITY 95.2)
  3. 도구 사용 능력: BFCL에서 88.5 달성하여 제로샷 함수 호출 능력 확보
  4. 멀티모달 확장: 이미지, 비디오, 음성 인식 능력을 어댑터 기반 방식으로 통합 (아직 개발 중)
  5. 안전성 강화: Llama Guard 3를 통한 입출력 안전 필터링 및 DPO 기반의 인간 피드백 정렬

How

Figure 1: Llama 3의 전체 아키텍처 및 훈련 파이프라인

사전학습 (Pre-training)

사후학습 (Post-training)

멀티모달 확장 (미출시)

Originality

Limitation & Further Study

Evaluation

Novelty: 3.5/5 Technical Soundness: 4.5/5 Significance: 4.5/5 Clarity: 4/5 Overall: 4/5

총평: Llama 3는 데이터 품질 개선과 대규모 투자를 통해 GPT-4 수준의 성능을 달성한 중요한 오픈소스 기반모델이지만, 멀티모달 통합의 미흡함과 기술적 세부사항의 제한된 공개는 완전히 새로운 방법론보다는 기존 기법의 정교한 조합과 규모화의 측면에서 가치를 갖는다.

같이 보면 좋은 논문

기반 연구안전성과 강건성이 향상된 LLM 모델의 후속 연구를 다룬다.
다른 접근대규모 언어모델의 사전학습 및 정렬 방법론이라는 기술적 기반을 공유한다.
기반 연구대규모 사전학습 모델 구축의 기초 방법론을 제공한다.
후속 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'The Llama 3 Herd of Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근안전성 지식과 위험을 구분하는 평가 프레임워크의 유사한 접근법임
후속 연구Llama 3 모델을 기반으로 성능을 확장한 후속 연구이다.
후속 연구SPECTER2 유사도 0.92로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'The Llama 3 Herd of Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'The Llama 3 Herd of Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'The Llama 3 Herd of Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'The Llama 3 Herd of Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.90 기준으로 'Synthesis Tamper-evident Attestation and Molecular Provenance (STAMP): Cryptographic Molecular Barcoding for DNA Synthesizers'의 AI4S 방법론을 'The Llama 3 Herd of Models'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.90로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'The Llama 3 Herd of Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.90로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'The Llama 3 Herd of Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.90로 Reinforcement Learning Policy Optimization와 Formal Methods and Computational Reasoning가 맞닿아, 'The Llama 3 Herd of Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.90로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'The Llama 3 Herd of Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'The Llama 3 Herd of Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.90로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'The Llama 3 Herd of Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.89 기준으로 'Machine-Checked Finite Differential Privacy in Lean'의 AI4S 방법론을 'The Llama 3 Herd of Models'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드