Openai o1 system card

저자: OpenAI (Aaron Jaech, Adam Tauman Kalai, Adam Lerer 등) | 날짜: 2024 | DOI: - 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

Figure 1

Figure 1: GPT-4o, o1, o1-preview, o1-mini의 jailbreak 평가 성능 비교

OpenAI o1 모델은 대규모 강화학습(reinforcement learning)으로 훈련된 chain-of-thought 추론 능력을 갖춘 모델로, 기존 GPT-4o 대비 안전성과 강건성이 크게 향상되었으며 특히 jailbreak 공격에 대한 저항성이 획기적으로 개선되었다.

Motivation

Achievement

  1. Jailbreak 저항성 획기적 개선: StrongReject 벤치마크에서 GPT-4o 대비 o1이 상당히 우수한 성능 달성 (Figure 1 참조). Production jailbreaks, 인간 기반 jailbreaks 등 모든 jailbreak 평가에서 o1 모델 계열이 GPT-4o를 능가.
  2. 유해 콘텐츠 거부 강화: Challenging Refusal Evaluation에서 o1이 0.92-0.934의 not_unsafe 점수로 GPT-4o의 0.713 대비 29-31% 향상. WildChat에서도 0.98 달성으로 0.945 상회.
  3. 과도 거부(overrefusal) 개선: 멀티모달 입력에서 o1의 not_overrefuse 점수가 0.96으로 GPT-4o의 0.48에서 두 배 향상. 양성 요청에 대한 거부율 감소.
  4. 환각(hallucination) 감소: SimpleQA에서 o1의 환각율 0.44(GPT-4o 0.61), PersonQA에서 0.20(GPT-4o 0.30)으로 30-35% 감소. 정확도도 동시에 향상(SimpleQA accuracy: 0.47 vs 0.38).
  5. 편향성 개선: BBQ 평가에서 명확한 답변의 경우 o1이 93-94% 정확도로 GPT-4o의 72% 대비 22% 향상. 모호한 질문에서도 o1-preview 대비 o1이 개선된 성능 표시 (63% → 96%).

How

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 4/5

총평: 본 보고서는 대규모 언어모델의 안전성 평가에 있어 chain-of-thought 추론 능력이 defensive alignment의 새로운 차원을 제시함을 실증적으로 입증했으며, 다층적이고 체계적인 평가 프레임워크를 제시한 점에서 학계와 산업 모두에 중요한 기여를 한다. 다만 chain-of-thought 자체가 야기할 수 있는 deception 위험과 도메인 특화 평가의 부족은 향후 연구의 중요한 과제로 남아있다.

같이 보면 좋은 논문

기반 연구chain-of-thought 기반 추론 능력의 이론적 기초를 공유한다.
후속 연구LLM 에이전트 협업의 기초 개념을 공유한다
기반 연구LLM의 jailbreak 저항성 및 안전성 평가에 대한 기초 연구이다.
기반 연구LLM을 활용한 주석 프로세스 개선을 실제 데이터셋 구축에 응용한다.
기반 연구강화학습 기반 chain-of-thought 훈련의 방법론적 기초를 제공한다.
후속 연구risk control 기법이 온라인 안전성 모니터링의 방법론적 기반이 됨.
기반 연구Particle Filter 기반 온라인 모니터링을 확장하여 적용함
다른 접근딥러닝 불확실성 정량화 방법론을 유사하게 체계적으로 분류
다른 접근대규모 언어모델의 사전학습 및 정렬 방법론이라는 기술적 기반을 공유한다.
후속 연구안전성과 강건성이 향상된 LLM 모델의 후속 연구를 다룬다.
다른 접근체인-오브-씽크 추론 한계를 다루는 유사 연구
다른 접근chain-of-thought 추론 강화를 위한 다른 대규모 강화학습 접근법을 제시한다.
후속 연구LLM 정렬 및 안전성 연구의 기초가 되는 대규모 모델 연구이다.
후속 연구SPECTER2 유사도 0.90 기준으로 'Membership Circuits: Tractable Membership Testing via Probabilistic Circuits'의 AI4S 방법론을 'Openai o1 system card'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Openai o1 system card'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Openai o1 system card'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.89로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Openai o1 system card'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Openai o1 system card'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Openai o1 system card'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 Multimodal Biomedical Data Fusion와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Openai o1 system card'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Openai o1 system card'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Openai o1 system card'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Openai o1 system card'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드