Claudini: Autoresearch Discovers State-of-the-Art Adversarial Attack Algorithms for LLMs

저자: Alexander Panfilov, Peter Romov, Igor Shilov, Yves-Alexandre de Montjoye, Jonas Geiping, Maksym Andriushchenko | 날짜: 2026 | URL: https://openreview.net/forum?id=enVl7HguJW 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

frontier LLM agent(Claude Code, Codex)를 autoresearch 루프에 투입해 기존 30여 개 white-box adversarial attack 방법을 능가하는 새로운 jailbreaking·prompt injection 알고리즘을 자동으로 발견할 수 있음을 보인 연구이다. 특히 surrogate 모델의 random-target token-forcing task에서 개발된 공격이 adversarially robust model인 Meta-SecAlign-70B에 그대로 전이되어 100% ASR을 달성한다.

Motivation

Achievement

Figure 3
  1. GPT-OSS-Safeguard-20B jailbreak SOTA 달성: agent가 발견한 방법(v100)이 held-out CBRN 쿼리에서 80% ASR을 달성, 기존 최고 방법(I-GCG, 47.5%)을 크게 상회함.
  2. Meta-SecAlign-70B로의 zero-shot 전이 성공: 전혀 다른 surrogate 모델의 순수 random-target token-forcing task에서 개발된 claude_v82 방법이 adversarially robust model에 대한 prompt injection에서 100% ASR 달성, 기존 최고 자동화 방법(Optuna 튜닝, 82%)을 능가함.
  3. classical AutoML 대비 우위 입증: Optuna 기반 hyperparameter optimization보다 Claudini가 유의미하게 우수한 성능을 보임(Figure 4).
  4. methods lineage 분석: 발견된 방법들의 계보를 추적하여 대부분의 성능 향상이 기존 공격 요소의 재조합과 하이퍼파라미터 튜닝에서 비롯되며, 진짜 새로운 아이디어(예: patience-based perturbation, iterated local search 같은 escape mechanism)는 드물다는 것을 확인함.

How

Figure 2

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: LLM agent 기반 autoresearch가 사람 전문가 수준을 넘어서는 새로운 adversarial attack 알고리즘을 자율적으로 발견하고 이를 전혀 다른 모델·태스크로 전이시킬 수 있음을 실증적으로 보여준 흥미롭고 시의적절한 연구로, LLM 안전성 평가 방법론에 중요한 시사점을 제공한다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 Multimodal Biomedical Data Fusion와 Formal Methods & Code Generation가 맞닿아, 'Evaluating large language models trained on code'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Multimodal Biomedical Data Fusion와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Multimodal Biomedical Data Fusion와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Openai o1 system card'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구character 분포 기반 탐지 방법을 확장한 연구
기반 연구white-box adversarial attack 방법론의 기초가 된다.
후속 연구코딩 에이전트 통합 인프라의 기초를 공유한다.
기반 연구SPECTER2 유사도 0.92로 Multimodal Biomedical Data Fusion와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'SEVerA: Verified Synthesis of Self-Evolving Agents'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근adversarial attack 자동 발견을 다른 agent 기반 방법으로 시도한다.
다른 접근토큰 레벨 검증 프로토콜을 통한 공격 탐지라는 유사한 접근을 공유
다른 접근AI 생성 커널의 정확성과 속도를 평가하는 유사한 벤치마크를 다른 하드웨어(GPU)에서 제시한다.
응용 사례LLM agent를 실제 adversarial attack 자동화에 적용한 사례
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드