Scientific CI/CD for Self-Modifying Discovery Agents: Statistical Gödel Gates, Capacity Budgets, and Domain Verifiers

저자: David Scott Lewis | 날짜: 2026 | URL: https://openreview.net/forum?id=4ob0d33A2l 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Scientific CI/CD merge path. A candidate self-edit passes through a trust boundary, an anytime-valid statistic

자기수정형 과학 발견 에이전트의 편집(self-edit)이 겉보기 점수는 올리면서 실제 유효성·보정·강건성을 몰래 훼손하는 "silent regression" 문제를 정의하고, 이를 막기 위한 Scientific CI/CD 거버넌스 아키텍처(Statistical Gödel Gate, Capacity Budget Gate, Domain Verifier)를 제안한다.

Motivation

Achievement

Figure 3

Figure 3. Experiment 1. Naive optional stopping promotes many

  1. Silent regression의 정식화: 시각적 점수(V)와 보호된 실제 유효성(U) 사이의 괴리를 수식으로 정의하고, evaluator overfitting·capacity drift·domain drift 세 가지 원인으로 분해했다.
  2. 3-게이트 병합 계약(merge contract) 설계: Statistical Gödel Gate(e-process 기반 anytime-valid 검정), Capacity Budget Gate(capacity vector 가격 책정), Domain Verifier(conformal calibration·불변량·provenance 검증)를 구체적 수식과 알고리즘으로 명세했다.
  3. 6개 라이프사이클 지표 정의: accepted-edit regret, harmful-adoption rate, evaluator-corruption gap, calibration preservation, rollback utility, cost-adjusted verified discovery를 제시해 최종 벤치마크 점수가 아닌 채택 이력 전체를 평가하도록 했다.
  4. 실증 실험 결과: 200-proposal 스트림에서 naive repeated testing은 6.1%의 유해 편집을 승인했으나, spending 기반 e-Gödel gate는 이를 0.008%로 낮췄다. Capacity budgeting은 자기확장형 다항식 에이전트의 숨은 위험 과적합을 줄였고, domain verifier는 기계적·통계적 검사를 통과한 유해 생물의학 워크플로 편집을 거부했다.

How

Figure 4

Figure 4. Experiment 2. Penalizing capacity expansion reduces

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 자기진화형 과학 에이전트의 배포 안전성이라는 시의적절하고 중요한 문제를 소프트웨어 CI/CD의 은유로 명확하게 구조화한 참신한 거버넌스 프레임워크이나, 실험적 검증이 synthetic·dry-lab 수준에 머물러 실제 스케일에서의 효용성 검증이 추가로 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'How Claude Code is used in practice \ Anthropic'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Autoreproduce: Automatic AI Experiment Reproduction with Paper Lineage'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구특정 수학 분야(differential privacy)에 AI 증명 생성을 적용한 사례
다른 접근AI 에이전트의 성능 저하 문제를 다른 거버넌스 관점에서 접근
다른 접근안전성 과대평가 문제를 다루는 유사한 진단 프레임워크임
다른 접근AI 에이전트의 자기수정 및 신뢰성 검증 문제를 다루는 유사 연구
후속 연구provenance 및 검증 가능한 에이전트 실행 프레임워크의 공통 방법론적 기반을 공유한다.
다른 접근silent regression 문제를 다루는 유사하지만 다른 거버넌스 프레임워크
다른 접근인간-AI 협업 기여도 기록을 위한 다른 스키마 접근법을 제시한다.
다른 접근AI 과학자 실행에 대한 다른 감사·재현성 프레임워크를 다룬다.
후속 연구과학 발견 에이전트의 검증 파이프라인을 확장 적용
반론/비판벤치마크 안전성 점수의 신뢰성 문제를 지적하는 상반된 관점
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드