SEVerA: Verified Self-Evolving Agents with Specification Guidance

저자: Debangshu Banerjee, Changming Xu, Eugene Ie, Ming Zhang, Daiyi Peng, Chu-Cheng Lin, Gagandeep Singh | 날짜: 2026 | URL: https://openreview.net/forum?id=HgeGw5hu9Z 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

SEVerA는 자기진화형 LLM 에이전트 합성을 하드 formal specification과 soft task utility를 결합한 제약 학습 문제로 정식화하고, Search→Verify→Learn 3단계 프레임워크와 Formally Guarded Generative Models(FGGM)를 통해 모든 입력과 파라미터에 대해 first-order output contract를 만족하는 것을 형식적으로 보장하면서 성능도 향상시킨다.

Motivation

Achievement

Figure 2
  1. FGGM 도입: 각 모델 호출을 first-order logic으로 표현된 input-output contract로 감싸는 Formally Guarded Generative Models을 제안하여, open/closed-source 모델 모두에 적용 가능하고 출력 문자열만으로 동작하는 local contract enforcement 메커니즘을 구현했다.
  2. SEVerA 알고리즘: Search→Verify→Learn 3단계로 구성된 최초의 검증 가능한 self-evolving agent synthesis 알고리즘을 제시하고, 검증된 파라메트릭 프로그램에 대해 constrained learning을 unconstrained optimization으로 환원하여 scalable gradient 기반 학습을 가능케 했다.
  3. 이론적 보증: 반환된 에이전트가 모든 입력과 모든 파라미터 값에 대해 behavioral specification을 만족함을 증명하는 soundness 정리(Theorem 3.2)와, unconstrained 모델보다 task loss가 나빠지지 않는(오히려 위반 시 strict 개선되는) 검증된 에이전트 존재의 충분조건(Theorem 3.3)을 확립했다.
  4. 실증적 성능: τ2-bench airline domain에서 Qwen3-8B 기반 SEVerA가 52.6% pass rate로 Claude Sonnet 4.5 기반 Agent-C(47.3%)를 능가했고, HumanEvalDafny에서 97.0%(vs 86.9%), GSM-Symbolic에서 66.0%(vs 44.7%) 성능을 달성하며 zero constraint violation을 유지했다.

How

Figure 2

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: self-evolving LLM agent 합성에 formal verification을 통합해 안전성과 성능을 동시에 보장하는 새로운 접근으로, 이론적 보증과 실증적 성능 향상을 함께 제시한 의미 있는 연구이나 verifier-aware language에 대한 의존성과 확장성 검증이 추가로 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'How Claude Code is used in practice \ Anthropic'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'Agentomics-ML: Autonomous Machine Learning Experimentation Agent for Genomic and Transcriptomic Data'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구제약된 분포 근사 문제에 유사한 알고리즘을 적용한다.
기반 연구agent 명세 및 검증에 대한 공통 방법론적 기반을 제공한다.
기반 연구자기진화형 에이전트 연구 하네스의 관찰가능성 개념이 SEVerA의 검증 프레임워크 설계에 기초가 된다.
후속 연구형식적 검증 프레임워크의 이론적 기초를 제공한다.
다른 접근train-free 방식의 LLM 활용 정책 탐색을 다루는 대안적 연구이다.
다른 접근self-evolving/self-experimenting agent 연구 프레임워크로서 유사한 관측성-검증 접근을 공유한다.
다른 접근formal specification 기반 검증과 sheaf 기반 구조 검증이 유사한 목표를 공유한다.
다른 접근탐색적 생성 정책을 통한 design space 확장이라는 공통 목표를 가진다.
다른 접근자기진화 에이전트 합성 문제를 formal specification 결합이라는 다른 방식으로 접근한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드