ThunderAgent: A Fast, Simple, and Program-Aware Agentic Inference System

저자: Hao Kang, Ziyang li, Weili Xu, Xinyu Yang, Yinfang Chen, Junxiong Wang, Beidi Chen, Tushar Krishna, Chenfeng Xu, Simran Arora | 날짜: 2026 | URL: https://openreview.net/forum?id=kR4iOTaAOJ 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 3

Figure 3. An Overview of THUNDERAGENT. We show the transition between scheduling states and memory management. THUNDERA-

ThunderAgent는 agentic workflow를 LLM Program이라는 일급 스케줄링 단위로 추상화하여 KV cache, GPU 메모리, 툴 리소스(디스크, 네트워크 포트 등)를 프로그램 단위로 통합 관리함으로써, 기존에 LLM 추론 엔진과 툴 오케스트레이터를 느슨하게 결합한 시스템 대비 서빙과 RL rollout에서 큰 처리량 향상을 달성한다.

Motivation

Achievement

Figure 4

Figure 4. Serving Evaluation Results. THUNDERAGENT outperforms vLLM and Continuum across three models, four agentic work

  1. 서빙 처리량 향상: coding, routing, scientific discovery agent 전반에서 기존 SOTA 추론 시스템 대비 1.5-3.6배 처리량 향상을 달성했다.
  2. RL rollout 가속: 분산 GPU 노드 환경에서 RL rollout 처리량을 1.8-3.9배 개선했다.
  3. 디스크 메모리 절감: 툴 리소스 lifecycle 관리를 통해 최대 4.2배의 disk memory 절감을 달성했다.
  4. 확장성 검증: 최대 64개 H100 GPU에서 다중 worker replica로 near-linear 처리량 확장을 보였고, KV-cache offloading과 결합해도 효과가 유지됨을 확인했다.
  5. 실채택: SkyRL, NVIDIA Dynamo 등 오픈소스 프레임워크에 ThunderAgent가 채택되었다.

How

Figure 3

Figure 3. An Overview of THUNDERAGENT. We show the transition between scheduling states and memory management. THUNDERA-

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: agentic workflow를 위한 program-aware 추론 시스템 설계라는 실용적이고 시의적절한 문제를 명확한 추상화와 구체적 메커니즘으로 풀어내며 상당한 성능 향상을 실증했다는 점에서 시스템 연구로서 완성도가 높다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'InternAgent: When Agent Becomes the Scientist -- Building Closed-Loop System from Hypothesis to Verification'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'R&D-Agent: Automating Data-Driven AI Solution Building Through LLM-Powered Automated Research, Development, and Evolution'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구에이전틱 워크플로우 스케줄링의 기본 개념을 제공하는 선행 연구
다른 접근도구 오케스트레이션과 LLM 추론 통합을 위한 대안적 시스템 구조 제시
다른 접근LLM 에이전트 추론 스케줄링에 대한 다른 시스템 설계 접근
후속 연구KV cache 및 GPU 자원 관리를 확장한 에이전틱 인퍼런스 엔진 연구
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드