⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
Figure 3. An Overview of THUNDERAGENT. We show the transition between scheduling states and memory management. THUNDERA-
ThunderAgent는 agentic workflow를 LLM Program이라는 일급 스케줄링 단위로 추상화하여 KV cache, GPU 메모리, 툴 리소스(디스크, 네트워크 포트 등)를 프로그램 단위로 통합 관리함으로써, 기존에 LLM 추론 엔진과 툴 오케스트레이터를 느슨하게 결합한 시스템 대비 서빙과 RL rollout에서 큰 처리량 향상을 달성한다.
Motivation
Known: vLLM, SGLang과 같은 LLM 추론 엔진과 Kubernetes 같은 범용 툴 오케스트레이터를 결합해 multi-turn agentic workflow를 서빙하는 것이 현재 표준적인 방식이며, 이들 시스템은 각 request를 독립적으로 스케줄링한다.
Gap: 기존 request-aware 시스템은 workflow 전체에 대한 end-to-end 지식 없이 개별 request 단위로 자원을 할당하기 때문에 KV cache thrashing(재-prefill 비용 급증), cross-node memory imbalance, tool lifecycle obliviousness(사용하지 않는 sandbox·포트의 누적으로 인한 자원 고갈)라는 세 가지 근본적 문제를 겪는다.
Why: agentic workflow가 자율적으로 대규모로 실행됨에 따라 시스템 효율은 tail latency보다 sustained throughput에 의해 좌우되며, 이는 서빙 비용 절감과 RL rollout에서 policy lag 완화를 통한 학습 수렴 속도 및 최종 policy 품질 향상에 직접적으로 기여하므로 이 문제 해결은 실무적으로 중요하다.
Approach: agentic workflow를 LLM Program으로 추상화하여 KV cache, 시스템 상태, 외부 툴 자산을 통합된 관점으로 다루고, 이를 기반으로 program-aware scheduler와 tool resource manager를 설계해 KV cache hit rate를 극대화하고 메모리 불균형을 완화하며 비동기 환경 준비를 가능하게 한다.
Achievement
Figure 4. Serving Evaluation Results. THUNDERAGENT outperforms vLLM and Continuum across three models, four agentic work
서빙 처리량 향상: coding, routing, scientific discovery agent 전반에서 기존 SOTA 추론 시스템 대비 1.5-3.6배 처리량 향상을 달성했다.
RL rollout 가속: 분산 GPU 노드 환경에서 RL rollout 처리량을 1.8-3.9배 개선했다.
디스크 메모리 절감: 툴 리소스 lifecycle 관리를 통해 최대 4.2배의 disk memory 절감을 달성했다.
확장성 검증: 최대 64개 H100 GPU에서 다중 worker replica로 near-linear 처리량 확장을 보였고, KV-cache offloading과 결합해도 효과가 유지됨을 확인했다.
실채택: SkyRL, NVIDIA Dynamo 등 오픈소스 프레임워크에 ThunderAgent가 채택되었다.
How
Figure 3. An Overview of THUNDERAGENT. We show the transition between scheduling states and memory management. THUNDERA-
Program abstraction: agentic workflow를 identifier, execution phase(reasoning/acting), scheduling status, total tokens, tool resources 등의 메타데이터를 추적하는 first-class scheduling unit인 agentic program으로 정의하여 스케줄링을 실행 백엔드(vLLM/SGLang/TensorRT-LLM)로부터 분리
Program-aware scheduler: agentic inference 스케줄링을 재계산·캐싱 오버헤드를 최소화하고 prefilling/decoding throughput을 GPU 메모리 용량 제약 하에 극대화하는 constrained optimization 문제로 정식화
State-aware pausing: 메모리 압박 시 acting 상태(tool call 중)인 workflow를 선택적으로 pause하여 reasoning 상태 프로그램을 위한 메모리를 보존, 임의적인 KV cache eviction 방지
Dynamic migration: 모든 DP(data parallel) 노드가 global program-aware waiting queue를 공유하도록 하여 program을 노드 간 마이그레이션함으로써 메모리 불균형 완화
Program-aware tool resource management: 실행 의존성을 추적해 I/O-intensive 환경 초기화를 LLM reasoning과 오버랩시키고, program 종료 신호를 활용하는 lifecycle-aware garbage collector로 Docker sandbox·네트워크 포트 등 툴 리소스를 회수
Originality
기존 연구가 LLM 추론 엔진이나 툴 오케스트레이터 등 개별 컴포넌트 최적화에 집중한 것과 달리, agentic workflow 전체를 first-class 스케줄링 단위(LLM Program)로 추상화하여 KV cache, GPU 메모리, 툴 리소스를 통합적으로 관리하는 end-to-end 관점을 제시
reasoning/acting 상태 구분에 기반한 state-aware pausing과, 고정 노드 라우팅 대신 global waiting queue를 이용한 dynamic migration이라는 program-aware 스케줄링 메커니즘을 새롭게 도입
툴 실행 환경(sandbox, 네트워크 포트, 디스크 등)의 lifecycle을 program 종료 신호와 연계해 관리하는 garbage collector 설계로 자원 누적 고갈 문제를 해결
Limitation & Further Study
평가가 특정 모델(GLM-4.6 MoE 등)과 특정 agent(SWE-Agent, OpenHands, ToolOrchestra) 및 벤치마크(SWE-bench, HLE-Bench, ScienceAgentBench)에 국한되어 있어, 더 다양한 workflow 구조나 모델 아키텍처에 대한 일반화 가능성은 추가 검증이 필요
constrained optimization 기반 스케줄러의 이론적 최적성 보장이나 복잡도 분석이 본문 발췌에서 명확히 제시되지 않아, 대규모·이질적 workflow 혼재 상황에서의 강건성 검증이 후속 연구로 필요
state-aware pausing 시 pause된 workflow의 재개 지연이 tail latency에 미치는 영향에 대한 정량적 분석이 부족해 보이며, latency-critical 응용에서의 trade-off 분석이 추가로 요구됨
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'InternAgent: When Agent Becomes the Scientist -- Building Closed-Loop System from Hypothesis to Verification'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'R&D-Agent: Automating Data-Driven AI Solution Building Through LLM-Powered Automated Research, Development, and Evolution'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.