JAXBench: Benchmarking Autonomous TPU Kernel Optimization

저자: Arya Tschand, Charles Hong, Julian Walker, Shengnan Cai, Shangkun Wang, Suvinay Subramanian, Sundar Dev, Vijay Janapa Reddi, Amir Yazdanbakhsh, Sethuraman Sankaran | 날짜: 2026 | URL: https://openreview.net/forum?id=4vznznrGnT 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

JAXBench는 TPU에서 AI가 생성한 Pallas 커널의 정확성과 속도를 평가하기 위한 최초의 TPU-native 벤치마크로, 17개의 production LLM 연산자와 33개의 KernelBench 기반 fused 연산자로 구성되며 hand-tuned Pallas 기준선과 다양한 코드 생성/에이전트 방법을 비교한다.

Motivation

Achievement

Figure 2
  1. TPU-native 벤치마크 구축: Llama-3.1, DeepSeek-V3, Mixtral, Mamba-2, AlphaFold2 등에서 추출한 17개 production 연산자와 KernelBench L2에서 변환한 33개 fused 연산자로 구성된 50개 JAX workload 세트를 TPU v6e(Trillium)에서 compute-bound 규모로 제공한다.
  2. Reference 상한선 확립: 17개 중 8개 priority kernel에 대해 Tokamax의 hand-optimized Pallas 구현을 grid search로 튜닝하여, XLA 대비 최대 16.3배(Ragged Paged Attention) 속도 향상을 보이는 expert upper bound를 확립했다.
  3. 엄밀한 평가 하네스: jax.profiler 기반 device-side 프로파일링으로 dispatch overhead를 제거한 재현 가능한 커널 타이밍 측정 체계를 구축했다.
  4. 다양한 에이전트 방법 비교: Gemini 3 Flash 기준 best-of-N(13/50, 1.01×), iterative refinement(32/50, 1.18×), TPU documentation 주입 iterative refinement(48/50, 1.28×, per-sample correctness 5.8%→37.3%), Autocomp(45/50, 1.36× geomean, 76% XLA 초과)를 정량 비교하고, 모든 방법이 hand-tuned 성능에는 미치지 못함을 보여 TPU 커널 생성이 여전히 미해결 문제임을 입증했다.

How

Figure 2

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: TPU 커널 자동 최적화라는 중요하지만 미개척된 영역에 엄밀하고 실용적인 벤치마크를 최초로 제공한 의미 있는 연구로, hand-tuned 성능과의 격차를 명확히 드러내 향후 연구 방향을 제시한다는 점에서 커뮤니티에 큰 기여를 할 것으로 판단된다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 Formal Methods & Code Generation가 맞닿아, 'Evaluating large language models trained on code'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'StarCoder: may the source be with you! arXiv preprint arXiv:2305.06161, 2023.'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Deepseek-coder: When the large language model meets programming–the rise of code intelligence'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구hand-tuned 커널 대비 AI 생성 커널 평가의 방법론적 기초를 제공한다.
기반 연구LLM agent를 실제 adversarial attack 자동화에 적용한 사례
다른 접근AI 생성 커널의 정확성과 속도를 평가하는 유사한 벤치마크를 다른 하드웨어(GPU)에서 제시한다.
기반 연구실제 코드베이스 히스토리를 활용한 LLM 평가 응용 사례이다.
기반 연구유사한 지역 규모 기상 예측 배포 사례를 다룬다.
기반 연구슈퍼컴퓨터 환경에서의 대규모 학습을 확장한 연구
기반 연구SPECTER2 유사도 0.91로 LLM Agent Reasoning Training와 AI-Driven Drug and Materials Discovery가 맞닿아, 'MatClaw: An Autonomous Code-First LLM Agent for End-to-End Materials Exploration'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근AI 생성 커널 최적화 평가를 다른 하드웨어 대상으로 수행한다.
다른 접근대규모 단일세포 데이터 로딩을 위한 다른 샘플링 전략을 제안하는 대안적 연구이다.
후속 연구KernelBench 기반 벤치마크를 TPU 환경으로 확장한다.
후속 연구KernelBench 기반 fused 연산자 평가를 TPU 환경으로 확장한 연구이다.
응용 사례production LLM 연산자 최적화를 실제 벤치마크에 적용한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드