⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
Figure 1. Hardware scaling under ultrafast on-chip online
B-spline locality로 인해 Kolmogorov-Arnold Networks(KANs)는 MLP 대비 sparse한 파라미터 업데이트와 fixed-point quantization에 대한 내재적 강건성을 가지며, 이를 FPGA 상에서 구현해 서브마이크로초(sub-microsecond) 지연의 model-free online learning을 최초로 실현했다.
Motivation
Known: 양자 제어(quantum control), 핵융합 제어, 플라즈마 진단 등 고빈도 비정상(non-stationary) 시스템에서는 서브마이크로초 단위의 실시간 적응이 필요하며, 기존에는 host-accelerator 학습 루프나 off-device 학습·주기적 재배포 방식이 주로 사용되어 왔다. HLS4ML, FINN 등 on-chip inference 가속 프레임워크는 잘 확립되어 있으나, 완전한 on-device training은 거의 탐구되지 않았다.
Gap: 기존 MLP 기반 backpropagation은 dense한 gradient 연산과 activation 저장을 요구하여 fixed-precision, 저지연, 메모리 제약 환경에서 비효율적이고 수치적으로 불안정하다. 또한 KAN은 GPU 중심, 배치·부동소수점 학습/추론 가정 하에서 하드웨어 비효율적이라는 평가를 받아왔으나, B-spline 활성화가 유발하는 locality와 sparsity를 활용한 fully on-chip fixed-point 학습 가능성은 전혀 분석되지 않았다.
Why: 양자 컴퓨팅 제어, 핵융합 플라즈마 제어, 고속 통신 등 마이크로초·나노초 단위로 동역학이 변하는 시스템에서 모델을 재학습 없이 실시간으로 적응시킬 수 있다면, 통신·스케줄링 지연이 없는 결정론적(deterministic) 온라인 학습이 가능해져 안전성과 성능이 크게 향상될 수 있다.
Approach: KAN의 B-spline 활성화가 갖는 local support 특성으로 인해 한 샘플당 업데이트되는 계수 수가 grid size G와 무관하게 S+1로 고정됨을 이론적으로 증명하고, 이를 FPGA 상 fixed-point online training 커널로 구현하여 MLP와 정량 비교했다.
Achievement
Figure 1. Hardware scaling under ultrafast on-chip online
Sparse update 이론 증명: Proposition 3.2를 통해 동일 파라미터 수 N 하에서 KAN의 업데이트 연산량이 Cupdate(KAN) = (S+1)/(G+S) × Cupdate(MLP)로 MLP보다 현저히 적음을 증명했다.
용량-연산량 분리(decoupling) 입증: grid size G를 늘려 근사 성능(approximation quality)을 향상시키면서도 per-sample 연산량은 거의 일정하게 유지되는 반면, MLP는 용량 증가 시 MAC과 gradient 연산이 비례적으로 증가함을 보였다.
양자화 강건성 증명: Proposition 3.3을 통해 KAN 활성화 함수의 출력이 학습된 계수들의 최솟값과 최댓값 사이로 유계(bounded)됨을 증명하여, 입력 크기에 무관하게 fixed-point quantization에 안정적임을 보였다.
FPGA 구현 및 실증: fixed-point online training을 FPGA에 구현하여 DSP/FF/LUT 자원 사용량이 KAN에서 grid size 증가에도 거의 일정(near-constant)하게 유지되고 sub-100ns forward/backward latency를 달성함을 실증했다.
최초의 sub-microsecond model-free online learning 시연: 논문 저자들 주장에 따르면 이는 서브마이크로초 지연에서의 model-free online learning을 시연한 최초 사례이다.
How
Figure 2. Overview of our streaming custom hardware kernels for fully online learning. KAN (left) and MLP (right) are sy
MLP는 Φℓ(x) = σ(Wℓx + bℓ) 형태의 dense affine-activation 레이어로, KAN은 각 edge에 학습 가능한 univariate B-spline map ϕℓ,q,p(x) = Σ wℓ,q,p,i Bi(x)를 적용하는 구조로 정의하고 이론적으로 비교.
Lemma 3.1을 통해 spline order S에서 각 입력 좌표에 대해 정확히 S+1개의 basis function만 0이 아님(local support)을 활용.
Proposition 3.2에서 동일 파라미터 예산 N 하에서 KAN과 MLP의 per-sample gradient 연산량 비율을 유도(증명은 Appendix A.1).
총평: KAN의 구조적 특성(B-spline locality, 유계 활성화)을 하드웨어 효율성과 결부시켜 이론과 FPGA 실증을 모두 제시한 참신하고 시의적절한 연구로, sub-microsecond on-chip online learning이라는 어려운 문제에 새로운 해법을 제안한다.
기반 연구SPECTER2 유사도 0.91로 Scientific Machine Learning for Dynamics와 Scientific Information Extraction and QA가 맞닿아, 'State-Free Inference of State-Space Models: The Transfer Function Approach'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 Scientific Machine Learning for Dynamics와 Scientific AI for Physics and Environment가 맞닿아, 'SLE-FNO: Single-Layer Extensions for Task-Agnostic Continual Learning in Fourier Neural Operators'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.