Can Training Logs Make Model Comparisons More Precise?

저자: Wei-Jung Huang | 날짜: 2026 | URL: https://openreview.net/forum?id=u8NbwHFx0f 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

모델 간 성능 비교의 불확실성을 줄이기 위해, 각 모델(arm)의 자체 training log 통계량만을 이용해 covariate adjustment를 수행하는 arm-specific 방법을 제안하고, 3×3(architecture×dataset) 비전 실험으로 그 유용성과 covariate selection의 위험성을 검증한다.

Motivation

Achievement

Figure 3
  1. Arm-specific adjustment framework 제안: 각 모델을 자신의 training-log covariate로만 조정하고, cross-fitted coefficient 추정, coverage 진단, null calibration check를 결합한 프레임워크를 3×3 factorial 비전 실험(ResNet-18, ViT-Tiny, ConvNeXt-Tiny × CIFAR-10, CIFAR-100, Tiny-ImageNet, 총 450 runs)으로 검증했다.
  2. Model-specific covariate signal 발견: 고정된 early validation-loss adjustment와 training-log family의 PCA summary가 일부 셀에서 상당한 폭으로 single-arm variance를 줄일 수 있음을 보였으나, 유용한 통계량은 모델과 training recipe에 따라 달라진다.
  3. Covariate selection risk 규명: 큰 candidate pool에서 가장 상관된 통계량을 사후적으로 탐색(broad search)하면 사후적으로는 유용한 통계량이 존재함에도 불구하고 오히려 노이즈를 더 추가하는 경우가 많음을 실증했다.
  4. Pairwise comparison에서의 효과 확인: arm-specific adjustment가 충분한 run budget에서는 confidence interval을 좁히지만, run 수가 적을 때는 오히려 넓힌다는 것을 보였다.

How

Figure 2

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 3/5 Clarity: 4/5 Overall: 4/5

총평: 딥러닝 모델 비교의 불확실성을 줄이기 위해 training log를 활용하는 실용적이고 신중하게 설계된 arm-specific covariate adjustment 방법을 제시하며, covariate selection의 위험성까지 정직하게 분석한 점이 돋보이는 견실한 workshop 논문이다. 다만 비전 도메인에 국한된 실험 범위와 covariate selection 문제의 미해결은 후속 연구가 필요한 지점이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.90로 Computational Molecular Design와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.90로 Computational Molecular Design와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Mind the gap: Examining the self-improvement capabilities of large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.90 기준으로 'Can Training Logs Make Model Comparisons More Precise?'의 AI4S 방법론을 'After science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구모델 비교의 정밀도를 높이는 통계적 방법론이 관련 실험 설계의 기초가 된다
반론/비판모델 학습 방식(SFT vs RL)의 한계를 다루는 대조적 관점을 제공함
기반 연구SPECTER2 유사도 0.90로 Computational Molecular Design와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Reverse predictivity for bidirectional comparison of neural networks and biological brains'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근모델 성능 비교의 불확실성을 줄이는 유사한 통계적 접근법이다
후속 연구batch normalization의 통계 특성에 대한 이론적 기반을 제공하는 연구이다.
후속 연구training log 기반 covariate adjustment 방법을 확장 적용하는 연구이다
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드