Learning to Discover at Test Time

저자: Mert Yuksekgonul, Daniel Koceja, Xinhao Li, Federico Bianchi, Jed McCaleb, Xiaolong Wang, Jan Kautz, Yejin Choi, James Zou, Carlos Guestrin, Yu Sun | 날짜: 2026 | URL: https://openreview.net/forum?id=96zNuQrH9Y 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. TTT-Discover continues to train an LLM on a single problem at test time. πθi denotes the policy with the updat

TTT-Discover는 test time에 단일 과학 문제에 대해 LLM 정책을 강화학습으로 계속 학습시켜, 고정된 LLM으로 프롬프트만 반복하는 기존 test-time search(AlphaEvolve 등)와 달리 정책 자체가 문제-특이적 경험으로부터 개선되도록 한다.

Motivation

Achievement

Figure 3

Figure 3. Results in GPU kernel engineering. TTT-Discover

  1. 네 개 분야에서 SOTA 달성: 수학(Erdős 최소 중첩 문제, 자기상관 부등식), GPU 커널 엔지니어링(GPUMode TriMul 대회, 최대 2배 속도 향상), 알고리즘 설계(과거 AtCoder 대회), 생물학(단일세포 RNA-시퀀싱 디노이징 문제)에서 거의 모든 문제에 대해 새로운 state-of-the-art를 달성했다.
  2. 오픈 모델만으로 결과 재현: 기존 최고 성능이 closed frontier model을 요구했던 것과 달리, 공개 모델인 OpenAI gpt-oss-120b만으로 모든 결과를 달성하고 코드도 공개했다.
  3. 저비용 test-time training: Thinking Machines의 Tinker API를 이용해 문제당 단 수백 달러 수준의 비용으로 test-time RL을 수행했다.
  4. 전문가/주최자 검증: 해결책들이 각 분야 전문가 또는 대회 주최자에 의해 검토·검증되었다.

How

Originality

Limitation & Further Study

Evaluation

Novelty: 5/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 5/5

총평: Test-time에 정책 자체를 학습시켜 단일 과학 문제의 최고 해를 찾는다는 아이디어는 기존 프롬프트 기반 진화적 탐색의 근본적 한계를 짚어내며, 네 개 이질적 도메인에서의 광범위한 SOTA 달성과 오픈 모델 기반 재현성까지 갖춘 인상적인 연구다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.91로 LLM Agent Reasoning Training와 AI-Driven Drug and Materials Discovery가 맞닿아, 'SciCode: A Research Coding Benchmark Curated by Scientists'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Agent Reasoning Training와 Agentic AI for Scientific Automation가 맞닿아, 'R&D-Agent: Automating Data-Driven AI Solution Building Through LLM-Powered Automated Research, Development, and Evolution'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Agent Reasoning Training와 Agentic AI for Scientific Automation가 맞닿아, 'DeepScientist: Advancing Frontier-Pushing Scientific Findings Progressively'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근test-time에 LLM 정책을 개선하는 다른 강화학습 기반 접근을 제안하는 것으로 보인다.
다른 접근과학 문제 해결을 위한 다른 test-time 학습 전략을 제안함
다른 접근고정된 LLM 프롬프트 반복 대신 정책 자체를 개선하는 test-time search 방법론의 대안적 접근이다.
다른 접근조합 최적화 문제에 대한 다른 방법론 비교
후속 연구고정 LLM 프롬프트 반복 방식을 정책 학습으로 확장함
후속 연구diffusion 기반 test-time scaling의 이론적 기반을 제공하는 선행 연구이다.
후속 연구고정된 LLM 대신 정책 자체를 학습시키는 방식을 확장한 관련 연구로 보인다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드