저자: Zhuo Chen, Xinzhe Yuan, Jianshu Zhang, Jinzong Dong, Ruichen Zhou, Yingchun Niu, Tianhang Zhou, Yu Yang Fredrik Liu, Yuqiang Li, Nanyang Ye, Qinying Gu | 날짜: 2026 | URL: https://openreview.net/forum?id=KxLNNxz9T9 📄 PDF
Essence
Figure 1. Overview of the LABO workflow. Initialization combines prior knowledge and LLM reasoning to propose high-poten
LLM 예측을 저비용 LLM-fidelity 신호로, 실제 실험을 고비용 real-fidelity 신호로 취급하여 KOH(Kennedy–O'Hagan) joint GP 서라게이트와 discrepancy-dominance gating criterion으로 결합함으로써, 저비용 LLM 평가로 탐색 공간을 넓게 탐색하고 불확실성이 높은 영역에서만 실제 실험을 수행하는 dual-fidelity Bayesian optimization(BO) 프레임워크 LABO를 제안한다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: LLM 예측을 저비용 fidelity로 정식화하여 KOH joint GP와 gating criterion을 통해 실제 실험과 결합한 이론적으로 탄탄한 프레임워크로, 과학적 BO에서 LLM 활용의 새로운 방향을 제시하는 좋은 연구이다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.92로 Reinforcement Learning Policy Optimization와 Molecular Simulation and Generative Modeling가 맞닿아, 'Derivative-Free Guidance in Continuous and Discrete Diffusion Models with Soft Value-Based Decoding'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Reinforcement Learning Policy Optimization와 Molecular Simulation and Generative Modeling가 맞닿아, 'Iterative Distillation for Reward-Guided Fine-Tuning of Diffusion Models in Biomolecular Design'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Reinforcement Learning Policy Optimization와 Agentic AI for Scientific Automation가 맞닿아, 'LLM-based Multi-Agent Copilot for Quantum Sensor'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구다중 레짐 구조 발견을 위한 확장된 방법론을 다루는 연구로 보인다.
기반 연구KOH 다중 신뢰도 GP 모델의 이론적 기반을 공유한다.
다른 접근LLM 평가를 위한 통계적으로 엄밀한 신뢰구간 구성이라는 유사한 목표를 다른 방법으로 접근
기반 연구multi-fidelity 최적화의 이론적 기초 제공
다른 접근rollout 다양성 확보를 위한 다른 exploration 전략을 제안한다.
기반 연구제한된 예산 하의 다중 hit 탐색을 확장한 실험 설계 연구이다.
다른 접근LLM 기반 베이지안 최적화를 위한 다른 서라게이트 결합 방식
다른 접근GP 기반 정책 최적화에서 다른 불확실성 정량화 전략을 사용한다.
후속 연구KOH joint GP 프레임워크를 확장 적용한 연구
다른 접근Bayesian optimization의 stopping 또는 acquisition function 설계에 대한 다른 접근법을 제시하는 유사 연구이다.
다른 접근정보 획득을 목표로 하는 분산형 다중 에이전트 학습이라는 공통 주제를 다룬다.
후속 연구change point 탐지 이론의 기초를 제공하는 온라인 학습 연구이다.
후속 연구bandit 이론의 lower bound 관련 기초 연구
후속 연구강화학습 기반 sequential decision making 프레임워크로서 POMDP 정식화의 이론적 기반을 제공할 수 있음
후속 연구실험 설계 가속화를 위한 LLM 통합 방법을 확장한다.