저자: Minwei Kong, Chonghe Jiang, Ao Qu, Wenbin Ouyang, Zhaoming Zeng, Xiaotong Guo, Zhekai Li, Junyi Li, Yi Fan, Xinshou Zheng, Xi Jing, Yikai Zhang, Zhiwei Liang, Seonghoo Kim, Runqing Yang, Zijian Zhou, Sirui Li, Han Zheng, Wangyang Ying, Ou Zheng, Chonghuan Wang, Jinglong Zhao, Hanzhang Qin, Cathy Wu, Paul Pu Liang, Jinhua Zhao, Hai Wang | 날짜: 2026 | URL: https://openreview.net/forum?id=f3tz3NbZAH 📄 PDF
Essence
FrontierOR는 LLM이 단순한 최적화 모델링을 넘어 실제 대규모 OR 문제에서 효율적이고 확장 가능한 알고리즘을 설계할 수 있는지를 평가하는 최초의 literature-grounded benchmark로, 180개의 실세계 과제와 hidden expert-verified evaluation suite를 통해 feasibility, solution quality, runtime 효율성을 종합적으로 측정한다.
Evaluation
Novelty: 5/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 5/5
총평: LLM의 OR 알고리즘 설계 능력을 formulation 정확도를 넘어 실제 대규모 문제에서의 효율성 관점으로 체계적으로 측정한 시의적절하고 의미 있는 benchmark로, 현재 frontier LLM들의 명확한 한계를 드러내며 향후 연구를 위한 견고한 평가 플랫폼을 제공한다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Large Language Model-Based Evolutionary Optimizer: Reasoning with elitism'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'AI Scientists Fail Without Strong Implementation Capability'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'From LLM Reasoning to Autonomous AI Agents: A Comprehensive Review'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구OR 문제 벤치마킹의 방법론적 기반을 공유함
기반 연구LLM 에이전트를 활용한 회로 설계 자동화의 실제 적용 사례이다.
기반 연구단백질 설계에 Bayesian optimization을 적용한 유사 응용 사례이다.
다른 접근LLM의 최적화 능력 평가라는 동일 목표에 다른 벤치마크 설계를 제시함
기반 연구literature-grounded benchmark 구축의 방법론적 기반을 제공한다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 Formal Methods & Code Generation가 맞닿아, 'GraphInstruct: A Progressive Benchmark for Diagnosing Capability Gaps in LLM Graph Generation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구recursive self-improvement 개념의 이론적 기반을 제공한다.
후속 연구알고리즘 설계 평가 범위를 확장한 후속 벤치마크 연구이다.
후속 연구대규모 실세계 최적화 문제 평가를 확장하는 연구