Evolutionary Multi-Task Optimization for LLM-Guided Discovery

저자: Halil Alperen Gozeten, Xuechen Zhang, Muhammed Emrullah Ildiz, Ege Onur Taga, Tara Javidi, Samet Oymak | 날짜: 2026 | URL: https://openreview.net/forum?id=NRkkBkFyoF 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. EMO-STA shared-then-adapt framework. A unified candidate-program interface lets the same evolving program p

LLM 기반 진화적 프로그램 탐색(evolutionary search)을 여러 관련 태스크에 걸쳐 공유 구조를 활용해 효율화하는 Evolutionary Multi-Task Optimization(EMO) 프레임워크와 그 구체적 알고리즘인 EMO-STA(Shared-Then-Adapt)를 제안한다. 공유 진화 단계에서 태스크 패밀리 전반에 걸친 archive를 만들고, 이후 각 타겟 태스크에 맞게 적응(adapt)시키는 2단계 구조를 통해 동일 compute 대비 성능과 일반화를 모두 개선한다.

Motivation

Achievement

Figure 2

Figure 2. Compute-allocation results for EMO-STA on two K = 4 task families. Grouped bars compare STA Warmstart, STA Bes

  1. EMO-STA 프레임워크 제안: 공유 진화(archive 구축)와 태스크별 적응을 분리한 2단계 shared-then-adapt 구조를 처음으로 LLM 기반 프로그램 진화에 도입했다.
  2. 다양한 적응 전략 비교: Warmstart, Best-Shared, Best-Local 세 가지 초기화 전략을 제시하고, STA Best-Local이 in-distribution 적응에서 가장 강력하며 STA Best-Shared가 미지 태스크로의 전이(transfer)에 강건함을 규명했다.
  3. 8개 태스크 패밀리에서 실증적 개선: 연속 최적화, 기하학적 구성, 모델링, 알고리즘 최적화 등 다양한 영역에서 matched-compute 단일 태스크 진화 대비 대부분의 설정에서 성능 향상을 보였다.
  4. Compute 배분 분석: family-level budget 중 상당 부분(대략 균형 잡힌 비율)을 shared evolution에 할당하는 것이 일관되게 유리함을 실험적으로 규명했다.
  5. 과적합 완화 효과 입증: ARC, 시계열 특징 공학 등 학습 데이터가 적은 low-evidence 상황에서 shared evolution이 태스크에 특화된 취약한 아티팩트 대신 일반화 가능한 프로그램을 선호하도록 유도해 과적합을 완화함을 보였다.

How

Figure 3

Figure 3. Held-out task-size evaluation at fixed 60 / 15 / 120 compute allocation across three domains: circle packing,

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: LLM 기반 진화적 탐색에 멀티태스크 최적화 개념을 참신하게 접목한 실용적이고 설득력 있는 워크숍 논문으로, 특히 compute 효율성과 과적합 완화라는 두 가지 실질적 이점을 동시에 보여준 점이 인상적이나 발췌본 특성상 세부 실험 검증의 완전성은 추가 확인이 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 Formal Methods & Code Generation가 맞닿아, 'Evaluating large language models trained on code'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 AI-Driven Drug and Materials Discovery가 맞닿아, 'SciCode: A Research Coding Benchmark Curated by Scientists'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구MLLM을 활용한 코드 생성 및 시각적 이해 응용에 관련된 연구이다.
기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'ShinkaEvolve: Towards Open-Ended And Sample-Efficient Program Evolution'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구LLM 기반 진화적 프로그램 탐색의 공통 방법론적 기반이 되는 연구이다.
기반 연구비용 인지형 최적화 기법을 실제 시뮬레이터에 적용한 유사 응용 사례이다.
기반 연구여러 ML 도구를 통합한 에이전트 기반 설계 탐색이라는 방법론을 확장한다.
기반 연구알고리즘 설계 평가 범위를 확장한 후속 벤치마크 연구이다.
기반 연구진화적 프로그램 탐색의 병목 문제를 해결하기 위한 확장된 RL 기법을 다룬다.
기반 연구Hamiltonian path 탐색 기법을 확장한 관련 연구이다.
기반 연구진화적 다중태스크 최적화의 방법론적 토대를 제공한다.
다른 접근LLM 기반 진화적 탐색을 위한 다른 연산자 설계를 제안한다.
기반 연구KernelBench 기반 fused 연산자 평가를 TPU 환경으로 확장한 연구이다.
기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 Formal Methods & Code Generation가 맞닿아, 'GraphInstruct: A Progressive Benchmark for Diagnosing Capability Gaps in LLM Graph Generation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근LLM의 다른 능력을 진단하는 벤치마크를 제시하는 유사 연구
기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'An AI system to help scientists write expert-level empirical software'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근조합 최적화 문제에 대한 다른 LLM 활용 전략을 제안함
다른 접근LLM 기반 최적화의 다른 방법론을 제안함
다른 접근여러 태스크에 걸친 진화적 최적화를 다루는 유사한 접근이다.
다른 접근수치 함수 근사를 위한 다른 자동화 접근법 제시
다른 접근공유 구조를 활용한 멀티태스크 최적화라는 유사 목표를 가진 연구이다.
다른 접근멀티태스크 최적화를 위한 다른 알고리즘적 접근을 제시한다.
다른 접근LLM 에이전트 기반 자율 코드 실행 시스템의 유사한 접근을 제시한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드