Skill-Synthesizer: Query-Aware Skill Synthesis for Scientific Reasoning

저자: Jacob McCarran, Rajsuryan Singh, Carlos Arribalzaga Jové, Khaled Ahmed, Marco Del Tredici | 날짜: 2026 | URL: https://openreview.net/forum?id=T3WDCimC5K 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. A: in the standard approach, a single skill (or a few skills)

Skill-Synthesizer는 스킬 라이브러리 전체를 검색해 주입하는 대신, 질의와 관련된 세분화된 passage 단위로 검색하고 이를 전담 synthesis agent가 코드 실행으로 검증하며 하나의 query-specific skill로 합성하는 방법을 제안한다. 두 개의 물리학 벤치마크(UGPhysics, PHYSICS)에서 기존 retrieval 기반 baseline들을 정확도와 추론 건전성 모두에서 능가한다.

Motivation

Achievement

Figure 2

Figure 2. Normalised per-question improvement compared to the

  1. 일관된 성능 우위: UGPhysics와 PHYSICS 두 물리학 벤치마크에서 모든 retrieval baseline 대비 정확도와 추론 건전성(reasoning soundness) 양쪽에서 일관되게 우수한 성능을 보였다.
  2. 대학원 수준 벤치마크에서의 강력한 개선: 다른 어떤 retrieval 방법도 memoryless baseline 대비 유의미한 개선을 이루지 못한 어려운 PHYSICS(대학원 수준) 벤치마크에서 Skill-Synthesizer만 뚜렷한 향상을 달성했다.
  3. 실용적 제약 해소: SkillRL의 추가 파인튜닝, Memento의 학습된 retriever, Meta Context Engineering의 반복적 test-time 최적화 루프 없이도, frontier reasoning model에 바로 적용 가능한 방식으로 구현되었다.

How

Figure 1

Figure 1. A: in the standard approach, a single skill (or a few skills)

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 스킬 기반 agentic memory의 근본적 한계인 '전체 스킬 검색-주입' 방식을 passage 수준 검색과 query-aware 합성으로 개선한 실용적이고 참신한 접근으로, 어려운 물리학 벤치마크에서 뚜렷한 개선을 보였다는 점에서 의미 있는 워크숍 논문이다. 다만 평가 도메인이 물리학에 국한되어 있어 일반화 가능성에 대한 추가 검증이 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 Agentic AI for Scientific Automation가 맞닿아, 'Hiagent: Hierarchical working memory management for solving long-horizon agent tasks with large language model'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근세분화된 검색 단위를 활용한 스킬 합성이라는 유사한 접근 방식을 다룬다
다른 접근쿼리 인식 기반 스킬 검색 및 합성이라는 동일한 문제를 다루는 alternative 방법론이다
다른 접근두 논문 모두 LLM 에이전트를 위한 재사용 가능한 스킬 라이브러리 구축이라는 동일한 문제를 다루지만, SkillX는 backbone agent로부터 자동 구축하는 반면 Skill-Synthesizer는 질의별 세분화된 검색과 검증 합성을 사용하는 다른 접근을 취한다.
다른 접근과학적 태스크를 위한 코드 실행 검증 기반 에이전트 프레임워크의 foundation을 공유한다
후속 연구RL 기반 reasoning 일반화의 이론적 기반을 제공
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드