/Users/jehyunlee/Documents/내노트북/paper-curation/docs/papers/496_LLM_Agents_Making_Agent_Tools


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

Figure 2

Given a task description, a scientific paper, a

TOOLMAKER는 GitHub URL과 과제 설명만으로 논문에 딸린 코드 저장소를 자동으로 설치·통합·디버깅하여 LLM이 사용할 수 있는 실행 가능한 도구(tool)로 변환하는 agentic framework이다. 이를 평가하기 위해 15개의 복잡한 과학 계산 과제와 100개 이상의 unit test로 구성된 TM-BENCH 벤치마크를 새로 제안하고, 기존 최고 성능의 software engineering agent 대비 크게 앞서는 80%의 정확도를 달성했다.

Motivation

Achievement

Figure 3

TOOLMAKER workflow. Given a task description, a scientific paper, and its associated code repository,

  1. TOOLMAKER 프레임워크 제안: GitHub URL과 task 설명만으로 논문에 딸린 코드를 LLM-compatible tool로 자동 변환하는 agentic framework를 제시했다.
  2. TM-BENCH 벤치마크 구축: pathology, radiology, omics 등 의료 분야와 LLM, 3D vision 등 비의료 분야를 아우르는 15개의 복잡한 실제 연구 과제와 100개 이상의 unit test로 구성된 open-ended 벤치마크를 새로 도입했다.
  3. 높은 정확도 달성: 기존 state-of-the-art software engineering agent(OpenHands 등) 대비 크게 앞서는 80%의 task 정확도를 달성했다.
  4. 완전 개방형 평가 환경: 기존 벤치마크(SWE-bench 등)와 달리 의존성이 사전 설치되지 않은 완전 개방형 환경에서 다운로드, 의존성 해결, 코드 이해, 구현, 테스트, 디버깅 전 과정을 평가했다.

How

Figure 3

TOOLMAKER workflow. Given a task description, a scientific paper, and its associated code repository,

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 과학 논문의 공개 코드 저장소를 자동으로 LLM-compatible tool로 전환하는 실용적이고 시의적절한 접근을 제안하며, 새로운 벤치마크와 함께 명확한 성능 우위를 보여준 완성도 높은 연구이다.

같이 보면 좋은 논문

기반 연구에이전트 기반 도구 생성의 방법론적 기초 제공
다른 접근LLM용 도구 자동 생성을 위한 다른 프레임워크를 제시한다.
다른 접근자동화된 과학 연구 프레임워크에 대한 다른 접근법을 제시하는 것으로 추정된다.
다른 접근다중모달 논문 콘텐츠 처리 및 코드 자동화라는 공통 목표를 공유한다.
다른 접근다중 에이전트를 활용한 과학 연구 자동화라는 핵심 아이디어가 유사하다.
후속 연구LLM 호환 도구 자동 생성을 확장한 연구
후속 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.94로 Formal Proof Verification Automation와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 Formal Proof Verification Automation와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.94로 Formal Proof Verification Automation와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
응용 사례자동 도구 생성 프레임워크를 실제 과학 연구에 적용
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드