Essence
Given a task description, a scientific paper, a
TOOLMAKER는 GitHub URL과 과제 설명만으로 논문에 딸린 코드 저장소를 자동으로 설치·통합·디버깅하여 LLM이 사용할 수 있는 실행 가능한 도구(tool)로 변환하는 agentic framework이다. 이를 평가하기 위해 15개의 복잡한 과학 계산 과제와 100개 이상의 unit test로 구성된 TM-BENCH 벤치마크를 새로 제안하고, 기존 최고 성능의 software engineering agent 대비 크게 앞서는 80%의 정확도를 달성했다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: 과학 논문의 공개 코드 저장소를 자동으로 LLM-compatible tool로 전환하는 실용적이고 시의적절한 접근을 제안하며, 새로운 벤치마크와 함께 명확한 성능 우위를 보여준 완성도 높은 연구이다.
같이 보면 좋은 논문
기반 연구에이전트 기반 도구 생성의 방법론적 기초 제공
다른 접근LLM용 도구 자동 생성을 위한 다른 프레임워크를 제시한다.
다른 접근자동화된 과학 연구 프레임워크에 대한 다른 접근법을 제시하는 것으로 추정된다.
다른 접근다중모달 논문 콘텐츠 처리 및 코드 자동화라는 공통 목표를 공유한다.
다른 접근다중 에이전트를 활용한 과학 연구 자동화라는 핵심 아이디어가 유사하다.
후속 연구LLM 호환 도구 자동 생성을 확장한 연구
후속 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.94로 Formal Proof Verification Automation와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 Formal Proof Verification Automation와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.94로 Formal Proof Verification Automation와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LLM Agents Making Agent Tools'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
응용 사례자동 도구 생성 프레임워크를 실제 과학 연구에 적용