ISM: Self-Improving Strategy Memory for Continual Mathematical Reasoning

저자: Prakhar Dixit, Tim Oates | 날짜: 2026 | URL: https://openreview.net/forum?id=5JK3t0YI5Z 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Pipeline of the ISM system. A problem passes through the feature extractor (rule-based and LLM-based with agre

ISM은 파라미터를 고정한 LLM이 hard episodic reset 환경에서도 성공/실패 경험으로부터 자기 개선되는 compact strategy schema bank를 유지하며, symbolic verification으로 메모리 업데이트를 게이팅하여 continual mathematical reasoning 성능을 향상시키는 memory-augmented 시스템이다.

Motivation

Achievement

Figure 3

Figure 3. ISM head-to-head against each baseline on OlympiadBench. Left: wins (ISM correct, baseline wrong) versus losse

  1. 성능 우위: MATH-Hard와 OlympiadBench에서 vanilla, retrieval, reflection, static schema, passive schema memory 등 5개 baseline 대비 가장 높은 정확도를 달성했다.
  2. 저장 효율성: 가장 강력한 passive baseline 대비 각각 64%, 86% 더 적은 schema를 사용했고, retrieval 기반 시스템 대비 최대 23배 적은 저장소를 사용했다.
  3. 도메인 shift에 대한 강건성: 스트림이 진행될수록 성능 격차가 커지며, ISM은 어떤 baseline보다도 도메인 shift에 대한 회복력이 뛰어났다.
  4. 유계된 메모리 성장: retrieval 기반 저장소가 문제 수에 비례해 선형적으로 증가하는 반면, ISM의 메모리 뱅크는 엄격하게 bounded 상태를 유지했다.

How

Figure 2

Figure 2. Memory Controller and conditional schema evolution. After each episode, the outcome is passed to the Memory Co

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: ISM은 frozen LLM 기반 continual mathematical reasoning에서 성공/실패의 대칭적 학습, 검증 게이팅, lifecycle 관리를 결합한 실용적이고 효율적인 메모리 설계를 제시하며, 정확도와 저장 효율 모두에서 강력한 baseline 대비 우위를 보여준다는 점에서 의미 있는 기여로 평가된다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'From Human Memory to AI Memory: A Survey on Memory Mechanisms in the Era of LLMs'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근AI 시스템의 장단기 기억 메커니즘을 다루는 관련 연구로 본 논문의 분류체계와 상호보완적임
기반 연구symbolic verification 기반 보상 게이팅의 기초를 제공
다른 접근test-time에서 여러 reasoning trace를 활용해 성능을 개선한다는 점에서 ISM의 continual strategy memory와 유사한 목표를 공유하는 대안적 접근이다.
다른 접근LLM의 continual learning을 위한 다른 메모리 기반 접근을 제시
후속 연구self-improving 전략 메모리 개념을 확장한 연구
후속 연구LLM의 파라미터 고정 상태에서 외부 메모리를 활용해 지속적으로 개선하는 방법론을 확장한 연구로 볼 수 있다.
후속 연구symbolic verification 기반 메모리 게이팅을 확장한 연구이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드