Essence
Figure 2. SENPAI deployment architecture. A thin harness de-
SENPAI는 multi-agent 연구 상태를 agent memory나 scratchpad가 아니라 pull request와 구조화된 experiment log에 기반시키는 observability-first research harness로, CFD-surrogate recipe search 작업에서 Advisor/Student 루프를 통해 가설을 PR·훈련 실행·PR 코멘트로 전환하고, 이를 통해 감사 가능하고 복구 가능하며 연구자가 조정 가능한 실험 원장(ledger)을 만든다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: 자율 ML 연구 시스템의 상태 표현 문제를 기존 MLOps 인프라(PR, git, experiment tracker)로 해결한다는 참신한 시스템적 관점과, 실제 대규모 CFD surrogate 실험을 통해 이를 실증한 점에서 실용적 기여가 크지만, 평가가 단일 도메인에 국한되고 특정 툴 스택 의존성이 있어 일반화 검증은 추가로 필요하다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 AI-Driven Drug and Materials Discovery가 맞닿아, 'SciCode: A Research Coding Benchmark Curated by Scientists'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93 기준으로 'SENPAI: Self-ExperimentatioN for Physical AI An Observability-Based Research Harness'의 AI4S 방법론을 'DeepAnalyze: Agentic Large Language Models for Autonomous Data Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구coupled 시스템의 correction 프레임워크를 확장하는 백본 아키텍처 연구
기반 연구멀티에이전트 연구 자동화 프레임워크의 실험 로그 기반 관찰가능성 개념이 본 연구의 기반이 된다.
기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Agentic Discovery of Exchange-Correlation Density Functionals'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근멀티모달 LLM 기반 코드 생성의 다른 접근 방식을 다룬다.
다른 접근수치적 추론 능력 검증을 위한 벤치마크 설계라는 확장된 접근을 제공한다.
다른 접근multi-agent 연구/에이전트 자기진화 프레임워크에서 관측성과 검증을 다루는 유사한 접근법이다.
다른 접근physical AI 및 agent 기반 실험 프레임워크를 다루는 유사 연구로 추정된다.
다른 접근자율 ML 에이전트 평가 문제에 대한 다른 접근법을 제시하는 연구이다.
다른 접근adversarial attack 자동 발견을 다른 agent 기반 방법으로 시도한다.
다른 접근조합적 구조 탐색을 위한 다른 신경망 기반 접근법을 다룬다.
후속 연구코드 우선 LLM 에이전트 설계의 방법론적 기반을 공유한다.
반론/비판추론 시간 디바이싱의 한계를 지적하는 대조적 연구