SeisAgentBench: A Failure-Aware Core Benchmark for Multi-Agent Earthquake Rupture Inversion and Forward Validation

저자: Takayuki Shinohara | 날짜: 2026 | URL: https://openreview.net/forum?id=WwoNRQChfy 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

SeisAgentBench는 지진 파열(rupture) 역산과 물리 기반 순방향(forward) 검증을 아우르는 multi-agent orchestration을 평가하기 위한 failure-aware 벤치마크로, Grond, WISP, OpenSWPC, SeisSol, SPECFEM, SW4, gmprocess, ObsPy, Pyrocko 등 이종 지진학 도구를 공통 스키마 기반의 표준화된 interaction episode로 연결한다.

Motivation

Achievement

Figure 2
  1. Failure-aware core benchmark 제안: rupture inversion과 forward validation에 초점을 맞춘 초기 릴리스로, disagreement handling, reranking, abstention, reproducible execution을 평가할 수 있는 auditable testbed를 설계함.
  2. 표준화된 interaction episode 스키마 정의: 사건 정의, 목적, waveform/station context, 전처리 레시피, 백엔드 액션, 후보 출력, 검증 결과, 실행 트레이스를 포괄하는 case file 형태의 episode 단위를 도입함.
  3. 단계적(Phased) 데이터 수집 로드맵 수립: synthetic/semi-synthetic episode(Phase 1), replayable historical-event episode(Phase 2), failure-heavy 시나리오(Phase 3)로 구성된 acquisition plan을 제시함.
  4. 거버넌스 및 메타데이터 체계 설계: 공유 오브젝트 레이어를 통한 스키마 정합성 자동 검사, 라이선싱과 tiered access(open/controlled/redacted) 및 reconstruction manifest를 통한 책임 있는 공유 체계를 마련함.

How

Figure 2

Originality

Limitation & Further Study

Evaluation

Novelty: 3/5 Technical Soundness: 2/5 Significance: 3/5 Clarity: 4/5 Overall: 2/5

총평: 지진학 도메인에 특화된 failure-aware multi-agent 벤치마크라는 아이디어는 참신하고 필요성이 명확하지만, 현재는 개념적 로드맵과 스키마 설계 수준에 머물러 있어 실제 데이터셋과 실험 결과가 뒷받침되어야 벤치마크로서의 가치를 온전히 평가할 수 있다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'From LLM Reasoning to Autonomous AI Agents: A Comprehensive Review'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구결과는 맞지만 메커니즘이 틀린 문제를 다루는 평가 관점의 토대를 제공한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'BloClaw: An Omniscient, Multi-Modal Agentic Workspace for Next-Generation Scientific Discovery'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근동일한 seismic 도메인에서 벤치마크를 제안하지만 fault detection과 multi-agent orchestration이라는 다른 초점을 가진다.
다른 접근multi-agent 시스템 실패 평가라는 공통 문제를 다룬다.
응용 사례다중 에이전트 오케스트레이션을 특정 지구과학 도메인에 적용한 사례이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드