OpenSeesAgentBench: A Benchmark and Evaluation Framework for Agentic Structural Analysis in OpenSeesPy

저자: Takayuki Shinohara | 날짜: 2026 | URL: https://openreview.net/forum?id=J263rcTa09 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1.

LLM 에이전트를 이용한 구조해석(structural analysis) 평가를 위해 OpenSeesPy 중심의 벤치마크 OpenSeesAgentBench를 제안하며, domain knowledge, code generation, end-to-end workflow 실행 역량을 분리 평가하는 contract-first 프레임워크와 reference 실행 스택을 함께 공개한다.

Motivation

Achievement

Figure 4

Figure 4. Qualitative execution examples from OpenSeesBuildingBench calibration profile, shown for cases 01, 04, 08, and

  1. 3계층 벤치마크 공개: 도메인 지식(OpenSeesQuery), 코드 생성(OpenSeesCodeBench), 종단간 워크플로우 실행(OpenSeesWorkflowBench)을 명시적으로 분리해 각 역량을 독립적으로 측정 가능하게 만들었다.
  2. reference 실행 스택 공개: planner → input writer → local runner → reviewer(loop) → visualization으로 이어지는 multi-agent 아키텍처를 src/opensees_agent/에 공개하여 재현 가능한 평가를 지원한다.
  3. 워크플로우 calibration 검증: OpenSeesBuildingBench calibration profile의 easy/medium/hard shard에서 관측된 expected-match rate(89.33%, 70.33%, 60.67%)가 목표치(89.67%, 70.33%, 60.67%)와 1 case 이내로 일치함을 보여, 실행 가능한 확장 하에서도 난이도가 보존됨을 입증했다.

How

Figure 3

Figure 3. Deterministic dataset construction and split gen-

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 벤치마크 구성과 agent 역량 평가를 명확히 분리하려는 시도는 구조공학 AI 에이전트 평가 분야에 중요한 방법론적 기여를 하며, 공개된 reference 스택과 calibration 결과는 향후 비교 연구의 신뢰할 수 있는 기반이 될 것으로 보인다. 다만 현재는 단일 시스템의 calibration 검증에 그쳐 있어, 실제 다양한 agent 아키텍처 간 비교를 통한 실질적 유용성 입증은 후속 연구를 기다려야 한다.

같이 보면 좋은 논문

기반 연구LLM 에이전트 벤치마크 설계의 방법론적 기반을 제공한다.
기반 연구문헌 기반 벤치마크 구축 방법론을 확장한 연구이다.
다른 접근특정 도메인(구조해석)에 대한 LLM 에이전트 벤치마크를 다른 도메인에서 유사하게 구축한다.
다른 접근유사한 domain knowledge 및 workflow 평가 프레임워크를 다른 분야에 적용한다.
다른 접근도메인 특화 LLM 에이전트 벤치마크 구축이라는 동일한 문제를 다룸
후속 연구LLM 에이전트의 end-to-end workflow 평가라는 유사한 프레임워크를 확장함
후속 연구end-to-end workflow 평가 방법을 확장하여 더 복잡한 태스크에 적용한다.
응용 사례도메인 특화 LLM 에이전트 평가를 실제 엔지니어링 문제에 적용한 사례이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드