BuildArena: A Physics-Aligned Interactive Benchmark of LLMs for Engineering Construction

저자: Tian Xia, Tianrun Gao, Wenhao Deng, Long Wei, Xiaowei Qian, Chenglei Yu, Tailin Wu | 날짜: 2026 | URL: https://openreview.net/forum?id=QAQKmIp3SZ 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 2

Figure 2. Illustration of our BuildArena framework. It contains three parts: (1) Task definition; (2) LLM-based Construc

BuildArena는 자연어 지시를 물리적으로 실현 가능한 3D 구조물로 변환하는 LLM의 공학적 건설(engineering construction) 능력을 평가하기 위한 최초의 physics-aligned interactive benchmark이다. Support, Transport, Lift라는 세 가지 대표 과제와 난이도별 3단계(Lv.1~3)를 통해 정적/동적 역학 상황에서 LLM의 언어 기반 물리 구조 설계 능력을 종합 평가한다.

Motivation

Achievement

Figure 1

Figure 1. Examples of BuildArena’s construction results by

  1. 최초의 physics-aligned interactive benchmark 제안: 자연어 지시로 3D 구조물을 건설하고 물리적으로 제약된 환경 내에서 성능을 평가하는 첫 벤치마크(동시대 연구 BesiegeField 제외)를 제시했다.
  2. 확장 가능한 task design 전략 개발: Quantification, Robustness, Magnitude, Compositionality, Precision, Ambiguity의 6개 난이도 차원을 정의하고, 이를 기반으로 Support(정적 구조 안정성), Transport(동적 수평 이동), Lift(동적 수직 이동)의 3개 task category와 각 3단계 난이도(Lv.1~3)를 설계했다.
  3. 3D Spatial Geometric Computation Library 구축: 폐쇄형 소스인 Besiege 시뮬레이터의 기하 연산 기능을 재현한 오픈소스 라이브러리를 개발하여, 반복적 건설 과정에서 LLM의 언어 지시를 정확히 실행할 수 있도록 지원했다.
  4. 9개 최신 LLM 및 3개 추가 오픈웨이트 모델 평가: 다양한 frontier LLM들에 대해 언어 기반, 물리 기반 건설 자동화 역량을 종합적으로 비교 분석했다.

How

Figure 4

Figure 4. Details of the construction procedure in Figure 2. Our designed workflow (bottom row) contains five collaborat

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: LLM의 물리 기반 공학 건설 능력이라는 새로운 평가 축을 개척한 의미 있는 벤치마크로, 체계적인 난이도 설계와 오픈소스 도구 제공이라는 실질적 기여가 돋보이나, task 다양성과 시뮬레이터 fidelity에 대한 추가 검증이 향후 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Mooseagent: A llm based multi-agent framework for automating moose simulation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.90로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'AI Agents in Engineering Design: A Multi-Agent Framework for Aesthetic and Aerodynamic Car Design'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구diagrammatic reasoning 평가를 확장한 벤치마크이다.
다른 접근물리 정합적 벤치마크 구축을 위한 다른 접근법 제시
기반 연구LLM 공학적 건설 능력 평가의 이론적 기초
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 AI-Driven Drug and Materials Discovery가 맞닿아, 'From Perception to Autonomous Computational Modeling: A Multi-Agent Approach'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근물리적으로 실현 가능한 엔지니어링 설계 평가라는 유사 목표를 다른 도메인(CAD)에서 다룸
응용 사례자연어 지시 기반 물리 구조물 생성의 실제 응용
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드