CADEngBench: Can AI Systems Co-Author Engineering Designs? A Hierarchical Benchmark for Physics-Verified Parametric CAD Generation

저자: Harmanjot Singh, Abhra Dubey | 날짜: 2026 | URL: https://openreview.net/forum?id=hIKrX5XpuN 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 3

Figure 3. Layer profile across the full benchmark.

CADEngBench는 40개의 CadQuery 기반 엔지니어링 CAD 생성 과제를 L0(컴파일/위상), L1(기하 충실도), L2(파라메트릭 무결성, perturbation robustness + Z3 SMT), L3(닫힌형 물리 검증)의 4계층으로 평가하는 계층적 벤치마크이다. 5개 대표 모델을 평가한 결과 CADCoder는 L0에서 39/40을 달성하지만 L2/전체에서는 각각 2/40, 1/40에 그치는 "specialist-generalist inversion"을 발견했다.

Motivation

Achievement

Figure 3

Figure 3. Layer profile across the full benchmark.

  1. CADEngBench 데이터셋 구축: 12개 엔지니어링 도메인, 17개 물리 태그, 3단계 난이도를 포괄하는 40개 CadQuery 과제를 프롬프트·메타데이터·제약·ground-truth 아티팩트와 함께 제공.
  2. 계층적 평가자(hierarchical evaluator) 설계: 컴파일/위상(L0), 기하 충실도(L1), perturbation robustness와 Z3 SMT 검증을 포함한 파라메트릭 무결성(L2), 닫힌형 물리 검증(L3)을 분리하여 평가.
  3. specialist-generalist inversion 발견: 5개 모델(GPT-5.1, Claude Sonnet 4.6, Gemini 2.5 Pro, Qwen3 Coder 30B A3B, CADCoder) 비교에서 CADCoder가 L0에서는 39/40으로 최고 성능이나 L2/전체에서는 최하위(2/40, 1/40)를 기록, 실행 가능성과 엔지니어링 유효성 간 근본적 괴리를 실증.
  4. 프롬프트 명세 및 반복 샘플링 ablation: 저명세(level 1) 프롬프트에서 전체 통과율이 1/60로 붕괴하는 반면 level 3에서는 20/60으로 개선됨을 보이고, 반복 샘플링이 frontier hosted 모델의 성능은 개선하지만 CADCoder의 파라메트릭 실패는 복구하지 못함을 보임.

How

Figure 2

Figure 2. Implementation-level evaluator dataflow. CADEngBench scores generated programs through executable artifacts an

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 실행 가능한 CAD 코드와 진정한 엔지니어링 유효 CAD 사이의 간극을 정량적으로 드러낸 시의적절하고 정교하게 설계된 벤치마크로, AI-for-engineering 평가 방법론에 실질적 기여를 한다. 다만 규모와 모델 커버리지 확장이 추가 검증에 도움이 될 것이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Evaluation of openai o1: Opportunities and challenges of agi'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'CodePDE: An Inference Framework for LLM-driven PDE Solver Generation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구CAD 생성 평가 체계의 기초 프레임워크 제공
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 AI-Driven Drug and Materials Discovery가 맞닿아, 'From Perception to Autonomous Computational Modeling: A Multi-Agent Approach'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근물리적 실현 가능성 평가라는 유사 문제를 3D 구조물 생성에서 다룸
다른 접근CAD 또는 엔지니어링 설계 생성 과제를 다루는 유사한 벤치마크 접근법으로 평가 방법론이 비교 가능하다
후속 연구3D seismic 데이터 생성 및 벤치마크 구축이라는 공통 기반을 공유한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드