저자: Harmanjot Singh, Abhra Dubey | 날짜: 2026 | URL: https://openreview.net/forum?id=hIKrX5XpuN 📄 PDF
라이선스: OpenReview 공개(오픈액세스)
Figure 3. Layer profile across the full benchmark.
CADEngBench는 40개의 CadQuery 기반 엔지니어링 CAD 생성 과제를 L0(컴파일/위상), L1(기하 충실도), L2(파라메트릭 무결성, perturbation robustness + Z3 SMT), L3(닫힌형 물리 검증)의 4계층으로 평가하는 계층적 벤치마크이다. 5개 대표 모델을 평가한 결과 CADCoder는 L0에서 39/40을 달성하지만 L2/전체에서는 각각 2/40, 1/40에 그치는 "specialist-generalist inversion"을 발견했다.
Figure 3. Layer profile across the full benchmark.
Figure 2. Implementation-level evaluator dataflow. CADEngBench scores generated programs through executable artifacts an
총평: 실행 가능한 CAD 코드와 진정한 엔지니어링 유효 CAD 사이의 간극을 정량적으로 드러낸 시의적절하고 정교하게 설계된 벤치마크로, AI-for-engineering 평가 방법론에 실질적 기여를 한다. 다만 규모와 모델 커버리지 확장이 추가 검증에 도움이 될 것이다.