Measuring Representation Robustness in Large Language Models for Geometry

저자: Vedant Jawandhia, Yash Sinha, Ankan Pal, Murari Mandal, Dhruv Kumar | 날짜: 2026 | URL: https://openreview.net/forum?id=cXHVj1UjVs 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 2

본 논문은 동일한 기하 문제를 Euclidean, coordinate, vector 세 가지 표현으로 병렬 구성하여 LLM의 answer가 표현 방식에 따라 얼마나 달라지는지를 측정하는 GeoRepEval 프레임워크를 제안한다. Invariance@3과 Consistency@3이라는 새 지표로 11개 LLM을 평가한 결과, vector 표현에서 특히 취약함이 드러났다.

Motivation

Achievement

Figure 3
  1. GeoRepEval 프레임워크 제안: Invariance@3과 Consistency@3을 표준 accuracy와 수학적으로 연결하는 Property 1-3을 증명하여 통계적으로 근거 있는 representation-aware 평가체계를 구축했다.
  2. 병렬 벤치마크 구축: NCERT, RD Sharma, RS Aggarwal 등 표준 교과서에서 추출한 158개 핵심 문제를 Euclidean/coordinate/vector 세 형태로 의미적 동등성을 검증하여 474 instance로 구성했다.
  3. 표현 편향에 따른 유의미한 성능 격차 발견: Euclidean-Vector 간 최대 14 pp accuracy 격차, Invariance@3이 GPT-OSS-20B를 제외한 모든 모델에서 0.47 이하(LLaMA-3.1-8B는 0.044)로 나타났으며, surface complexity 통제 이후에도 11개 모델 중 8개에서 유의성이 유지되었다.
  4. Vector 표현이 지배적 실패 지점임을 규명: CCW 패턴(Euclidean·Coordinate 정답, Vector 오답)이 WCC 패턴보다 2-5배 더 빈번하여, 모델이 Euclidean reasoning template은 유창하게 적용하지만 vector 절차는 취약함을 보였다.
  5. Convert-then-solve prompting 개입 효과 검증: 고성능 모델에서는 vector accuracy가 최대 52 pp 개선되어 표현 민감성 문제임을 시사했으나, 저성능 모델에서는 개선이 없어 더 근본적인 한계가 있음을 발견했다.

How

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 표현 방식에 따른 LLM의 기하 reasoning 취약성을 체계적이고 통계적으로 엄밀하게 드러낸 의미 있는 연구로, aggregate accuracy 중심의 기존 평가 관행에 중요한 경종을 울린다. 다만 데이터셋 규모와 문화적 범위, 그리고 저용량 모델의 실패 원인에 대한 심층 분석이 보완된다면 더욱 완성도 높은 벤치마크로 발전할 수 있을 것이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.90로 LLM Agent Reasoning Training와 Scientific AI for Physics and Environment가 맞닿아, 'Scientific discovery in the age of artificial intelligence'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.90로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'BrowseComp: A simple yet challenging benchmark for browsing agents'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구LLM 평가 프레임워크 설계의 기초 방법론을 공유한다.
기반 연구SPECTER2 유사도 0.90로 LLM Agent Reasoning Training와 AI-Driven Drug and Materials Discovery가 맞닿아, 'What Topological and Geometric Structure Do Biological Foundation Models Learn?'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근LLM의 표현 방식에 따른 일관성 문제를 다른 방법으로 측정한다.
다른 접근LLM의 표현 방식에 따른 답변 일관성을 측정하는 유사한 평가 프레임워크를 제안한다.
다른 접근동일한 문제를 다른 표현으로 재구성해 모델의 강건성을 측정하는 접근이 유사하다.
후속 연구표현 방식에 따른 답변 일관성 평가를 확장한다.
후속 연구표현 불변성 측정이라는 개념을 확장하여 적용한 연구로 볼 수 있다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드