Know Your Limits : On the Faithfulness of LLMs as Solvers and Autoformalizers in Legal Reasoning

저자: Olivia Peiyu Wang, Sanna Wong-Toropainen, Daneshvar Amrollahi, Arush Garg, Tashvi Bansal, Ryan Bai, Leilani H. Gilpin | 날짜: 2026 | URL: https://openreview.net/forum?id=9O8cX5mlxv 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 2

본 논문은 법률 문언 함의(entailment) 과제에서 LLM 단독 분류, LLM 기반 Formal Reasoning, Z3 SMT solver 기반 신경-기호적(neuro-symbolic) 추론의 세 가지 패러다임을 비교하여, 벤치마크 정확도 향상이 실제 논리적 충실성(faithfulness)을 의미하지 않음을 보인다.

Motivation

Achievement

Figure 1
  1. formal structure의 효과 규명: formal structure를 도입하면 정확도가 향상되며 LLM-based Formal Reasoning이 세 패러다임 중 가장 높은 벤치마크 성능을 달성함을 보였다.
  2. 정확도-충실성 괴리 입증: 정확도 향상이 곧 충실한 논리적 추론을 의미하지 않음을 실증적으로 보이고, LLM이 formal representation을 오해석하거나 명시되지 않은 가정을 도입함을 확인했다.
  3. 세 가지 실패 모드 식별: scope laundering(solver를 실제로 실행하지 않고 solver-consistent한 결론만 보고), implicit constraint blindness(formal representation 내 논리적 제약을 간과), program synthesis failures(구조화된 프롬프팅에도 불구하고 잘못된 Z3 코드 생성)라는 세 가지 반복적 실패 유형을 규명했다.
  4. scope laundering의 전방위적 지속성 확인: 모든 모델에서 scope laundering이 지속적으로 관찰되어, LLM 기반 formal reasoning이 symbolic execution의 대리(proxy)로서 신뢰될 수 있는지에 대한 심각한 우려를 제기했다.
  5. 재주석 데이터셋 구축: 실용적 법률 해석과 엄밀한 형식적 entailment 사이의 체계적이고 측정 가능한 간극을 드러내는, formal reasoning에 맞게 재주석된 ContractNLI 부분집합을 구축했다.

How

Figure 2

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 법률 도메인에서 LLM 기반 formal reasoning의 정확도와 충실성 사이의 근본적 간극을 실증적으로 드러낸 시의성 있고 중요한 연구로, scope laundering 등 새로운 실패 모드 개념은 향후 neuro-symbolic 시스템 평가에 중요한 시사점을 제공하지만, 데이터셋 범위와 재주석 신뢰도 검증에서 추가 보강이 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'Draft, sketch, and prove: Guiding formal theorem provers with informal proofs'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'Fimo: A challenge formal dataset for automated theorem proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'Grammars of formal uncertainty: When to trust llms in automated reasoning tasks'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구LLM 신뢰성 평가의 기초적 프레임워크 제공
다른 접근LLM 기반 추론의 신뢰성을 다른 방식으로 검증하는 접근이다.
후속 연구autoformalization의 기초적 방법론을 공유하는 선행 연구로 볼 수 있다.
다른 접근법률 추론에서 LLM과 formal reasoning을 비교하는 다른 연구
후속 연구neuro-symbolic 추론 신뢰성 평가를 확장한 연구
응용 사례신경-기호적 추론을 법률 도메인에 적용한 사례로 볼 수 있다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드