When LLMs Solve ODEs: Failure Modes, Conservation Blind Spots, and Ground-Truth-Free Auditing

저자: Ahmad A Rushdi | 날짜: 2026 | URL: https://openreview.net/forum?id=Od1zBaFLc2 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 4

Figure 4. Failure atlas: faithful (top, blue solid) vs. most illustrative hallucination (bottom, red dashed) for each of

LLM이 코드 실행 없이 직접 ODE 궤적을 생성할 때 발생하는 세 가지 실패 유형(catastrophic divergence, trivial-invariant collapse, phase drift)을 규명하고, ground-truth 없이 이를 감지하는 두 가지 보완적 감사 신호인 conservation residual R과 step consistency S를 제안한다.

Motivation

Achievement

Figure 3

Figure 3. Within-task Spearman ρ for R (blue) and S (gold) on

  1. 실패 유형 분류: LLM 수치 추론의 세 가지 실패 양상(catastrophic divergence, trivial-invariant collapse, phase drift)을 규명하고 각기 다른 검증 전략이 필요함을 보였다.
  2. 보완적 감사 신호 제안: R은 catastrophic 실패를 잘 포착하지만 phase drift에는 구조적으로 눈이 멀고 trivially 만족될 수 있는 반면, S가 이 공백을 메꾼다는 것을 실증했다.
  3. 강건한 순위 상관 검증: 모델 내부적으로 S가 실제 궤적 오차를 Spearman ρ∈[0.77,0.99]로 순위화하며, leave-one-task-out/leave-one-model-out 분석에서도 ρ∈[0.81,0.90]로 강건함을 확인했다.
  4. 결정론적 vs 확률적 모델 구분 및 Goodhart 효과 문서화: 모델들이 결정론적/확률적 수치 추론자로 나뉘며(동일 프롬프트에서 1,000배 이상 오차 편차), invariant 보존을 유도하는 프롬프팅이 일부 모델에서 invariant는 보존하지만 동역학적으로는 틀린 궤적을 생성하는 Goodhart식 게이밍을 유발함을 밝혔다.

How

Figure 2

Figure 2. Per-task scatter of conservation residual R vs. true

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: LLM의 수치 추론 신뢰성 문제를 명확한 실패 분류와 실용적인 ground-truth-free 감사 신호로 체계화한 흥미롭고 시의적절한 연구로, 표본 규모의 한계에도 불구하고 과학 응용 분야에서 LLM 출력을 검증하는 실질적 방법론을 제시한다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Openai o1 system card'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Mind the gap: Examining the self-improvement capabilities of large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Scientific AI for Physics and Environment가 맞닿아, 'RBF++: Quantifying and optimizing reasoning boundaries across measurable and unmeasurable capabilities for chain-of-thought reasoning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구LLM의 물리 법칙 위반 검출이라는 문제의식의 기반이 되는 연구임
기반 연구LLM 기반 수치 시뮬레이션의 실패 유형 연구의 기초가 된다.
기반 연구jailbreak 탐지 등 실제 안전성 문제에 프레임워크를 적용함
다른 접근학습 불안정성 예측을 위한 다른 접근법을 제안하는 연구
다른 접근LLM의 수치적 추론 실패를 다른 도메인(ODE 외)에서 분석하는 유사 연구임
반론/비판LLM의 code execution 유무에 따른 성능 차이를 반대 관점에서 다룸
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드