Essence
Figure 4. Failure atlas: faithful (top, blue solid) vs. most illustrative hallucination (bottom, red dashed) for each of
LLM이 코드 실행 없이 직접 ODE 궤적을 생성할 때 발생하는 세 가지 실패 유형(catastrophic divergence, trivial-invariant collapse, phase drift)을 규명하고, ground-truth 없이 이를 감지하는 두 가지 보완적 감사 신호인 conservation residual R과 step consistency S를 제안한다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: LLM의 수치 추론 신뢰성 문제를 명확한 실패 분류와 실용적인 ground-truth-free 감사 신호로 체계화한 흥미롭고 시의적절한 연구로, 표본 규모의 한계에도 불구하고 과학 응용 분야에서 LLM 출력을 검증하는 실질적 방법론을 제시한다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Openai o1 system card'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Mind the gap: Examining the self-improvement capabilities of large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Scientific AI for Physics and Environment가 맞닿아, 'RBF++: Quantifying and optimizing reasoning boundaries across measurable and unmeasurable capabilities for chain-of-thought reasoning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구LLM의 물리 법칙 위반 검출이라는 문제의식의 기반이 되는 연구임
기반 연구LLM 기반 수치 시뮬레이션의 실패 유형 연구의 기초가 된다.
기반 연구jailbreak 탐지 등 실제 안전성 문제에 프레임워크를 적용함
다른 접근학습 불안정성 예측을 위한 다른 접근법을 제안하는 연구
다른 접근LLM의 수치적 추론 실패를 다른 도메인(ODE 외)에서 분석하는 유사 연구임
반론/비판LLM의 code execution 유무에 따른 성능 차이를 반대 관점에서 다룸