저자: Khashayar Khajavi, Shaghayegh Sadeghi, Rise Adhikari, Alexander Tessier | 날짜: 2026-05-26 | URL: https://arxiv.org/abs/2605.27700 📄 PDF
Figure 1: The CITECHECK pipeline. A raw citation string is first parsed into structured metadata, then matched against
LLM이 생성한 과학 문헌의 인용 오류를 탐지하기 위해 학술 검색, 구조화된 LLM 기반 비교, 그리고 임계값 기반 의사결정을 결합한 하이브리드 프레임워크 CiteCheck를 제시한다. 982개의 제어된 부패 물리학 인용 벤치마크에서 88.7 macro-F1을 달성하여 GPT, Claude, Gemini를 포함한 베이스라인을 능가한다.
Figure 1: The CITECHECK pipeline. A raw citation string is first parsed into structured metadata, then matched against
주요 성과:
Figure 1: The CITECHECK pipeline. A raw citation string is first parsed into structured metadata, then matched against
총평: CiteCheck는 LLM 생성 과학 문헌의 인용 오류 탐지에 대한 실질적이고 시의적절한 해결책을 제시한다. 학술 검색과 구조화된 LLM 검증을 결합한 방법론은 sound하며, 제어된 벤치마크에서 강한 성능을 보인다. 그러나 도메인 일반화, 검색 인프라 의존성, 이차 검증 논리의 투명성 측면에서 개선의 여지가 있다.