⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
그라운딩된 조건과 그라운딩되지 않은(un-grounded) 동일 프롬프트 조건을 비교하여, 모델이 실제로 증거를 읽는지 아니면 사전학습 prior로 그럴듯한 내용을 재생산하는지를 구분하는 paired metric인 Hallucination Dependence Index (HDI)를 제안하고, 이를 embedding-overlap probe와 결합해 calibrated refusal과 silent prior-recycling을 구분하는 진단 프레임워크를 제시한다.
Motivation
Known: 임상 LLM의 hallucination 문제는 잘 알려져 있으며, evidence bundle에 대한 supported-claim rate를 계산하는 grounded-only faithfulness 평가가 표준으로 사용되어 왔고, retrieval augmentation이 hallucination을 줄인다는 연구(RAG 계열)와 LLM judge의 self-preference bias 문제도 선행 연구로 존재한다.
Gap: 기존 supported-claim rate는 grounded 조건 단일 점수만 측정하므로, 두 모델이 동일하게 87%를 기록해도 하나는 실제로 evidence를 읽고 다른 하나는 사전학습 prior가 우연히 cohort와 일치해 그럴듯한 내용을 만들어내는지 구분할 수 없다는 근본적 한계가 있으며, grounded-only 평가로는 ranking inversion이나 refusal-driven failure mode 같은 구조적 문제를 전혀 포착하지 못한다.
Why: 임상 현장에 배포되는 foundation model의 안전성 평가에서 grounded score만으로는 실제 위험한 hallucination 패턴(특히 ungrounded 상태에서 자신감 있게 틀린 수치를 생성하는 모델)을 놓칠 수 있어, 이는 환자 안전과 직결된 임상 배포 의사결정에 중대한 영향을 미친다.
Approach: 동일한 프롬프트 템플릿·디코딩 설정·재시도 정책을 고정한 채 evidence bundle 유무만 바꾸는 2×2 factorial cross-condition harness를 구축하고, 외부 고정 LLM judge와 rule-based checker를 병행하는 dual-checker 방식으로 claim을 검증하여 HDI와 semantic overlap을 계산한다.
Achievement
HDI 지표 제안: ungrounded hallucination 중 grounding이 실제로 억제하는 비율을 계산하는 paired metric HDI를 정의하고, bit-for-bit 동일 프롬프트에서 evidence bundle만 치환하는 통제된 측정 프로토콜을 확립했다.
failure mode 분리: embedding-overlap probe를 결합해 낮은 HDI가 calibrated refusal(저 overlap)에 의한 것인지 silent prior-recycling(고 overlap)에 의한 것인지 구분하는 Mode A/Mode B 분류 체계를 제시했다.
랭킹 역전 실증: 119 TCGA-LUAD 케이스에 대해 gpt-4o-mini, gpt-5.4-mini, gemini-2.5-flash, gemini-3-flash-preview 4개 모델로 실험한 결과, grounded support rate(81.9–93.2%)만 보면 gemini-2.5-flash(93.2%)가 gemini-3(81.9%)보다 안전해 보이지만 HDI(0.336–0.984)와 ungrounded unsupported rate(gemini-3 91.5% vs gemini-2.5 64.8%)를 보면 실제로는 반대임을 보였다.
통계적 유의성 확보: 300-claim 2인 전문가 합의(κ=0.64, inter-annotator κ=0.71)에 앵커링하고, patient-paired bootstrap과 Holm-corrected p≤0.009로 6개 모델 쌍 모두를 통계적으로 유의하게 분리했다.
119개 TCGA-LUAD 케이스를 면역 tier(Hot/Warm/Cold) 기준 tertile로 균등 층화 추출
각 케이스에 대해 pathology, RNA(면역 관련 유전자 패널 TPM), clinical, 사전 계산된 Hot/Warm/Cold immune tier를 포함한 sealed JSON evidence bundle 구성
grounded 조건은 이 bundle을 제공하고, ungrounded 조건은 case ID와 cohort명만 제공하며, 프롬프트 템플릿·디코딩 온도(T=0.2)·재시도 정책·타임아웃(120s)을 모든 조건에서 동일하게 고정
생성된 요약문을 의료 약어 경계를 고려해 문장 단위로 토큰화하고 numeric, modality, tier, uncertainty, literature, other 6개 claim type으로 태깅
rule-based checker(수치 매칭, ±0.01/±1pp 허용오차)와 고정된 외부 LLM judge(gpt-4.1-mini, T=0, 2-pass 합의)를 병행하는 dual-checker로 각 claim을 supported/partial/unsupported/unknown/conflict로 라벨링
text-embedding-3-small을 이용한 별도 semantic overlap 측정
HDI, semantic overlap 및 보조 지표를 결정론적으로 산출하고, patient-paired bootstrap과 Holm 보정으로 모델 쌍 간 유의성 검정
Originality
기존 연구가 거의 전적으로 grounded-output 단일 조건 평가에 머물렀던 반면, 동일 프롬프트에서 evidence bundle만 치환하는 paired grounded-vs-ungrounded 프로토콜과 HDI를 최초로 결합한 개념적 기여
embedding-overlap probe를 도입해 HDI 단독으로는 구분 불가능한 calibrated refusal과 silent prior-recycling을 patient-level에서 분리해내는 진단 방법론
외부 고정 judge(gpt-4.1-mini)를 factorial 어느 행에도 포함시키지 않음으로써 LLM judge의 self-preference bias를 구조적으로 제거
다중 모달(pathology, RNA, clinical, immune tier) 임상 코호트와 2인 전문가 합의 human anchor를 실질적 규모로 결합한 실증 설계
Limitation & Further Study
4개 상용 frontier LLM(gpt-4o-mini, gpt-5.4-mini, gemini-2.5-flash, gemini-3-flash-preview)에 국한되어 있고, gemini-3-flash는 preview 엔드포인트로 프로덕션 버전과 다를 수 있어 결과의 시간적 안정성이 불확실함
단일 암종(TCGA-LUAD) 119 케이스에 한정되어 있어 다른 질환·코호트로의 일반화 가능성이 검증되지 않음
human anchor κ=0.64로 중간 수준의 합의도이며, 300-claim 규모의 adjudication이 전체 결론의 통계적 견고성을 완전히 보장하는지에 대한 추가 검증 필요
semantic overlap probe가 text-embedding-3-small 특정 임베딩 모델에 의존하므로 임베딩 모델 선택에 따른 민감도 분석이 요구됨
후속 연구로 더 많은 모델·질환군·prompt 구조로 HDI의 일반화성을 검증하고, HDI를 실제 임상 배포 의사결정 파이프라인에 통합하는 연구가 필요함
총평: grounded-only 평가의 근본적 맹점을 짚어내고 이를 해결하는 간단하지만 강력한 paired diagnostic(HDI)과 overlap probe를 제안한 점에서 임상 LLM 안전성 평가에 실질적 기여를 하는 연구이며, 실증 규모의 확장과 다양한 코호트 검증이 추가되면 임팩트가 더욱 커질 것으로 판단된다.