저자: Jenna Russell, Marzena Karpinska, Mohit Iyyer | 날짜: 2025-01-26 | DOI: 10.48550/arXiv.2501.15654 📄 PDF
Figure 1: 인간 전문가의 AI 생성 텍스트 주석 예시 - 판단, 신뢰도 점수, 상세 설명 포함
LLM을 글쓰기 작업에 자주 사용하는 사람들은 특별한 학습 없이도 AI 생성 텍스트를 극도로 정확하게 탐지할 수 있으며, 자동 탐지 시스템보다 훨씬 우수한 성능을 보인다. 본 연구는 300개의 논픽션 기사에 대한 9명의 주석자 분석을 통해 이를 입증한다.
Figure 2: 전문가 신뢰도는 난이도가 높아질수록 감소하지만 정확도는 유지
Figure 3: 전문가가 언급한 탐지 단서의 범주별 빈도 분포
총평: 현대 LLM 시대에 인간 탐지자의 잠재력을 체계적으로 재평가한 중요한 실증 연구이며, 실무적 가치가 높으나, 도메인과 전문가 표본의 제한성으로 인해 일반화 가능성에 주의가 필요하다.