/Users/jehyunlee/Documents/내노트북/paper-curation/docs/papers/411_How_do_humans_and_language_models_reason_about_creativity_a


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

Figure 3

We find that LLMs

본 연구는 STEM 분야의 design problem 창의성 평가에서 인간 전문가와 LLM이 originality를 판단할 때 어떤 인지적 과정과 세부 요인(uncommonness, remoteness, cleverness)에 의존하는지를 예시(example) 제공 여부에 따라 비교 분석한다.

Motivation

Achievement

Figure 4

CLAUDE-3.5-SONNET’s ratings generally agreed

  1. 인간 평가 패턴 발견: no-example 조건의 전문가는 example 조건 전문가에 비해 비교 언어(예: "better/worse")를 더 많이 사용하고 uncommonness를 더 강조하여, 기억 인출(memory retrieval) 기반 비교 전략에 더 의존함을 시사했다.
  2. LLM 평가 전략 규명: 최신 LLM들은 originality 평가 시 uncommonness와 remoteness를 우선시하여, 아이디어 간 semantic similarity에 기반한 평가 과정을 사용함을 보였다.
  3. example 제공 효과의 이중성: example 조건에서 LLM의 실제 originality 점수 예측 정확도는 향상되었으나, remoteness·uncommonness·cleverness와 originality 간 상관관계가 최대 0.99까지 급격히 높아져, 세부 facet에 대한 평가가 동질화(homogenization)되는 현상을 확인했다.
  4. 인간-AI 평가 전략의 발산: 두 연구 결과를 종합하여 인간과 AI가 서로 다른 집단적 선호와 인지 전략을 가지고 창의성을 평가함을 실증적으로 제시했다.

How

Figure 2

Pearson correlations among pairwise Likert ratings

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 인간과 LLM의 창의성 평가 과정을 세밀한 facet 단위로 병렬 비교한 실증적이고 시의적절한 연구로, LLM을 창의성 평가자로 활용할 때 발생할 수 있는 잠재적 편향(예: facet 동질화)을 구체적으로 드러낸 점이 인상적이다. 다만 표본 규모와 도메인 일반화 측면에서 추가 검증이 필요하다.

같이 보면 좋은 논문

기반 연구LLM을 재료 발견 실험에 적용한 사례이다.
기반 연구인간과 LLM의 추론 메커니즘 비교의 기초적 틀을 제공한다.
다른 접근창의성 평가에서 인간과 LLM의 차이를 다른 실험적 방법으로 규명한다.
반론/비판LLM의 창의성 인지 편향에 대한 비판적 시각을 제공한다.
반론/비판인간과 LLM의 창의성 추론 방식을 비교하여 본 논문의 AI 아이디어 영향 연구에 대한 인지적 관점을 보완한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드