저자: Jakub Radzikowski, Josef Chen | 날짜: 2026 | DOI: 10.48550/ARXIV.2605.22391 📄 PDF
Figure 4: One ICA factor per Epicure model with its GMM-mode decomposition, projected onto
본 논문은 multilingual recipe corpus에서 재학습한 ingredient embedding 모델 Epicure 세 가지 sibling을 제시한다. 동일한 아키텍처를 공유하되 random-walk schema만 다르게 하여 chemistry와 recipe-context 신호의 비율을 조절 가능한 설계축으로 노출시킨다.
Figure 4: One ICA factor per Epicure model with its GMM-mode decomposition, projected onto
선형 회복 가능성: 27개 continuous sensory/nutrient와 8개 cuisine macro-region에 대해 선형 supervised probe 구성 가능. Cuisine separability (Cohen's d)는 Cooc/Core/Chem에서 2.43/2.70/3.07. 비지도 인수분해: FastICA로 모델당 20개 interpretable factors 발견. GMM 분할로 모델당 150-200개 named culinary modes 확인, 평균 coherence 0.611/0.833/0.703 (random baseline 대비 5-8배 향상). 조작 연산: nearest-neighbour pairing과 SLERP direction arithmetic으로 supervised/emergent pole 모두 지원.
총평: 본 논문은 multilingual recipe corpus와 LLM-augmented normalization을 통해 ingredient embedding의 다양성과 해석 가능성을 크게 향상시킨 작업이다. Chemistry-vs-recipe-context를 controllable design axis로 명시한 것과 supervised/emergent geometry의 parallel analysis는 novel하며, 광범위한 evaluation (27 sensory + 8 cuisine + 20 unsupervised factors)이 rigor를 보강한다. 다만 모델 및 코드 미공개, downstream task 실증 부재, multilingual pipeline의 신뢰성 검증 부족이 한계이다.