FRIGID: Scaling Diffusion-Based Molecular Generation from Mass Spectra at Training and Inference Time

저자: Montgomery Bohde, Hongxuan Liu, Mrunali Manjrekar, Magdalena Lederbauer, Shuiwang Ji, Runzhong Wang, Connor W. Coley | 날짜: 2026 | URL: https://openreview.net/forum?id=wTgx7b2D9r 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 2

Figure 2. (a) FRIGID-base includes a masked diffusion language model (MDLM) that generates SAFE (Noutahi et al., 2023) s

FRIGID은 mass spectra로부터 분자 구조를 de novo로 생성하는 diffusion language model 프레임워크로, fingerprint와 chemical formula를 조건으로 SAFE 시퀀스를 생성하며, ICEBERG 기반 forward fragmentation model을 활용한 inference-time remasking/denoising으로 정확도를 크게 향상시킨다.

Motivation

Achievement

Figure 4

Figure 4. Inference-time scaling on NPLIB1 and MassSpecGym.

  1. FRIGID-base 프레임워크 제안: SAFE 시퀀스를 생성하는 최초의 diffusion language model 기반 de novo 구조 규명 모델로, 수억 개의 비표지 구조로 사전학습 가능하며 NGBoost로 시퀀스 길이를 예측해 탐색 공간을 제약한다.
  2. Inference-time scaling 기법 도입: ICEBERG와 같은 forward fragmentation model을 활용해 hallucinated fragment를 식별하고 해당 subgraph만 targeted remasking·재디노이징함으로써 무작위 마스킹이나 단순 diffusion step 증가보다 표본 효율적인 성능 향상을 달성한다.
  3. 벤치마크 성능 대폭 개선: NPLIB1에서 기존 최고 방법 대비 Top-1 정확도를 3배 향상시키고, MassSpecGym에서 18% 이상의 Top-1 정확도(상대적으로 70% 향상)를 달성했다.
  4. 로그-선형 스케일링 법칙 발견: 학습 데이터 규모와 inference-time 연산량 모두에 대해 성능이 log-linear하게 향상되는 경향을 실증적으로 보여, 향후 de novo 구조 규명 개선을 위한 새로운 방향을 제시한다.

How

Figure 2

Figure 2. (a) FRIGID-base includes a masked diffusion language model (MDLM) that generates SAFE (Noutahi et al., 2023) s

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: FRIGID은 diffusion language model과 forward fragmentation model을 결합해 de novo 구조 규명의 학습·추론 확장성 문제를 동시에 해결한 인상적인 연구로, 벤치마크 성능 향상 폭이 크고 스케일링 법칙 발견이 후속 연구에 중요한 방향을 제시한다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 Computational Molecular Design와 LLMs for Molecular Biology & Chemistry가 맞닿아, 'Enhancing chemical reaction and retrosynthesis prediction with large language model and dual-task learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구vision-language 모델을 유사한 진단 리포트 생성에 적용한다.
기반 연구diffusion 기반 분자 생성의 이론적 토대
기반 연구SPECTER2 유사도 0.92로 Computational Molecular Design와 Molecular Simulation and Generative Modeling가 맞닿아, 'FlexMS: Benchmarking Deep Learning-Based Mass Spectrum Prediction Tools in Metabolomics'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Computational Molecular Design와 Molecular Simulation and Generative Modeling가 맞닿아, 'When should we trust the annotation? Selective prediction for molecular structure retrieval from mass spectra'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구불확실성 정량화 전략의 이론적 기반을 제공하는 선행 연구이다.
기반 연구SPECTER2 유사도 0.92로 Computational Molecular Design와 Molecular Simulation and Generative Modeling가 맞닿아, 'CAGenMol: Condition-Aware Diffusion Language Model for Goal-Directed Molecular Generation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근유사한 생성 프레임워크의 대안적 구현
다른 접근질량 스펙트럼 기반 분자 생성에 대한 다른 생성 모델 접근
다른 접근질량 스펙트럼 기반 분자 생성의 다른 접근법
후속 연구de novo 분자 구조 생성 프레임워크를 확장한 연구
후속 연구de novo 분자 구조 생성 방법의 확장
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드