REFORMS: Consensus-based Recommendations for Machine-learning-based Science

저자: Sayash Kapoor, Emily M. Cantrell, Kenny Peng, Thanh Hien Pham, Christopher A. Bail, Odd Erik Gundersen, Jake M. Hofman, Jessica Hullman, Michael A. Lones, Momin M. Malik, Priyanka Nanayakkara, Russell A. Poldrack, Inioluwa Deborah Raji, Michael Roberts, Matthew J. Salganik, Marta Serra-Garcia, Brandon M. Stewart, Gilles Vandewiele, Arvind Narayanan | 날짜: 2024-05-03 | DOI: 10.1126/sciadv.adk3452 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

기계학습 기반 과학 연구의 타당성, 재현성, 일반화 가능성을 보장하기 위한 학제 간 합의 기반 체크리스트 REFORMS (32개 항목, 8개 모듈)을 제시한다.

Motivation

Achievement

How

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: ML 기반 과학 연구의 신뢰성 위기를 직면하여, 광범위한 학제 간 합의를 기반으로 명확하고 실행 가능한 체크리스트를 제시한 중요한 메타-과학 기여로, 과학 생산성과 투명성 향상에 즉시적 영향을 미칠 수 있다.

같이 보면 좋은 논문

기반 연구대부분의 발표된 연구 결과가 거짓이라는 Ioannidis의 주장은 REFORMS가 왜 엄격한 재현성 기준을 제시해야 하는지의 이론적 배경이 된다.
기반 연구심리과학 재현성 위기 연구는 기계학습 기반 과학 연구의 재현성과 타당성을 보장하기 위한 REFORMS 체크리스트 개발의 핵심 동기를 제공한다.
기반 연구머신러닝 연구를 위한 합의 기반 권고안(REFORMS)은 재현성 위기 해결을 위한 구체적인 방법론적 개선안을 제시한다.
기반 연구1079의 머신러닝 연구 보고 권고사항은 987이 지적한 과학 편향 문제를 AI 연구 분야에서 구체적으로 해결하려는 실천적 대응이다.
기반 연구머신러닝 연구의 재현성 권고안을 제시한 10791042의 재현성 향상을 위한 학술 생태계 개혁 어젠다를 구체화한다.
기반 연구학술 출판의 인센티브 불일치 문제를 다룬 [1123]은 본 연구의 기계학습 연구 신뢰성 체크리스트 개발이 해결하려는 구조적 문제의 배경을 제공한다.
기반 연구머신러닝 연구의 재현성과 타당성 문제를 다루는 이론적 기초를 제공한다.
다른 접근과학 데이터와 LLM 능력을 평가하는 비슷한 목적의 연구이다.
기반 연구REFORMS의 ML 연구 재현성 체크리스트는 LLM 기반 비판적 리뷰 시스템이 자동으로 검증해야 할 항목들의 기준선을 제공한다.
기반 연구REFORMS의 ML 연구 재현성 체크리스트는 LLM-native figures가 제공하는 데이터 출처 추적 기능이 실제로 충족시켜야 할 재현성 요건의 기준을 제시한다.
다른 접근ML 연구 방법론 표준화를 위한 다른 체크리스트 접근을 제시한다.
다른 접근AI의 '이해의 환상' 문제를 이론적으로 경고하는 이 논문에 대해, REFORMS는 실용적 체크리스트를 통한 구체적 대응책을 제시하는 보완적 접근법이다.
다른 접근사회과학과 ML 결합에 대한 다른 관점을 제시한다.
다른 접근LLM의 임상 텍스트 생성 능력을 평가하는 유사한 목적의 연구이다.
응용 사례제안된 체크리스트를 실제 ML 연구 사례에 적용한 결과를 다룬다.
다른 접근에이전트 기반 메트릭을 이용한 재현성 자동 평가 시스템은 REFORMS 체크리스트와 상호 보완적인 기계학습 연구 재현성 확보의 대안적 방법론이다.
후속 연구기계학습 기반 과학 연구의 타당성과 재현성 체크리스트를 제시한 [1079]는 본 연구의 DFT 계산 기반 데이터셋이 충족해야 할 방법론적 기준을 제공한다.
후속 연구기계학습 기반 과학 연구의 타당성과 재현성을 위한 체크리스트를 제시한 [1079]는 본 논문이 지적하는 자동화된 재료 발견 시스템의 신뢰성 문제 해결에 직접적으로 관련된다.
응용 사례고처리량 재료 자동 합성 시스템의 신뢰성 문제를 다룬 [1070]은 본 연구의 REFORMS 체크리스트가 실제로 적용되어야 할 기계학습 기반 과학 연구의 구체적 사례이다.
후속 연구REFORMS 체크리스트의 특정 모듈을 심화하여 확장한다.
후속 연구기계학습 기반 과학 연구의 타당성을 위한 체크리스트를 제시한 [1079]는 LLM이 사용된 학술 연구의 신뢰성 평가 기준을 이해하는 맥락을 제공한다.
후속 연구SPECTER2 유사도 0.91 기준으로 'Missingness-Aware Conformal Prediction Under Cross-Hospital Distribution Shift'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.91 기준으로 'Multiple-Comparison Testing for Cross-Validation Path Optimization Benchmarks: A Hessian-Mismatch Diagnostic for Holm--Bonferroni Failure Modes'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.91 기준으로 'Prediction-Powered Adaptive Inference with Pretrained AI Models for Contextual Bandits'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.91 기준으로 'Semi-knockoffs: a model-agnostic conditional independence testing method with finite-sample guarantees'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.91 기준으로 'Semiparametrically Efficient Inference for Kernel Measures of Noise Heterogeneity'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.90 기준으로 'Sequential Kernel-based Conditional Independence Testing via Adaptive Betting'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.92 기준으로 'Shared-Benchmark Regime Decomposition for Nonstationary Clinical Decisions'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.90 기준으로 'Spatial Deconfounder: Interference-Aware Deconfounding for Spatial Causal Inference'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.92 기준으로 'Strategic Hypothesis Testing'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.90 기준으로 'Three Tests for an Adoption-Aware Crop Recommender: Sensitivity, Permutation, Placebo'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.92 기준으로 'Unveiling Multi-regime Patterns in SciML: Distinct Failure Modes and Regime-specific Optimization'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구REFORMS의 ML 기반 과학 연구 재현성 체크리스트는 코드와 데이터를 함께 검증하는 execution-grounded evaluation 프레임워크와 결합하면 더 완전한 검증 체계를 구성한다.
후속 연구SPECTER2 유사도 0.90 기준으로 'Adaptive Inference with Weak Instruments'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.92 기준으로 'Addressing Instrument-Outcome Confounding in Mendelian Randomization through Representation Learning'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.91 기준으로 'Aggregate Models, Not Explanations: Improving Feature Importance Estimation'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.92 기준으로 'Anytime-Valid Confirmation of Label-Shift Corrections'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.91 기준으로 'Asymptotically Log-Optimal Bayes-Assisted Confidence Sequences for Bounded Mean'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.91 기준으로 'Asymptotically Optimal Sequential Testing with Markovian Data'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.90 기준으로 'Bayesian Frontier-Evaluation Testing Under Repeated Top-k Reporting'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.90 기준으로 'Beyond Classification: A Cough Regression Benchmark for Respiratory Acoustic Foundation Models'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.90 기준으로 'Causal Discovery for Irregularly Time Series with Consistency Guarantees'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.91 기준으로 'Causal Risk Minimization for High-Dimensional Treatments'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.91 기준으로 'Component-Wise Composite Likelihood Distillation for Censored Time-to-Event Data'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.91 기준으로 'Discovering Subgroups with Exceptional Survival Characteristics'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.91 기준으로 'Discrete Survival Knowledge Distillation for Competing Risks Analysis'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.90 기준으로 'Distilling Tabular Foundation Models for Structured Health Data'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.91 기준으로 'Equivalence Testing of Parametric Models via the Effective Dimension'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.90 기준으로 'FunCQNet: A Functional Censored Quantile Neural Network for Predicting Long-Term Post-Transplant Kidney Survival'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.90 기준으로 'Gradient-Based Causal Tree Ensembles: A Backbone Architecture for Heterogeneous Treatment Effects'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.92 기준으로 'Holm-Bonferroni Verification of Math Solvers: A Hessian-Mismatch Diagnostic for Benchmark-Level Failure Modes'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.91 기준으로 'Informative Irregularity as a Diagnostic for Model Robustness'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.91 기준으로 'Learning Treatment Representations for Downstream Instrumental Variable Regression'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.92 기준으로 'Longitudinal Dense-to-Sparse Forecasting: Individual Variability Predicts Conversion Better than Mean Change'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.91 기준으로 'Maximum Mean Discrepancy with Unequal Sample Sizes via Generalized U-Statistics'의 AI4S 방법론을 'REFORMS: Consensus-based Recommendations for Machine-learning-based Science'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구1079의 머신러닝 연구를 위한 표준화된 보고 권고사항은 977의 다중우주분석 방법론 도입의 필요성을 지지하는 메타과학적 맥락을 제공한다.
반론/비판머신러닝 재현성 권고안(REFORMS)은 LLM 벤치마크 환상 문제를 해결하기 위한 실천적 가이드라인을 제시하는 상보적 관점을 제공한다.
반론/비판REFORMS가 ML 연구의 재현성 기준을 강화하려는 반면, AI 가속 논문 작성이 동료 검증 능력을 초과한다는 논문은 그러한 기준 적용의 현실적 한계를 보여준다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드