저자: Aayam Bansal, Ishaan Gangwani | 날짜: 2026 | URL: https://openreview.net/forum?id=RyX98G24rP 📄 PDF
라이선스: OpenReview 공개(오픈액세스)
Figure 2. False discovery rate across conditions. “—” an-
이 논문은 여러 LLM 에이전트가 과학적 주장을 제안-비판-반증(Propose-Critique-Falsify, PCF)하는 다중 에이전트 검증 파이프라인이 실제로 허위 발견율(false discovery rate, FDR)을 줄이는지 벤치마킹하며, 오히려 "conservatism-as-abstention"이라는 새로운 실패 양상을 통해 모델별로 상반된 편향(과잉보수 또는 과잉허용)을 유발함을 보인다.
Figure 2. False discovery rate across conditions. “—” an-
Figure 1. Accuracy with 95% Wilson confidence intervals
총평: 자율 AI 과학 시스템의 신뢰성이라는 시의적절하고 중요한 문제를 다루며 흥미로운 실패 양상(conservatism-as-abstention)과 모델 의존적 편향을 발견했으나, 표본 크기가 작고 SciFact 도메인에서 FDR 측정이 근본적으로 불가능하다는 점이 실증적 결론의 일반화 가능성을 제한한다.