Essence
학습 없이 in-context 자기개선 루프에서 confidence 기반 예시 선택과 correctness 기반 예시 선택이 vision-language model의 수학적 추론 성능, 캘리브레이션, 오답 확신도에 통계적으로 차이를 만들지 않음을 보인 negative-result 연구이다. 대신 오답에 대한 과신은 selection signal이나 task가 아니라 모델 자체의 속성임을 보인다.
Evaluation
Novelty: 4/5 Technical Soundness: 3/5 Significance: 3/5 Clarity: 4/5 Overall: 3/5
총평: RL 환경에서 알려진 confidence-vs-correctness 구분이 no-training in-context 설정에는 전이되지 않는다는 흥미로운 negative result를 제시하며 overconfidence가 모델 고유 속성이라는 실용적 시사점을 주지만, 표본 크기와 모델 수가 매우 제한적이어서 결론의 견고성에는 추가 검증이 필요하다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Openai o1 system card'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 AI-Assisted Academic Scholarly Communication가 맞닿아, 'Remor: Automated peer review generation with llm reasoning and multi-objective reinforcement learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 AI-Assisted Academic Scholarly Communication가 맞닿아, 'AgentRxiv: Towards Collaborative Autonomous Research'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구자율 에이전트 기반 연구 협업의 이론적 기반을 제공함
기반 연구약한 감독자 개념을 critique distillation으로 확장
기반 연구correctness와 confidence 관계의 이론적 기초를 제공하는 연구
다른 접근LLM 기반 subagent 구조를 활용한 자율 연구 파이프라인이라는 공통 방법론을 공유함.
기반 연구vision-language model의 캘리브레이션 및 confidence 연구의 기반이 된다.
다른 접근jailbreaking 메커니즘 분석을 위한 다른 접근법 제시
다른 접근명시적 요청 없이 발생하는 chain-of-thought 현상 분석이라는 공통 주제를 공유
후속 연구프롬프트 최적화 방법론의 이론적 기반을 제공한다.
후속 연구in-context learning의 calibration 문제를 확장하는 연구
반론/비판정서적 프롬프트 효과에 대한 재현성 검증으로 원 연구의 주장을 반박함
반론/비판confidence 기반 선택의 유효성에 대해 상반된 결과를 제시할 수 있다.