LitXBench: A Benchmark for Extracting Experiments from Scientific Literature

저자: Curtis Chong, Jorge Colindres | 날짜: 2026 | URL: https://openreview.net/forum?id=Ie2S7UNfYA 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 3

Figure 3. Schema of extracted materials in LitXAlloy. Each material is identified by its process steps, which are outlin

과학 문헌에서 소재(합금)의 실험 측정치를 추출하는 작업을 벤치마킹하기 위한 프레임워크 LitXBench와, 19편의 합금 논문에서 1426개 측정치를 담은 고밀도 벤치마크 LitXAlloy를 제안한다. 실험 데이터를 CSV/JSON이 아닌 Python 객체로 저장하여 감사 가능성과 프로그래밍적 검증을 강화했다.

Motivation

Achievement

Figure 1

Figure 1. Pareto front of experiment extraction methods. The cost

  1. LitXAlloy 벤치마크 구축: 19편의 합금 논문에서 1426개 측정치를 사람과 LLM이 함께 검토하여 고품질로 수작업 추출한 고밀도 벤치마크를 제시했다.
  2. 성능 격차 규명: 최신 LLM(Gemini 3.1 Pro Preview 등)이 기존 다단계(multi-turn) 추출 파이프라인 대비 최대 0.37 F1의 우위를 보였고, 이는 파이프라인이 측정치를 조성이 아니라 공정 단계와 연결하지 못하는 데서 기인함을 밝혔다.
  3. Canonical value 매핑 효과 입증: 범주형 값을 고유 canonical identifier로 매핑할 때 값 구분 정확도가 향상됨을 보였다.
  4. 코드 기반 데이터 모델 제시: Python 객체 기반 표현으로 편집 가능성과 감사 가능성을 높인 데이터 모델을 제안했다.

How

Figure 5

Figure 5. Definition of each Synthesis Group. Each material defines which group of synthesis events it undergoes through

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 3/5 Clarity: 4/5 Overall: 3/5

총평: 소재 실험 데이터 추출 평가에서 조성 대신 공정 이력을 기준으로 삼아야 한다는 통찰과 코드 기반 감사 가능 벤치마크 설계는 실용적으로 유의미하나, 벤치마크 규모가 작고 워크숍 논문 수준의 초기 연구로서 추가 검증과 확장이 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 Formal Methods & Code Generation가 맞닿아, 'Evaluating large language models trained on code'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 AI-Driven Drug and Materials Discovery가 맞닿아, '34 examples of llm applications in materials science and chemistry: Towards automation, assistants, agents, and accelerated scientific discovery'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Prim: Principle-inspired material discovery through multi-agent collaboration'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Agentic LLM Reasoning in a Self-Driving Laboratory for Air-Sensitive Lithium Halide Spinel Conductors'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근장문 생성을 위한 다른 테스트 타임 스케일링 방법을 제시한다.
다른 접근과학 문헌에서 실험 데이터를 추출하는 유사한 문제를 다룬다.
다른 접근과학 문헌에서 실험 데이터를 추출하는 다른 벤치마크 접근이다.
후속 연구LLM 기반 소재 설계 인터페이스의 기초적 접근을 제공한다.
후속 연구문헌 기반 실험 추출 작업을 확장한 관련 연구이다.
후속 연구multimodal 재료 데이터셋 구축의 방법론적 기반을 제공함
후속 연구문헌 기반 벤치마크 구축 방법론을 확장한 연구이다.
응용 사례소재 과학 문헌의 실험 측정치 추출을 실제 도메인에 적용한 사례이다.
반론/비판기존 벤치마크 논문들의 데이터 누수와 shortcut learning 문제를 비판적으로 지적한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드