LifeSciBench: Evaluating Language Models on Realistic, Expert-Level Tasks in the Life Sciences

저자: Amelia Liu, Andrew Ho, Anne Marie Droste, David Martin, Edmund Wong, Edward Zhou, Isabelle Zhou, Joshua Park, Joy Jiao, Katie-Rose Skelly, Kenny Kim, Kevin Rao, Masatoshi Uehara, Max Marion, Nicole Fitzgerald, Rachel Dias, Suyash Shringarpure, Yuan Yuan, Yunyun Wang | 날짜: 2026-06-17 | URL: https://openai.com/index/introducing-life-sci-bench/ 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

Figure 1

Figure 1: LifeSciBench overview. Expert scientists write tasks consisting of prompts, artifacts, and rubrics; tasks

LifeSciBench는 생명과학 연구의 현실적 복잡성을 반영하는 750개 전문가 저작 과제로 구성된 벤치마크로, 7개 과학 워크플로우와 7개 생명과학 도메인을 아우르며 각 과제별 전문가 작성 채점 기준을 포함하고 있다. 이를 통해 LLM의 실무 수준 과학적 추론 및 의사결정 능력을 평가한다.

Motivation

Achievement

Figure 4

Figure 4: Overall LifeSciBench score by model. Bars show problem-weighted mean normalized rubric score.

GPT-Rosalind 최우수 성능: 0.576 정규화 점수 및 36.1% 과제 통과율 달성

벤치마크 포화도 원거리: 171개 과제(22.8%)를 모든 모델이 통과하지 못하고, 261개 과제(34.8%)의 최고 성능 모델 통과율이 20% 미만

포괄적 평가 프레임워크: 7개 워크플로우 × 7개 도메인 × 전문가 채점 기준의 다차원 평가 체계 구축

현실성 검증: 이미지, 문서, 시퀀스 파일, 분자 구조, 웹 참조 등 복잡한 인공물과 모호한 상황을 포함한 현실적 과제 설계

How

Figure 2

Figure 2: Example LifeSciBench task. Each task is comprised of an expert-written prompt, a set of artifacts or

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 5/5 Overall: 4/5

총평: LifeSciBench는 광범위한 도메인과 현실적 복잡성을 통합하는 업계 최초의 포괄적 생명과학 벤치마크로, 현재 frontier LLM도 여전히 상당한 도전에 직면해 있음을 명확히 보여주며 생명과학 분야 AI 평가의 표준으로서 중요한 기여를 하는 고품질 연구다.

같이 보면 좋은 논문

기반 연구LLM의 실제 위험 영향 평가에 적용된 유사한 실증 연구이다.
다른 접근매우 높은 유사도로 생명과학 LLM 벤치마크라는 유사한 목표를 다룬다.
후속 연구과학적 추론 및 실험 벤치마크를 확장하는 관련 연구이다.
후속 연구전문가 채점 기준을 활용한 평가 방법론을 확장함
후속 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LifeSciBench: Evaluating Language Models on Realistic, Expert-Level Tasks in the Life Sciences'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드