LifeSciBench: Evaluating Language Models on Realistic, Expert-Level Tasks in the Life Sciences
저자: Amelia Liu, Andrew Ho, Anne Marie Droste, David Martin, Edmund Wong, Edward Zhou, Isabelle Zhou, Joshua Park, Joy Jiao, Katie-Rose Skelly, Kenny Kim, Kevin Rao, Masatoshi Uehara, Max Marion, Nicole Fitzgerald, Rachel Dias, Suyash Shringarpure, Yuan Yuan, Yunyun Wang | 날짜: 2026-06-17 | URL: https://openai.com/index/introducing-life-sci-bench/📄 PDF
⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
Essence
Figure 1: LifeSciBench overview. Expert scientists write tasks consisting of prompts, artifacts, and rubrics; tasks
LifeSciBench는 생명과학 연구의 현실적 복잡성을 반영하는 750개 전문가 저작 과제로 구성된 벤치마크로, 7개 과학 워크플로우와 7개 생명과학 도메인을 아우르며 각 과제별 전문가 작성 채점 기준을 포함하고 있다. 이를 통해 LLM의 실무 수준 과학적 추론 및 의사결정 능력을 평가한다.
Motivation
Known: 기존 생명과학 벤치마크는 사실 지식 검색이나 계산 생물학 내 분석에 한정되었으며, 현실 연구의 모호성, 불완전한 증거 해석, 복합 의사결정이 필요한 다면적 작업들을 충분히 포착하지 못했다.
Gap: 기존 벤치마크는 좁은 범위의 특정 도메인에만 한정되거나 지식 기반의 고립된 질문에 초점을 맞추었으며, 광범위한 도메인 커버와 함께 현실 전문가 수준의 다층적 과제를 통합적으로 평가하는 벤치마크가 부재했다.
Why: 생명과학 연구에서 모델의 실용성과 신뢰성을 정확히 평가하려면 단순한 사실 지식이 아닌 과학적 추론, 불확실한 상황에서의 의사결정, 실제 워크플로우 반영이 필수적이며, 이를 통해 agentic LLM 시스템의 실제 업무 활용 가능성을 검증할 수 있다.
Approach: 173명의 생명과학 박사급 전문가가 7개 워크플로우(증거 처리, 분석, 설계, 과학적 추론, 검증, 임상 응용, 과학 커뮤니케이션)와 다양한 도메인에 걸쳐 현실적 문제를 자유 응답 형식으로 설계했으며, 각 과제는 멀티라운드 QA 검수와 전문가 작성 채점 기준을 포함한다.
Achievement
Figure 4: Overall LifeSciBench score by model. Bars show problem-weighted mean normalized rubric score.
GPT-Rosalind 최우수 성능: 0.576 정규화 점수 및 36.1% 과제 통과율 달성
벤치마크 포화도 원거리: 171개 과제(22.8%)를 모든 모델이 통과하지 못하고, 261개 과제(34.8%)의 최고 성능 모델 통과율이 20% 미만
포괄적 평가 프레임워크: 7개 워크플로우 × 7개 도메인 × 전문가 채점 기준의 다차원 평가 체계 구축
현실성 검증: 이미지, 문서, 시퀀스 파일, 분자 구조, 웹 참조 등 복잡한 인공물과 모호한 상황을 포함한 현실적 과제 설계
How
Figure 2: Example LifeSciBench task. Each task is comprised of an expert-written prompt, a set of artifacts or
활동 과학자들의 설문을 통해 7개 워크플로우 분류체계 개발
박사급 생명과학 전문가 173명이 과제 및 채점 기준 저작
멀티라운드 QA 프로세스를 통한 독립적 검수 수행
분자 구조, 실험 데이터, 규제 문서, 학술지 등 다양한 인공물 통합
자유 응답 형식으로 과제 설계하여 과학적 판단과 적절한 상세도 평가
GPT-Rosalind, Claude, Gemini 등 5개 주요 모델 대상 평가
Originality
현실성 강화: 기존 벤치마크의 고립된 지식 문제 대신 과학자가 동료에게 하듯 자연스러운 언어로 작성된 개방형 과제 도입
다원적 증거 처리: 이미지, 문서, 분자 표현, 웹 참조 등 이질적 인공물을 단일 과제에서 통합 평가
전문가 저작 규모: 173명 전문가의 대규모 협업으로 750개 과제 및 채점 기준 구성
광역 도메인 커버: 7개 워크플로우 × 7개 생명과학 도메인으로 기존 벤치마크보다 훨씬 광범위한 범위 달성
모호성 평가: 의도적으로 개방형으로 작성하여 모델의 문맥 해석과 불완전한 증거 판단 능력 평가
Limitation & Further Study
단회 응답 평가: 실제 과학적 대화는 반복적인 질의응답과 피드백 루프를 포함하나 벤치마크는 단일 응답만 평가
채점 기준 객관성: 채점 기준이 전문가 저작이나 일부 과제의 모호한 평가 기준으로 인한 채점자 간 변동성 가능성
도메인 편향: 약물 발견과 생명과학 분야 중심으로 기초 생물학 교육 수준이나 임상 진료 현장 과제는 제한적
향후 연구 필요: 멀티턴 상호작용, 실제 실험실 워크플로우와의 직접 비교, 도메인 편향성 완화, 채점 기준 신뢰도 향상 필요
총평: LifeSciBench는 광범위한 도메인과 현실적 복잡성을 통합하는 업계 최초의 포괄적 생명과학 벤치마크로, 현재 frontier LLM도 여전히 상당한 도전에 직면해 있음을 명확히 보여주며 생명과학 분야 AI 평가의 표준으로서 중요한 기여를 하는 고품질 연구다.
후속 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LifeSciBench: Evaluating Language Models on Realistic, Expert-Level Tasks in the Life Sciences'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.