⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
Figure 1. Overview of Unearth-AI: from natural language criteria
Unearth-AI는 자연어로 작성된 임상 예측 과제 설명을 ACES 프레임워크의 실행 가능한 YAML 명세로 변환하는 human-in-the-loop 방식의 agentic LLM 시스템으로, 환자 수준 데이터 없이 데이터셋 스키마 정보만으로 cohort 추출 명세를 생성한다.
Motivation
Known: MEDS 표준과 ACES 선언적 태스크 명세 언어는 기관 간 이식 가능하고 재현 가능한 임상 예측 과제 정의를 가능케 하지만, 임상 전문가가 이를 MEDS 코드 어휘와 ACES 문법으로 직접 번역하는 것은 여전히 큰 진입장벽이다.
Gap: 기존의 완전 텍스트 기반 LLM EHR 쿼리 접근법은 접근성은 높이지만 구조화된 중간 표현을 포기하여 재현성과 파이프라인 이식성을 상실하며, SQL/Python 기반 추출 코드는 데이터셋 특정적이라 기관 간 이식이 불가능하다는 근본적 격차가 존재한다.
Why: 임상 AI 연구의 재현성 문제는 코호트 정의의 미세한 차이(포함 기준, 시간 창, 코드 매핑)에서 비롯되는데, 자연어와 구조화된 실행 가능 명세(ACES) 사이의 번역 장벽을 자동화된 도구로 낮추면 더 많은 연구자가 공유 가능한 재현 가능 아티팩트를 생성하여 MEDS/ACES 생태계에 기여할 수 있게 된다.
Approach: LLM(GPT-5)이 자연어 과제 설명과 비민감 데이터셋 메타데이터(사용 가능한 MEDS 코드 집합)를 조건으로 후보 ACES YAML 설정 또는 실행 불가능성 평가를 반복적으로 제안하고, 구문 검증·술어 검증·실행 테스트로 구성된 자동 검증 루프와 선택적 사용자 개입을 통해 최종 명세를 정제한다.
Achievement
Figure 3. Efficiency metrics for Unearth-AI across 14 tasks. Blue bars indicate correctly processed tasks (n=12), while
완전한 실행 가능 태스크 커버리지: INSPIRE 주술기 EHR 데이터셋에서 14개 과제 중 실행 가능한 8개 과제 모두에 대해 사용자 의도와 일치하는 것으로 판정된 명세를 생성했다.
실행 불가능성 탐지: 실행 불가능한 6개 과제 중 4개를 정확히 식별하여 불필요한 작업 낭비를 방지할 수 있음을 보였다.
높은 효율성: 실행 가능한 과제에 대해 평균 4분 이내, 0.25달러 미만의 비용으로 종단 간(end-to-end) 생성이 완료되어 실용적 배포 가능성을 시사했다.
프라이버시 보존 설계: 환자 수준 데이터 없이 스키마 정보만으로 동작하여 기관 간 배포 시 개인정보 노출 위험을 최소화했다.
How
Figure 2. Example ACES configuration file generated by Unearth-
LLM(GPT-5, temperature=1.0, 최대 12,000 completion tokens)이 자연어 기준과 데이터셋 메타데이터(가용 MEDS 코드)를 입력받아 후보 YAML 구성 또는 실행 불가능성 평가를 JSON/YAML 형식으로 산출
자동 검증 3단계: (1) ACES 파서를 통한 구문 검증, (2) 참조된 코드가 실제 존재하는지 확인하는 술어 검증, (3) 단일 shard에서의 실행 테스트
검증 실패 시 오류 메시지를 LLM에 피드백하여 반복적으로 수정, 검증 성공 또는 실행 불가능 판정 시 루프 종료
사용자가 중간 산출물을 검토하고 수정 요청을 할 수 있는 human-in-the-loop refinement 단계 포함
INSPIRE 주술기 데이터셋 상 14개 과제(실행 가능/불가능 혼합)로 feasibility study 수행, 성공률·불가능성 탐지 정확도·효율성(시간, 반복 횟수, 토큰 비용) 측정
Originality
자연어 임상 과제 설명을 ACES라는 선언적·이식 가능·결정론적 실행 가능 명세로 변환하는 첫 시도로, 기존 완전 텍스트 기반 EHR 질의 접근법(Shi et al., 2024; Attrach et al., 2025)과 달리 구조화된 감사 가능(auditable) 중간 표현을 유지
SQL/Python 기반 데이터셋 특정적 추출 코드와 달리 MEDS 코드 어휘 기반의 스키마 비의존적(schema-agnostic) 산출물을 생성해 기관 간 이식성 확보
환자 수준 데이터 대신 데이터셋 스키마 정보만을 사용하는 프라이버시 보존적 설계로 생성 과정을 그라운딩
자동화된 검증(구문/술어/실행)과 선택적 human-in-the-loop 정제를 결합한 반복 루프 아키텍처 제안
Limitation & Further Study
LLM이 임상 이벤트의 시간적 순서 제약(예: 마취 종류가 마취 시작 시간보다 먼저 정의되어야 함)에 대한 명시적 지식이 부족하여 시간적으로 복잡한 과제에서 반복 횟수가 증가할 수 있음
평가가 단일 주술기 데이터셋(INSPIRE)의 14개 과제로 제한되어 있어, 다양한 임상 도메인에 걸친 실패 유형을 특징짓기 위해서는 더 큰 규모의 연구가 필요함
실행 불가능 과제 중 2건은 과소 명세된 복잡한 endpoint를 거부하지 않고 부적절하게 인코딩을 시도하는 실패 사례로 나타나, 실행 불가능성 판정 로직의 견고성 개선이 필요함
사람 평가자에 의한 "일치성" 판정 기준이 명확히 정의되지 않아 평가의 주관성 문제가 존재하며, 향후 체계적이고 정량적인 평가 프로토콜 및 사용자 중심 도구 설계 연구가 필요함
기반 연구SPECTER2 유사도 0.93로 Biomedical AI Knowledge Systems와 Agentic AI for Scientific Automation가 맞닿아, 'BioInformatics Agent (BIA): Unleashing the Power of Large Language Models to Reshape Bioinformatics Workflow'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.