Think Fast, Talk Smart: Partitioning Deterministic and Neural Computation for Structured Health Text Generation

저자: Kai-Chen Cheng, Haejun Han, Qiwei Sun | 날짜: 2026 | URL: https://openreview.net/forum?id=LF7WwoWAGI 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. The TFTS partitioning framework. Recurring structured health-generation tasks are split into structured inputs

구조화된 헬스 데이터를 텍스트로 변환하는 파이프라인에서 반복적인 분석 작업은 결정론적 코드(deterministic code)가 수행하고, LLM은 검증된 사실을 표현하는 bounded writer 역할만 맡도록 책임을 분할하는 TFTS(Think Fast, Talk Smart) 프레임워크를 제안하고, 층별 교체(layer-replacement) 실험으로 각 분석 책임을 LLM에 위임했을 때 발생하는 계약별(contract-specific) 실패 양상을 규명한다.

Motivation

Achievement

Figure 2

Figure 2. Baseline cost/error frontier across six models (n = 280 per cell). Both panels use end-to-end COST/NIGHT on a

  1. 낮은 오류와 비용을 동시에 달성: 280 user-nights, 6개 모델(GPT-5 nano, GPT-4o mini, GPT-OSS-20B/120B, Haiku 4.5, Sonnet 4.6)에 걸쳐 TFTS는 평균 NUMERR 0.7%(최악 모델도 2.0%), instruction-compliance error 3% 미만을 기록하며 STRUCTURED ZERO-SHOT과 STRUCTURED FEW-SHOT 베이스라인보다 numeric error, instruction-compliance error, end-to-end cost 모두에서 우수함을 보였다(Figure 2).
  2. 계약별 실패 양상 규명: layer-replacement 프로토콜을 통해 COMPARISON을 LLM으로 대체하면 NUMERR가 16.9%로, RANKER 대체 시 SELERR이 65.8%로, ATTRIBUTION 대체 시 ATTRERR이 24.5%로 급증함을 보여, 각 분석 책임이 서로 다른 방식으로 실패함을 정량적으로 입증했다(Table 1).
  3. writer 인터페이스라는 비자명한 실패 지점 발견: 업스트림 사실이 모두 결정론적으로 검증된 상태에서도 evidence-to-writer handoff를 LLM 생성 아티팩트로 대체(REPLACE HANDOFF)하면 NUMERR가 4.8%, ATTRERR이 10.7%로 상승하여, 검증된 사실과 산문 사이의 인터페이스 자체가 신뢰성 메커니즘의 일부임을 밝혔다.

How

Figure 3

Figure 3. Annotated examples of error types. Red highlights mark the LLM output span that violates the target rule; gree

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 반복적인 구조화 헬스 텍스트 생성에서 "무엇을 결정론적 코드로, 무엇을 LLM으로 처리할지"에 대한 명확한 설계 원칙과 이를 검증하는 체계적인 layer-replacement 방법론을 제시한 실용적이고 시의적절한 연구이나, 단일 도메인·소규모 데이터에 기반한 워크숍 논문 수준의 실증적 한계가 있다.

같이 보면 좋은 논문

기반 연구결정론적 코드와 LLM 역할 분리 아키텍처의 토대를 제공한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'StarCoder: may the source be with you! arXiv preprint arXiv:2305.06161, 2023.'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'StarCoder 2 and the Stack v2: The next generation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근LLM 에이전트를 활용한 자동화된 알고리즘/수치 최적화 설계라는 유사한 문제를 다른 접근으로 다룸
다른 접근sycophancy 교정을 위한 다른 방법론적 접근을 제시함
다른 접근LLM의 사실 생성 신뢰성을 확보하는 유사한 문제의식
다른 접근구조화된 데이터를 텍스트로 변환하는 다른 책임 분할 전략을 제시한다.
후속 연구bounded writer 개념을 다른 헬스 데이터 파이프라인으로 확장한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드