Optimizing generative AI by backpropagating language model feedback
저자: Mert Yuksekgonul, Federico Bianchi, Joseph Boen, Sheng Liu, Pan Lu, Zhi Huang, Carlos Guestrin, James Zou | 날짜: 2025-03-20 | DOI: 10.1038/s41586-025-08661-4📄 PDF
⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
Essence
Fig. 1 | Overview of TextGrad. a, Neural network and backpropagation using
TextGrad는 신경망의 backpropagation과 automatic differentiation에서 영감을 받아, LLM이 생성하는 자연어 피드백을 "textual gradient"로 삼아 compound AI 시스템의 각 구성요소(프롬프트, 중간 출력, 코드, 분자 구조 등)를 자동으로 최적화하는 범용 프레임워크이다.
Motivation
Known: 기존 신경망은 backpropagation과 automatic differentiation을 통해 numerical gradient를 전파하여 turnkey 방식으로 최적화가 가능해졌고, 이는 지난 15년간 AI 발전의 핵심 동력이었다.
Gap: 그러나 LLM, 시뮬레이터, 외부 도구 등 black-box 컴포넌트와 자연어 상호작용으로 구성된 최신 compound generative AI 시스템은 numerical gradient를 backpropagate하기 어려워, 대부분 도메인 전문가의 수작업 설계와 휴리스틱에 의존하는 실정이며 자동 최적화 알고리즘이 부재하다.
Why: compound AI 시스템의 자동 최적화는 LLM 기반 agent, 도구 사용 시스템 등 향후 AI 돌파구를 가속화하는 데 있어 핵심 과제이며, PyTorch식 backpropagation 추상화를 자연어 영역으로 확장함으로써 과학자와 엔지니어가 손쉽게 impactful한 generative AI 시스템을 구축할 수 있게 한다.
Approach: TextGrad는 AI 시스템을 computation graph로 표현하고, 각 노드(프롬프트, LLM 호출, 도구 호출 등)를 통과하며 LLM이 생성하는 자연어 critique을 textual gradient로 backpropagate하여, PyTorch와 동일한 문법(변수 θ, 모델 f, 손실 L, gradient descent optimizer)으로 임의의 미분 불가능한 black-box 함수에 대해서도 최적화를 수행한다.
Achievement
Fig. 1 | Overview of TextGrad. a, Neural network and backpropagation using
TextGrad는 단일 프레임워크로 코딩 문제 해결, PhD 수준 과학 문제(Google-proof QA) 풀이, 방사선치료 계획 최적화, 특정 물성을 갖는 분자 설계, 프롬프트 최적화를 통한 추론 성능 향상, agentic 시스템 최적화 등 매우 이질적인 다양한 도메인에서 일관되게 성능 향상을 보였다.
How
Fig. 2 | Illustrative implementation of TGD and TextGrad’s backpropagation.
두 개의 LLM 호출로 구성된 시스템(Prediction=LLM(Prompt+Question), Evaluation=LLM(Evaluation Instruction+Prediction))을 예시로 backpropagation 알고리즘을 정의
∇LLM 연산자를 도입해 LLM 호출을 통과하는 textual gradient를 생성: "The prediction can be improved by…" 형태의 critique을 반환
변수의 모든 successor로부터 얻은 피드백을 종합해 chain rule과 유사하게 상위 변수(프롬프트 등)로 피드백을 전파
Textual Gradient Descent (TGD)를 통해 numerical gradient descent의 θ_new = θ - ∂L/∂θ에 대응하는 방식으로, 텍스트 피드백을 이용해 변수(프롬프트, 코드, 분자 구조 등)를 직접 업데이트
목적함수(loss)는 미분 불가능하거나 black-box여도 되며, 임의의 도메인/공역을 갖는 함수로 일반화
코딩, 분자 설계, 방사선치료 계획, QA 프롬프트 최적화, agentic 시스템 등 다양한 실제 응용에 동일 프레임워크를 적용해 검증
Originality
Automatic differentiation/backpropagation의 수학적 추상화(변수, forward/backward pass, gradient descent optimizer)를 자연어 피드백 영역으로 유비적으로 확장한 최초의 시도
PyTorch와 동일한 API 문법을 제공하여 기존 딥러닝 개발자들이 쉽게 채택할 수 있도록 설계
분자, 코드, 치료 계획, 프롬프트 등 이종(heterogeneous) 데이터 타입을 하나의 computation graph 안에서 통합적으로 다루는 범용성
black-box LLM API에도 적용 가능하여 내부 파라미터 접근 없이도 시스템 전체를 최적화할 수 있다는 실용적 장점
Limitation & Further Study
Textual gradient는 LLM critique의 품질에 의존하므로, 평가 LLM의 편향·환각·불안정성이 최적화 방향을 잘못 이끌 수 있다.
자연어 피드백을 반복적으로 반영하는 과정은 비용과 지연 시간이 크며, 대규모 agentic 시스템에서는 계산 예산 관리가 중요한 병목이 된다.
분자 설계·치료 계획처럼 안전성이 중요한 영역에서는 성능 향상뿐 아니라 제약조건 만족, 검증 가능한 실패 감지, 사람 전문가의 승인 절차가 함께 필요하다.
향후 연구는 textual gradient의 신뢰도 추정, 다중 평가자 합의, 도메인별 안전 제약을 통합한 최적화 절차를 발전시켜야 한다.
후속 연구SPECTER2 유사도 0.91로 Statistical Causal Inference Methods와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Optimizing generative AI by backpropagating language model feedback'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.