MLDebugging: Towards benchmarking code debugging across multi-library scenarios

저자: Jinyang Huang, Xiachong Feng, Qiguang Chen, Hanzhang Zhao, Zheng Cheng, Jie Bai, Jingxuan Zhou, Min Li, L. Q. Qin | 날짜: 2025 | DOI: N/A 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

Figure 1

다중 라이브러리 코드 디버깅의 예시: (a) 단순 정적 버그 vs (b) 라이브러리 간 변수 적응 문제

본 논문은 실제 소프트웨어 개발 환경에서 흔히 나타나는 다중 라이브러리 시나리오에서의 코드 디버깅을 체계적으로 평가하기 위한 MLDebugging 벤치마크를 제시한다. 126개의 Python 라이브러리를 포함하고 7가지 버그 유형으로 분류된 1,175개의 샘플로 구성되어 있다.

Motivation

Achievement

Figure 2

데이터셋 구축 파이프라인: (1) 데이터셋 수집, (2) LLM을 통한 디버깅, (3) 카테고리 균형 조정, (4) 수동 검증

  1. 다중 라이브러리 디버깅 벤치마크 구축: 126개의 widely-used 라이브러리를 포함하는 1,175개의 고품질 샘플 생성. 기존 벤치마크(xCodeEval, HumanEval, MdEval)와 달리 2-6개의 라이브러리 사용 및 실제 시나리오 반영.
  2. 체계적 버그 분류 체계: Type Mismatch(TM), Data Transfer Issues(DTI), Function Parameter Errors(FPE), Parameter Configuration Errors(PCE), Function Misuse(FM), Requirement Misunderstanding(RM), Import Errors(IE) 등 7개 카테고리로 분류.
  3. 종합적 LLM 평가: GPT-4o, Claude-3.5-sonnet, DeepSeek-V3, DeepSeek-r1 등 주요 모델 평가 결과:
    • 모든 LLM이 다중 라이브러리 디버깅에서 제한된 성능 보임
    • 방법 클래스 에러(method class error)는 잘 처리하나 개념적 오류와 import 누락에 취약
    • 런타임 정보(테스트 케이스, 피드백) 접근성이 성능 향상에 기여

How

Figure 2

데이터셋 구축의 4단계 프로세스

1. 소스 코드 수집

2. LLM을 통한 어노테이션 및 디버깅

3. 버그 카테고리 균형 조정

4. 품질 제어

Originality

Limitation & Further Study

Evaluation

Novelty: 4.5/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: MLDebugging은 코드 디버깅 연구의 중요한 공백인 다중 라이브러리 시나리오를 처음으로 체계적으로 다루는 실질적인 기여를 한다. 엄격한 데이터 수집 및 품질 관리 프로세스와 포괄적인 LLM 평가를 통해 이 분야의 토대를 마련했으나, 언어 제한, 샘플 규모, 버그 현실성 검증 측면에서 개선 여지가 있다.

같이 보면 좋은 논문

기반 연구코드 디버깅 평가 방법론의 기초를 제공한다.
다른 접근코드 디버깅 벤치마크 구축이라는 동일 문제를 다른 방식으로 접근한다.
후속 연구다중 라이브러리 코드 디버깅 평가를 확장한 벤치마크이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드