Probe-and-Refine Tuning of Repository Guidance for Coding Agents
Asa Shepard, Jeannie Albrecht
레포지토리 가이드라인(AGENTS.md)을 합성 버그 수정 탐침을 통해 반복적으로 진단하고 개선하는 '탐색 및 정제 튜닝' 방법을 제안한다.
LLM 기반 코딩 에이전트는 코드 자체에는 존재하지 않는 레포지토리 수준의 운영 지식(파일 구조, 테스트 실행 방법, 과거 실패 패턴 등)이 필요하다. 엔지니어들은 AGENTS.md 파일을 통해 이 맥락을 제공하지만, LLM이 생성한 가이드라인이 실제로 도움이 되는지에 대한 연구 결과가 엇갈리고 있다.
제안 방법은 합성 버그-수정 탐침(synthetic bug-fix probes)을 사용하여 가이드라인 파일을 진단하고, 단일 샷 LLM 호출로 문제를 패치하는 과정을 반복한다. 튜닝 중에는 에이전트 루프나 도구 사용이 없으며, 오직 가이드라인 파일만 업데이트된다.
SWE-bench Verified에서 Qwen3.5-35B-A3B 모델로 200 스텝 실험 시 평균 해결률 33.0%로, 정적 지식베이스(28.3%) 및 무가이드(25.5%) 대비 유의미한 향상을 보였다. 개선은 정밀도(precision)보다 커버리지(coverage) 증가에서 비롯되었으며, 가이드라인이 에이전트의 스텝 예산 활용도를 높여준다는 점을 밝혔다.