MetaSkill-Evolve: Recursive Self-Improvement of LLM Agents via Two-Timescale Meta-Skill Evolution
Zefeng Wang, Minxi Yan, Jinhe Bi, Sikuan Yan, Volker Tresp, Yunpu Ma
LLM 에이전트의 작업 스킬과 그 자체를 개선하는 메타스킬을 동시에 재귀적으로 진화시키는 프레임워크를 제안한다.
최신 LLM 에이전트는 점점 더 긴 시간 범위의 개방형 작업을 다루며, 재사용 가능한 절차적 지식인 외부 스킬을 사용한다. 그러나 고정된 수동 스킬은 최적이 아니며 작업 다양성에 적응할 수 없다. 기존 자기 개선 에이전트는 작업 스킬만 개선할 뿐, 개선 절차 자체는 고정되어 있어 재귀적이지 않다.
MetaSkill-Evolve는 2-타임스케일 프레임워크를 도입한다. 각 분기는 작업 스킬(s)과 분기별 메타스킬(m)을 동시에 포함한다. 메타스킬은 개선 파이프라인의 분석기, 검색기, 할당자, 제안자, 진화기 에이전트를 매개변수화한다. 작업 스킬은 빠른 루프에서, 메타스킬은 동일한 파이프라인이 자기 자신에 적용되는 느린 루프에서 진화한다. 추가 모델이나 목표 함수 없이 단일 동결된骨干(backbone) 모델을 공유한다.
OfficeQA, SealQA, ALFWorld 세 가지 에이전트 벤치마크에서 스킬 없음, 고정 스킬, 단일 수준 진화 기반선을 능가한다. 원시骨干 대비 보유 테스트 정확도를 각각 +23.54, +16.09, +1.92 포인트 향상시켰다. 이는 에이전트의 자기 개선 능력을 재귀적으로 확장하는 새로운 방법론적 기여를 제공한다.