Generative Skill Composition for LLM Agents
Xinyu Zhao, Zhen Tan, Vaishnav Tadiparthi, Nakul Agarwal, Kwonjoon Lee, Ehsan Moradi Pari, Hossein Nourkhiz Mahjoub, Tianlong Chen
LLM 에이전트의 스킬 조합 선택 문제를, 스킬의 부분집합·개수·순서를 동시에 예측하는 생성 모델로 해결합니다.
LLM 에이전트의 성능을 높여주는 스킬 라이브러리가 커질수록, 작업에 맞는 최적의 스킬 조합(어떤 스킬을, 몇 개를, 어떤 순서로 사용할지)을 선택하는 것이 핵심 병목이 되었습니다. 기존의 전체 스킬 노출 방식이나 임베딩 기반 검색 방식은 이 세 가지 차원을 분리하여 처리하는 한계가 있었습니다.
작업 조건부 스킬 시퀀스 예측 문제로 공식화하고, 제약 조건이 있는 자기회귀 디코더를 사용하는 'SkillComposer'를 제안했습니다. 이 모델은 스킬 식별자 위에서 한 번의 디코딩 과정을 통해 부분집합, 개수, 순서를 동시에 결정하며, 연속된 스킬 간의 의존성을 자연스럽게 포착합니다.
실제 사람이 큐레이팅한 스킬 라이브러리로 학습 데이터를 구축하고, GPT-5.2-Codex와 Gemini-3-Pro-Preview 모델에서 평가했습니다. SkillComposer는 스킬 미사용 대비 통과율을 각각 +23.1pp, +18.2pp 향상시켰으며, 상위 3개 검색 방법을 능가하고, 골드 스킬 검색 상한선과 동등한 성능을 낮은 프롬프트 토큰 비용으로 달성했습니다.