한줄 요약
SIA는 메타 에이전트가 태스크에 맞춰 타겟 에이전트를 생성하고, 피드백 에이전트가 성능 로그를 분석해 타겟 에이전트를 반복적으로 개선함으로써 벤치마크 성능을 자율적으로 향상시키는 프레임워크입니다.
핵심 기능
세 가지 에이전트 구조: 메타 에이전트(태스크 설명 기반 타겟 에이전트 생성), 타겟 에이전트(태스크 수행), 피드백 에이전트(성능 로그 분석 및 개선)가 협력하여 반복적 개선 루프를 형성합니다.
하네스와 가중치 업데이트: 타겟 에이전트의 하네스(프롬프트 등)와 가중치를 모두 업데이트하여 성능을 향상시킵니다.
내장 태스크: gpqa, lawbench, longcot-chess, spaceship-titanic 등 네 가지 태스크가 기본 제공됩니다.
다양한 LLM 지원: Claude, OpenAI, Gemini 등 여러 LLM을 에이전트 구현체로 사용할 수 있습니다.
언제 쓰나
특정 벤치마크에서 AI 시스템의 성능을 자동으로 개선하고자 할 때 유용합니다.
수동 튜닝 없이 에이전트가 스스로 학습하고 개선하도록 만들고 싶을 때 적합합니다.
과학적 태스크(예: 법률 추론, GPU 커널 최적화, 유전자 발현 데이터 복원)에서 SOTA를 달성하고자 할 때 사용할 수 있습니다.