The Unfireable Safety Kernel: Execution-Time AI Alignment for AI Agents and Other Escapable AI Systems
Seth Dobrin, Łukasz Chmiel
AI 에이전트의 자체 실행 환경을 제어하는 새로운 아키텍처적 안전 계층을 제안하고 검증합니다.
현재 AI 에이전트의 안전 통제(시스템 프롬프트, 출력 필터 등)는 에이전트의 자체 주소 공간 내부에 위치합니다. 이는 에이전트가 자체 환경에 충분한 접근성을 가진 '탈출 가능한 AI 시스템'의 경우, 입력에 의해 영향을 받을 수 있는 근본적인 취약점을 가집니다.
프로세스 격리, 사전 실행 강제, 실패 시 차단, 외부화된 증거 검증 등 네 가지 필수 속성을 충족하는 '실행 시각 AI 정렬' 계층을 제안했습니다. 이 계층은 '불사 안전 커널'로 구현되었으며, 러스트로 작성되어 SMT 정리(Z3)와 유한 모델 검사(Kani)를 통해 실패 시 차단 불변식이 기계적으로 검증되었습니다.
실제 탈출을 시도하는 적대적 공격자에 대해 1,000회 자체 수정 시도 중 안전 핵심에 대한 704회 시도를 모두 거부하고 탈출을 방지했습니다. 6,240회의 인가 왕복 테스트에서도 우회 사례가 없었습니다. 이는 기존 협력적 제어 접근 방식과 구별되는 아키텍처적 안전 보장의 새로운 패러다임을 제시합니다.