LLM PC 5월 19일
자율 AI 에이전트의 런타임 안전성: AgentWall
자율 AI 에이전트의 안전성은 점점 더 중요한 오픈 문제로 인식되고 있습니다. 에이전트가 패스िव 텍스트 생성기에서 액티브 액터로 전환하면서, 셸 명령어를 실행, 파일을 수정, API를 호출, 웹을 탐색하는 등 안전하지 못하거나 적대적으로 조작된 행동의 결과가 즉각적이고 현실적인 것입니다. 기존의 AI 안전성 연구는 모델 정렬과 입력 필터링에 초점을 맞추었지만, 에이전트의 의도가 실제 머신에서 실제 행동으로 변하는 순간에 이를 해결하지 못했습니다. 특히 로컬 환경에서 개발자가 에이전트를 자신의 파일 시스템, 자격 증명, 인프라에 실행하는 동안 런타임 제어가 거의 없기 때문에 이러한 결함은 특히 심각합니다. 이 논문은 로컬 AI 에이전트의 런타임 안전성과 관찰성 레이어인 AgentWall을 소개합니다. AgentWall은 에이전트의 제안된 행동을 호스트 환경에 도달하기 전에 모든 행동을 중계하고, 명시적 선언적 정책에 따라 평가하고, 민감한 작업에 대한 인간 승인을 요구하고, 감사 및 재생을 위한 완전한 실행 기록을 기록합니다. AgentWall은 정책 집행 MCP 프록시와 네이티브 OpenClaw 플러그인으로 구현되어 Claude Desktop, Cursor, Windsurf, Claude Code, OpenClaw와 같은 단일 설치 명령어로 작동합니다.