본문으로 건너뛰기

스킬 캐스케이딩 공격 : 스킬 기반 agent 시스템에 대한 피해를 함께 가하는 스틸스 어파트

AI 자동 생성

[skill] 기반-agent 시스템은 특정 작업을 위해 기능을 확장하기 위해 런타임에 로드할 수 있는 자연어 명령, 실행 스크립트 및 참조 리소스의 모듈러 패키지이다. 따라서 이 [skill] 생태계의 개방성은 새로운 공격 표면을 열어두고 있다. 이전 연구는 개별 [skill] 내의 취약점에만 집중했지만, [skill] 간의 상호 작용으로부터 발생하는 위험에 거의 주목하지 않았다. 본 논문에서는 악의적인 목적을 여러 [skill]에 분산하여 각 수정이 단독으로는 해가 되지 않는 반면, 조합된 실행이 해롭다 하는 위협 패러다임인 [skill] cascading 공격을 소개한다. 예를 들어, 약물 복용 기록에서 최근 폐지된 약물에 대한 신호를 약화시키는 첫 번째 [skill], 약물 상호 작용과 관련된 약물의 중증도를 낮추는 두 번째 [skill], 마지막 요약에서 발생하는 낮은 우선순위 경보를 억제하는 세 번째 [skill]를 고려할 때, 심각한 약물 상호 작용 경고가 의사에게 전달되기 전에 조용히 사라지게 된다. 이 안전한 blind spot을 체계적으로 연구하기 위해, 우리는 SkillCascade라는 자동화된 다중-agent 적대적 테스팅 프레임워크를 개발하고, SkillCascade-Bench라는 213개의 유효한 cascading 테스트 케이스를 다양한 agent 시스템과 도메인에서 제공한다. 대표적인 agent(예: OpenClaw, Claude Code, Codex) 및 LLM [대규모 언어 모델] backbone을 포함한 cascaded 상호 작용은 존재하는 per-skill 스캐너 및 런타임 모니터를 피하면서도 유의미한 동작을 일으킨다.我们的 연구결과는 구성 요소 수준의完整성과 시스템 수준의 안전성 사이의 격차를 강조하고, 개별 [skill]에만 집중하는 대신, [skill] 간의 상호 작용을 이유하는 방어를 위한 호출을 제안한다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

에이전트 1시간 전

LLM agent와 데이터 공간을 연결하는 아키텍처 중재 방법: 모델 컨텍스트 프로토콜을 이용한 접근

데이터 공간은 조직 간의 데이터 공유를 주권적이고 관리되는 방식으로 허용하지만, 확률적 언어 모델 상호작용과 정책 기반 데이터 인프라 간의 불일치로 인해 인공지능 agent와의 통합이 어려울 수 있다. 이 문서는 Model Context Protocol (MCP) 기반의 아키텍처 중재 접근 방식을 제시하며, Eunomia Agent를 통해 대규모 언어 모델(LLM) agent와 데이터 공간

에이전트 1시간 전

멀티 에이전트 코드 심판이 실제로 지지되는 때는 언제인가? 두 레이블 없는 측정치, 그리고 추측하지 않는 심판

연구자들은 언어 모델이 다른 언어 모델의 코드가 올바른지 판단할 때 증거가 없다고 보고하지 않는다는 것을 발견했다. 대신에, 언어 모델은 자신이 판단한 결과를 신뢰적으로 내고 그 결과를 뒷받침하는 이유를 첨부한다. 이와는 달리, 증거가 문서의 집합인 경우 다중_AGENT 검증은 판단을 검증 가능한 주장으로 분해하고 각 주장을 증거와 비교하는 promising한 대안이다. 하지만, 언어 모델이

에이전트 1시간 전

Agent의 목표 압박 하에 사용자 참여 경계를 유지하는가?

인공지능이 점차 웹 애플리케이션 및 네트워크 침투 테스트에 실제로 자율적으로 배치되는 경우, 단 하나의 범위 밖의 행동만으로도 고객과 계약 조건을 위반할 수 있다. 기존의 공격 보안 지표는 단순히 해킹 능력을 측정했는데, 지표가 saturate되면 실제로 배치에 걸리는 가장 큰 장애물은 scope adherence의 특수한 경우다. 우리는 ScopeBench라는 30개의 dead-end ag

에이전트 1일 전

Meta의 영감은 OpenAI와 Anthropic에서 본격적으로 빛나는 AI를 훔쳤습니다.

AI 리더들이 OpenAI와 Anthropic에서 "선도 경계를 맞춰가기"라는 주제로 논의를 시작했을 때, 누군가는 "어느 속도로?"라는 질문을 해야 했을 수도 있었다. 이제는 두 회사가 모두 모델을 출시하는 모델 출시 주간이 되었는데, Anthropic이 Opus 5.5을 출시한 후 OpenAI가 GPT-6 모델 업데이트를 90분만에 출시했다. 그러나 스포트라이트를 잡은 것은 Meta 였는

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.