에이전트 7월 21일
플랜 플립: 멀티 에이전트 LLM 시스템 공격하기
멀티 에이전트 LLM 시스템이 계획 단계를 통해 목표를 분해하고, 이하의 이행자와 심사자 에이전트가 실행하고 감사하는 데 의존하는 것을 발견했습니다. 계획 단계는 공격 표면으로 인식되었으며, 계획자에 대한 단일 입력을 통해 동시적으로 모든 하위 작업이 부패되었습니다. 우리는 플랜 플립을 제시했습니다. 플랜 플립은 4 가지 계획 단계 지시어 삽입 공격을 포함합니다. - 목표 대체 (PF-1), 우선순위 반전 (PF-2), 맥락 오염 (PF-3), 역할 혼란 (PF-4) - 각은 의도적으로 키워드 필터를 회피하기 위해 합리적인 도구 출력으로 위장되었습니다. 우리는 9 개의 선도적인 LLM을 3,479 회의 에피소드에 걸쳐 평가했습니다. 우리는 세 가지 발견을 확인했습니다: (1) 능력은 취약성을 증폭시킵니다 - GPT-5는 가장 높은 공격 성공률 (ASR = 0.68)을 달성했습니다. 이는 더 강력한 모델이 자체적으로 더 안전하다는 가정에 반하는 것입니다; (2) 유사한 pipeline은 연관된 에이전트의 무시를 보여줍니다 - GPT-4o와 Llama-3.3-70B는 ASR가 근소한 차이로 0에 근접하지만 Stealth = 1.00과 StepShift > 0을 보였습니다. 공격은 계획을 재구성했지만 동일한 백본 Critic은 동의를 보고했습니다 (2 개의 independent judge가 -0.20에서 -0.32의 의미적 편차를 확인했습니다, r = 0.943); (3) 논리 증강 모델은 삽입 공격에 저항합니다 - DeepSeek-R1는 모든 공격에 대해 StepShift = 0.00을 달성했습니다. 우리는 GoalAnchorCheck (D1)과 CrossAgentConsensus (D2)를 제안했습니다. 이 두 가지 검출 기법은 1.00까지의 검출률을 달성하고, 16 개의 셀 중 15 개에서 동일한 백본 baseline보다 우수했습니다.我们的 핵심 발견: 다양한 모델 다양성은 멀티 에이전트 시스템의 보안 요구 사항입니다. 유사한 백본 내의 중복성은 계획 단계 공격에 대한 보호를 제공하지 않습니다.