전략적 공격 선택이 주관적 인공지능 제어 평가에서 안전성을 현실적으로 감소시킨다.
공격자가 전략적으로 공격할 때를 선택하는 공격자는 무작위로 공격하는 공격자보다 훨씬 더 어려운 경우를 잡을 수 있다. AI 제어는 미래에 쓸 수 있는 AI agent를 신뢰할 수 없는 weaker monitor와 한정된 human audit 예산의 감독하에 배포하는 안전 프레임워크이다. 제어 평가는 이러한 프로토콜을 검증하기 위해 red-team 공격 정책을 blue-team monitor와