본문으로 건너뛰기

鏡中的공격자: 안정된 이중 역할 자극을 통해 안전성을 깨는 방법

AI 안전성을 향상시키기 위한 자극된 팀(self-play) 접근법에서, 동일한 모델의 다양한 인스턴스가 공격자와 방어자 역할을 하며, 0-1 게임에서 공격자가 방어자를 탈옥시키려고 시도하는 경우, 자극된 팀이 Nash 평형에 수렴할 경우, 모델은 게임 설정 내에서 안전하게 반응할 수 있다. 그러나 동일한 모델을 사용하여 두 역할을 강제하는 파라미터 공유는 안정성과 성능을 향상시키지만, 이론적 및 아키텍처적 한계를 초래한다.

AI 자동 생성

안정된 이중 역할 자극을 통해 안전성을 깨는 방법

자극된 팀(self-play) 접근법은 AI 안전성을 향상시키기 위한 전통적인 방법 중 하나이다. 동일한 모델의 다양한 인스턴스가 공격자와 방어자 역할을 하며, 0-1 게임에서 공격자가 방어자를 탈옥시키려고 시도하는 경우, 자극된 팀이 Nash 평형에 수렴할 경우, 모델은 게임 설정 내에서 안전하게 반응할 수 있다. 그러나 동일한 모델을 사용하여 두 역할을 강제하는 파라미터 공유는 안정성과 성능을 향상시키지만, 이론적 및 아키텍처적 한계를 초래한다.

우리는 Nash 평형이 달성할 수 있는 집합이 넓은 범위의 동작을 포함하는 broad class of behaviours를 포함한다는 것을 보여주며, 이는 실제 적용성에 제한을 가한다. 또한 공격자와 방어자가 같은 베이스 모델을 공유하고 업데이트할 때, 동적이 자체 일관성을 도출한다는 것을 보여주며, 이로 인해 공격자는 방어자에 대한 적대적 압력을 미치지 못한다.

이에 대한 대안으로, 우리는 고정된 베이스 모델 위에 distinct role-specific LoRA 어댑터를 훈련하여 안정적인 최적화를 유지하면서, 역할 분리를 통해 명시적으로 적대적 압력을 유지하는 Anchored Bipolicy Self-Play를 제안한다. 이는 스탠다드 자극된 팀에 비해 up to 100x 더 큰 파라미터 효율성을 달성하고, 자극된 팀 훈련 모델에 비해 일관된 안전성 향상을 보여준다.

우리는 Qwen2.5-{3B, 7B,14B}-IT 모델을 사용하여 널리 사용되는 안전성 벤치마크를 평가하여, 안전성 향상과 사유 능력 손실 없이 robustness를 향상시킨다. 교차 자극 실험을 통해, 우리의 공격자와 방어자 모델은 자극된 팀에 비해 적대적 방어 및 안전성에서 우수하다는 것을 보여준다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 23시간 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.