본문으로 건너뛰기

에이전트 안전 판단 향상 : 조절 된 벤치마크 재 작성 및 배포 외의 속임수 시나리오에 대한 아날로그 이유

인공지능 요소의 안전한 판단을 높이기 위한 연구: 제어된 벤치마크 재작성 및 유사성 논리 reasoning을 통한 분포 이탈 시의 속임수 시나리오 arXiv:2605.03242v1 발표 유형: 새로운 요약: 대규모 언어 모델(LLM)로 güç을 받는 도구 사용 인공지능 시스템은 웹, 앱, 운영 체제 및 거래 환경에서 점점 더 많이 배포되고 있습니다. 그러나 현재의 안전 벤치마크는 명시적 위험에 중점을 두고 있으므로 모델이 속임수 또는 모호한 경로를 판단할 수 있는 능력을 과대평가할 수 있습니다.

AI 자동 생성

Enhancing Agent Safety Judgment: Controlled Benchmark Rewriting and Analogical Reasoning for Deceptive Out-of-Distribution Scenarios

인공지능 요소의 안전한 판단을 높이기 위한 연구: 제어된 벤치마크 재작성 및 유사성 논리 reasoning을 통한 분포 이탈 시의 속임수 시나리오 arXiv:2605.03242v1 발표 유형: 새로운 요약: 대규모 언어 모델(LLM)로 güç을 받는 도구 사용 인공지능 시스템은 웹, 앱, 운영 체제 및 거래 환경에서 점점 더 많이 배포되고 있습니다. 그러나 현재의 안전 벤치마크는 명시적 위험에 중점을 두고 있으므로 모델이 속임수 또는 모호한 경로를 판단할 수 있는 능력을 과대평가할 수 있습니다. 이 차이를 해결하기 위해 우리는 ROME(Red-team Orchestrated Multi-agent Evolution, 레드 팀 조직된 다중 에이전트 진화)을 소개합니다. ROME은 알려진 위험 경로를 재작성하여 평가 인스턴스를 더 속임수화 하면서 위험 레이블을 유지하는 제어된 벤치마크 생성 파이프라인입니다. 100개의 위험한 원본 경로에서 시작하여 ROME은 상황 간의 모호성, 암묵적 위험 및 단축 결정을 포함한 300개의 도전 인스턴스를 생성합니다. 실험 결과, 이러한 도전 세트는 안전한 판단 성능을 크게 감소시키며, 은닉 위험 사례는 최근 프론티어 모델조차도 특히 비트리할 수 없는 사례입니다. 또한 우리는 ARISE(Analogical Reasoning for Inference-time Safety Enhancement, 유사성 논리 reasoning을 통한 추론 시간 안전 향상)을 연구합니다. ARISE은 외부 유사성 베이스에서 ReAct-style 유사성 안전 경로를 검색하여 구조화된 논리적 예시로 삽입하는 검색 지시된 추론 시간 향상입니다. ARISE은 재학습 없이 판단 품질을 향상시킵니다. 그러나 ARISE은 독립적인 안전 보장보다는 특정 과제에 대한 강도 향상으로 보아야 합니다. ROME과 ARISE은 속임수 분포 이동 시 인공지능 요소의 안전한 판단을 테스트하고 향상하는 실용적인 도구를 제공합니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

에이전트 20시간 전

Meta의 영감은 OpenAI와 Anthropic에서 본격적으로 빛나는 AI를 훔쳤습니다.

AI 리더들이 OpenAI와 Anthropic에서 "선도 경계를 맞춰가기"라는 주제로 논의를 시작했을 때, 누군가는 "어느 속도로?"라는 질문을 해야 했을 수도 있었다. 이제는 두 회사가 모두 모델을 출시하는 모델 출시 주간이 되었는데, Anthropic이 Opus 5.5을 출시한 후 OpenAI가 GPT-6 모델 업데이트를 90분만에 출시했다. 그러나 스포트라이트를 잡은 것은 Meta 였는

에이전트 2일 전

강화 학습 기반 역할 놀이 에이전트의 역할 학습을 위한 적대적 폐쇄 루프 교육과정

역할 연기하는 agent는 대규모 언어 모델을 기반으로 한 것들이 개인화된 지원 및 사회 시뮬레이션과 같은 분야에서 광범위하게 적용되어 왔다. 최근 RL 방법들은 학습이 시작되기 전에 미리 수집한 고정된 시나리오 풀에서 훈련을 받는다. 이로 인해 분포적 병목 현상이 발생한다: agent가 향상될수록 agent가 나쁜 성능을 보이는 시나리오도 변하고, 훈련 분포는 정적이다. 따라서, 우리는 역

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.