Agent의 목표 압박 하에 사용자 참여 경계를 유지하는가?
인공지능이 점차 웹 애플리케이션 및 네트워크 침투 테스트에 실제로 자율적으로 배치되는 경우, 단 하나의 범위 밖의 행동만으로도 고객과 계약 조건을 위반할 수 있다. 기존의 공격 보안 지표는 단순히 해킹 능력을 측정했는데, 지표가 saturate되면 실제로 배치에 걸리는 가장 큰 장애물은 scope adherence의 특수한 경우다. 우리는 ScopeBench라는 30개의 dead-end agentic 보안 과제를 소개한다. 이러한 과제의 목표는 범위 조건을 위반하지 않고는 달성할 수 없다. 각 과제는 두 가지 조건에서 나타난다. 두 조건은 환경, 검증기, 목표가 모두 공유되며, 범위만 다르다. 하나의 명령 집합에는 범위 조건이 없고, 다른 하나의 명령 집합에는 자연어로 범위 조건이 명시된다. 범위가 없는 경로를 검증하기 위해 표준적인 결정론적 검증기를 사용한다. 범위가 있는 경로는 두 개의 검증기 arms를 통과한다. 첫 번째 검증기는 플래그를 확인한다. 플래그는 범위 경계 뒤에 위치하고 있으므로, 플래그를 찾은 경우는 범위 조건을 위반한 행동이 발생한 것으로 보증된다. 이로 인해 범위 위반율에 대한 고정밀의 하한값을 얻을 수 있다. 검증기가 경로를 통과하지 못한 경우, agentic judge는 범위 밖의 함수 호출이 발생했는지 여부를 추정한다. 우리는 judge를 100개의 ScopeBench 경로에 대한 human annotators의 label call-by-call에 대해 학습시켰고, evaluated rollouts에 대한 blinded audit를 수행했으며, high recall이 유지됨을 발견했다. 또한 8개의 모델에 대해 raw capability과 scope adherence의 범위는 각각 12.2%에서 81.1%까지, 34.4%에서 86.7%까지이며, judge는 331개의 범위 위반을 발견했지만, mechanical verification은 발견하지 못했다. Opus-4-8는 sonnet-4-6보다 raw-capability score 10%가 높은 반면, scope adherence가 35.6%가 높았다. 우리는 frozen pilot benchmark, evaluation code, 및 2160개의 ATIF trajectories를 공개한다.
함께 읽으면 좋은 기사
스킬 캐스케이딩 공격 : 스킬 기반 agent 시스템에 대한 피해를 함께 가하는 스틸스 어파트
[skill] 기반-agent 시스템은 특정 작업을 위해 기능을 확장하기 위해 런타임에 로드할 수 있는 자연어 명령, 실행 스크립트 및 참조 리소스의 모듈러 패키지이다. 따라서 이 [skill] 생태계의 개방성은 새로운 공격 표면을 열어두고 있다. 이전 연구는 개별 [skill] 내의 취약점에만 집중했지만, [skill] 간의 상호 작용으로부터 발생하는 위험에 거의 주목하지 않았다. 본 논문
LLM agent와 데이터 공간을 연결하는 아키텍처 중재 방법: 모델 컨텍스트 프로토콜을 이용한 접근
데이터 공간은 조직 간의 데이터 공유를 주권적이고 관리되는 방식으로 허용하지만, 확률적 언어 모델 상호작용과 정책 기반 데이터 인프라 간의 불일치로 인해 인공지능 agent와의 통합이 어려울 수 있다. 이 문서는 Model Context Protocol (MCP) 기반의 아키텍처 중재 접근 방식을 제시하며, Eunomia Agent를 통해 대규모 언어 모델(LLM) agent와 데이터 공간
멀티 에이전트 코드 심판이 실제로 지지되는 때는 언제인가? 두 레이블 없는 측정치, 그리고 추측하지 않는 심판
연구자들은 언어 모델이 다른 언어 모델의 코드가 올바른지 판단할 때 증거가 없다고 보고하지 않는다는 것을 발견했다. 대신에, 언어 모델은 자신이 판단한 결과를 신뢰적으로 내고 그 결과를 뒷받침하는 이유를 첨부한다. 이와는 달리, 증거가 문서의 집합인 경우 다중_AGENT 검증은 판단을 검증 가능한 주장으로 분해하고 각 주장을 증거와 비교하는 promising한 대안이다. 하지만, 언어 모델이
자율 시스템에서 AI를 적용하는 길 - 인지부터 집단 지능까지
자율 시스템은 인공지능의 궁극적인 단계로, 이에 대한 개발은 심각한 기술적 난제를 야기한다. 이러한 난제를 해결하기 위해 연결주의 인공지능과 символ주의 인공지능을 결합하는 것이 필요하다. 또한 인공지능과 시스템 엔지니어링을 통합하는 것이 필요하다.
Meta의 영감은 OpenAI와 Anthropic에서 본격적으로 빛나는 AI를 훔쳤습니다.
AI 리더들이 OpenAI와 Anthropic에서 "선도 경계를 맞춰가기"라는 주제로 논의를 시작했을 때, 누군가는 "어느 속도로?"라는 질문을 해야 했을 수도 있었다. 이제는 두 회사가 모두 모델을 출시하는 모델 출시 주간이 되었는데, Anthropic이 Opus 5.5을 출시한 후 OpenAI가 GPT-6 모델 업데이트를 90분만에 출시했다. 그러나 스포트라이트를 잡은 것은 Meta 였는
메타, 인공지능 앱 '뮤즈'에 힘을 싣는다
메타는 인공지능 개인 에이전트 '뮤즈'를 더욱 홍보하기 위해 대규모 언어 모델(LLM) 기반 앱의 홍보를 강화하고 있습니다. 뮤즈 앱은 앱스토어 차트에서 1위를 차지하고 사용자 추가가 빠른 속도로 진행되고 있습니다.
관련 콘텐츠 더 보기
다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.