권한 제한된 증거를 위한 부분 증거 벤치: 권한 제한된 증거를 위한 에이전트 시스템의 벤치마킹
기업 에이전트는 점진적 검색 시스템, 위임된 워크플로우 및 정책 제약 증거 환경 내에서 점점 더 많이 작동하고 있다. 이러한 환경에서 접근 제어는 시스템이 호출자 권한 구간 외부에 있는 물리적 증거가 있더라도 완전한 답변을 생성하는 동안도 올바르게 적용될 수 있다. 이 논문은 Partial Evidence Bench라는 결정론적 벤치마크를 소개한다. 이 벤치마크는 72개의 태스크를 포함하는 3개의 시나리오 패밀리 - due diligence, compliance audit 및 security incident response -를 제공한다. 벤치마크는 ACL-분할된 코퍼스, 오라클 완전한 답변, 오라클 인증된 뷰 답변, 오라클 완전성 판단 및 구조화된 간격 보고 오라클을 제공한다. 벤치마크는 네 가지 표면 - 답변 정확성, 완전성 인식, 간격 보고 품질 및 위험한 완전성 행동 - 에 따라 시스템을 평가한다. 체크인 베이스 라인은 모든 배송 패밀리에서 침묵 필터링이 재앙적인 위험을 초래한다는 것을 보여주고, 명시적 실패-보고 동작은 위험한 완전성을 제거하는 동안 태스크를 단순한 참석으로 압축하지 않는다.
초기 실모델 실행 결과는 시스템이 완전성을 과대 선언, 보수적으로 과소 선언하거나 기업으로부터 사용할 수 있는 형태로 불완전성을 보고하는지 여부에 따라 모델 종속적이고 시나리오 민감한 차이가 있음을 보여준다. 벤치마크의 더 광범위한 기여는 인간 심사관이나 오염되기 쉬운 정적 코퍼스를 사용하지 않고 에이전트 실패를 측정할 수 있도록 한다.
함께 읽으면 좋은 기사
오픈에이아이의 Dot agent는 기업용 소프트웨어로 식사 주문까지 가능하다
오픈아이의 새로운 agent 플랫폼인 Dots는 귀여운 작은 친구들이 많아 주문에 따라 행동하는 모습을 보여줍니다. 그러나 메타 뮤즈 같은 친숙한 느낌보다는, Dots는 사용자가 일을 처리하는 도구에 부가 기능으로 음식을 주문할 수 있는 기능을 제공하는 것처럼 느껴집니다.
쇼피프가 선보인 캔버스, AI와 대화하며 온라인 매장을 만드는 방법
쇼피프의 새로운 캔버스(Canvas) 사이트 빌더는 판매자들이 AI agent인 사이드 킥(Sidekick)과 대화하며 온라인 상점을 만들고 커스터마이징할 수 있게 해줍니다. 이 과정을 실시간으로 보면서 진행할 수 있습니다.
에어비앤비의 차세대 운영 체제: 인공지능 agent의 자율성 필요하다
에어비앤비 창업자 브라이언 체스키(Brian Chesky)는 인공지능 agent를 위해 자체 운영 체제가 필요하다고 말합니다. 그는 또한 소비자 인공지능의 현재 상태와 인공지능이 가진 잠재력을 강조합니다.
오픈아이, 메타와 경쟁하기 위해 '도트'를 출시하다
오픈아이가 메타의 마인드(Muse) AI agent 플랫폼에 도전하기 위해 '도트(Dots)'라는 새로운 agent를 출시했다. 이 agent는 GPT-6 Astra를 기반으로 하고 있으며, 메타의 마인드 플랫폼의 성공에 도전한다.
장기 언어_AGENT의 중량 꼬리 메모리 트레이스
장기 예측 언어 agent는 점점 더 외부 메모리를 세계 모델로 고정시키며, 현재의 메모리 시스템은 일반적으로 작업 성공률이나 토큰 비용만으로 평가됩니다. 우리는 메모리 사용의 형태가 누락된 것이며, 한정된 맥락과 반복적인 검색에서 agent 메모리는 작은 핵심에 집중할 수 있으며, 예측 오류가 축적되는 드문 상태를 긴 꼬리에서 남겨둘 수 있음을 주장합니다. 우리는 이 효과를 보존된 꼬리 감
메타, 뮤즈가 사용자의 사생활 메시지를 읽었다는 주장에 반박한다
메타는 뮤즈 AI agent가 사용자의 사생활 메시지를 읽는 것을 허용하지 않는다고 밝혔다. 뮤즈는 사용자의 사생활 메시지를 읽었을 가능성이 있다. 하지만 사용자가 Mac의 특정 설정을 끄지 않았다면.
관련 콘텐츠 더 보기
다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.