본문으로 건너뛰기

권한 제한된 증거를 위한 부분 증거 벤치: 권한 제한된 증거를 위한 에이전트 시스템의 벤치마킹

AI 자동 생성

기업 에이전트는 점진적 검색 시스템, 위임된 워크플로우 및 정책 제약 증거 환경 내에서 점점 더 많이 작동하고 있다. 이러한 환경에서 접근 제어는 시스템이 호출자 권한 구간 외부에 있는 물리적 증거가 있더라도 완전한 답변을 생성하는 동안도 올바르게 적용될 수 있다. 이 논문은 Partial Evidence Bench라는 결정론적 벤치마크를 소개한다. 이 벤치마크는 72개의 태스크를 포함하는 3개의 시나리오 패밀리 - due diligence, compliance audit 및 security incident response -를 제공한다. 벤치마크는 ACL-분할된 코퍼스, 오라클 완전한 답변, 오라클 인증된 뷰 답변, 오라클 완전성 판단 및 구조화된 간격 보고 오라클을 제공한다. 벤치마크는 네 가지 표면 - 답변 정확성, 완전성 인식, 간격 보고 품질 및 위험한 완전성 행동 - 에 따라 시스템을 평가한다. 체크인 베이스 라인은 모든 배송 패밀리에서 침묵 필터링이 재앙적인 위험을 초래한다는 것을 보여주고, 명시적 실패-보고 동작은 위험한 완전성을 제거하는 동안 태스크를 단순한 참석으로 압축하지 않는다.

초기 실모델 실행 결과는 시스템이 완전성을 과대 선언, 보수적으로 과소 선언하거나 기업으로부터 사용할 수 있는 형태로 불완전성을 보고하는지 여부에 따라 모델 종속적이고 시나리오 민감한 차이가 있음을 보여준다. 벤치마크의 더 광범위한 기여는 인간 심사관이나 오염되기 쉬운 정적 코퍼스를 사용하지 않고 에이전트 실패를 측정할 수 있도록 한다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

에이전트 1일 전

장기 언어_AGENT의 중량 꼬리 메모리 트레이스

장기 예측 언어 agent는 점점 더 외부 메모리를 세계 모델로 고정시키며, 현재의 메모리 시스템은 일반적으로 작업 성공률이나 토큰 비용만으로 평가됩니다. 우리는 메모리 사용의 형태가 누락된 것이며, 한정된 맥락과 반복적인 검색에서 agent 메모리는 작은 핵심에 집중할 수 있으며, 예측 오류가 축적되는 드문 상태를 긴 꼬리에서 남겨둘 수 있음을 주장합니다. 우리는 이 효과를 보존된 꼬리 감

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.