긴 시간 범위의 에이전트 워크플로우에서 유도된 위임의 벤치마크: DecisionBench
DecisionBench는 긴 시간 범위의 에이전트 워크플로우에서 유도된 위임의 벤치마크이다. DecisionBench는 작업 집합(GAIA, tau-bench, BFCL multi-turn), 동료 모델 풀(11 모델, 7 벤더 가족), 위임 인터페이스(call_model와 읽기 프로파일 채널의 옵션), 결정론적 스킬-ANNOTATION 레이어, 품질, 비용, 지연 시간, 위임률, 라우팅 신뢰도-at-k, 벤더 자체 선호도, 그리고 카운터팩토럴 위임 천장으로 구성된 다중 축 메트릭 스위트를 포함