본문으로 건너뛰기

작업대시보드: 인간의 의지와 일치하는 agent

작업대시보드(JobBench)는 전문가들이 우선순위로 위임하기로 결정한 업무 흐름을 평가하는 새로운 지표입니다. 이는 GDP 가치 대신 인간의 필요에 따라 인간을 대체하는 대신 강화하는 방식으로 AI agent를 평가하는 것입니다.

AI 자동 생성

현재의 AI agent 평가 지표는 주로 경제적 가치에 기반을 두어 대체의 이야기를 전달하고 있습니다. 그러나 인간의 필요에 따라 인간을 대체하는 대신 강화하는 방식으로 AI agent를 평가하는 새로운 지표가 필요합니다. 작업대시보드(JobBench)는 이러한 목표를 달성하기 위해 개발되었습니다.

  • 작업대시보드는 전문가들이 우선순위로 위임하기로 결정한 업무 흐름을 평가합니다.
  • 작업대시보드는 130 가지의 agent적 작업을 35 가지의 직업에 걸쳐 다룹니다.
  • 각 작업은 혼합된 참조 파일의 작업 공간으로 구성되어 있으며, agent는 실제 전문가의 작업에 있는 복잡한 정보 스트림을 통과하여 추론해야 합니다.
  • 출력은 사실에 근거한 체인 형태의 규칙으로 평가됩니다. 각 작업에는 평균적으로 35.6 개의 이진 기준이 있습니다.
  • 작업대시보드는 36 가지의 모델을 평가했습니다. 가장 강력한 모델인 Claude Opus~4.7은 Claude Code에서 45.9% 의 성능을 보여주었습니다.
  • 작업대시보드는 AI community의 목표를 대체의 효과에서 강화의 효과로 전환하는 것을 목표로 합니다. 이는 인간이 실제로 위임하고 싶은 작업을 수행하는 agent를 개발하는 것을 의미합니다.
원문 보기 arXiv AI

함께 읽으면 좋은 기사

에이전트 17시간 전

Meta의 영감은 OpenAI와 Anthropic에서 본격적으로 빛나는 AI를 훔쳤습니다.

AI 리더들이 OpenAI와 Anthropic에서 "선도 경계를 맞춰가기"라는 주제로 논의를 시작했을 때, 누군가는 "어느 속도로?"라는 질문을 해야 했을 수도 있었다. 이제는 두 회사가 모두 모델을 출시하는 모델 출시 주간이 되었는데, Anthropic이 Opus 5.5을 출시한 후 OpenAI가 GPT-6 모델 업데이트를 90분만에 출시했다. 그러나 스포트라이트를 잡은 것은 Meta 였는

에이전트 2일 전

강화 학습 기반 역할 놀이 에이전트의 역할 학습을 위한 적대적 폐쇄 루프 교육과정

역할 연기하는 agent는 대규모 언어 모델을 기반으로 한 것들이 개인화된 지원 및 사회 시뮬레이션과 같은 분야에서 광범위하게 적용되어 왔다. 최근 RL 방법들은 학습이 시작되기 전에 미리 수집한 고정된 시나리오 풀에서 훈련을 받는다. 이로 인해 분포적 병목 현상이 발생한다: agent가 향상될수록 agent가 나쁜 성능을 보이는 시나리오도 변하고, 훈련 분포는 정적이다. 따라서, 우리는 역

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.