본문으로 건너뛰기

Agent 평가 차이: 기업 AI 조직은 실재 가치와 일치하는 문제가 아니라 커버리지 문제를 가지고 있으며 대부분은 생산 환경으로 배포하고 있습니다.

AI 자동 생성

인간이 AI 에게 더 많은 자율성을 부여하면서, 그에 대한 자율성을 평가하는 데 대한 신뢰를 줄여가고 있다. 157 개 기업을 대상으로 한 연구에 따르면, 절반의 기업은 내부 평가를 통과한 AI agent를 고객에게 배포한 후에 실패한 적이 있다. 현재 1/5 만이 자동 평가에 대한 신뢰를 가졌고, 가장 큰 약점은 평가가 실제 세계 결과와 일치하지 않는다는 것이다. 그러나 2/3 는 자동 평가만으로도 프로덕션에 agent 변경을 배포하도록 허용하거나, 그에 대한 엔지니어링을 진행 중이다. 결과적으로 평가 간격이 생기게 되는데, 이는 기업이 AI agent에 부여하는 자율성과 그에 대한 평가를 신뢰하는 정도의 간격을 의미한다. 이 연구는 기술 리더들이 agent 성능을 측정하는 방식을 조사한다. 그들은 어떤 신뢰성 및 평가 플랫폼을 사용하고, 그들을 선택하고 신뢰하는 방법, 프로덕션에서 어떤 문제가 발생하는지, 그리고 인간이 loop에 포함되지 않은 상태로 agent가 얼마나 далеко까지 작동할 수 있는지에 대한 내용을 포함한다. 중심적인 발견은 평가 간격이다. 이 간격은 기업이 AI agent에 부여하는 자율성과 그에 대한 평가를 신뢰하는 정도의 간격을 의미한다. 절반의 기업(50%)은 최근 1년 동안 내부 평가를 통과한 AI agent를 고객에게 배포한 후에 실패한 적이 있다. 또한 1/4 만이 이러한 실패를 여러 번 겪었다. 평가 자체에 대한 신뢰도 적으며, 5% 만이 자동 평가에 대한 신뢰를 가졌다. 가장 큰 약점은 평가가 실제 세계 결과와 일치하지 않는다는 것이다. 기업은 평가를 통과한 AI agent가 실제로 작동하는지 여부를 확인하기 위해 더 많은 노력을 기울이고 있다. 그러나 2/3 가 이미 낮은 위험성의 agent에 대해 자동 평가만으로도 프로덕션에 배포하도록 허용하거나, 그에 대한 엔지니어링을 진행 중이다. 평가 스택은 provider-native tooling에 의해 주도되고 있으며, provider-native tooling과 no dedicated tooling이 가장 많이 사용되고 있다. 프로덕션 모니터링은 uptime 및 cost를 모니터링하는 경우가 많으며, output quality를 모니터링하는 경우는 적다. 약 1/4 만이 실시간으로 output quality를 모니터링하고 있다. 기업은 자동 평가를 신뢰하기 위해 consistency를 중시하고 있다. 약 1/3 만이 evaluation consistency를 가장 중요한 성공 요소로 꼽고 있다. 투자는 observability 및 human review에 집중하고 있다. 약 26% 만이 human review workflows에 투자를 증가시키고 있다. 투자는 tooling reshuffle로 이어질 것으로 보인다. 약 64% 만이 새로운 evaluation platform을 도입하거나, 기존 platform을 교체할 계획이다.

원문 보기 VentureBeat AI

함께 읽으면 좋은 기사

에이전트 18시간 전

Meta의 영감은 OpenAI와 Anthropic에서 본격적으로 빛나는 AI를 훔쳤습니다.

AI 리더들이 OpenAI와 Anthropic에서 "선도 경계를 맞춰가기"라는 주제로 논의를 시작했을 때, 누군가는 "어느 속도로?"라는 질문을 해야 했을 수도 있었다. 이제는 두 회사가 모두 모델을 출시하는 모델 출시 주간이 되었는데, Anthropic이 Opus 5.5을 출시한 후 OpenAI가 GPT-6 모델 업데이트를 90분만에 출시했다. 그러나 스포트라이트를 잡은 것은 Meta 였는

에이전트 2일 전

강화 학습 기반 역할 놀이 에이전트의 역할 학습을 위한 적대적 폐쇄 루프 교육과정

역할 연기하는 agent는 대규모 언어 모델을 기반으로 한 것들이 개인화된 지원 및 사회 시뮬레이션과 같은 분야에서 광범위하게 적용되어 왔다. 최근 RL 방법들은 학습이 시작되기 전에 미리 수집한 고정된 시나리오 풀에서 훈련을 받는다. 이로 인해 분포적 병목 현상이 발생한다: agent가 향상될수록 agent가 나쁜 성능을 보이는 시나리오도 변하고, 훈련 분포는 정적이다. 따라서, 우리는 역

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.