본문으로 건너뛰기

대화형 에이전트의 다차원 평가를 위한 운영화: 선택적 재평가 및 모델 벤치마크를 포함한 규제된 확장 가능한 pipe라인

AI 자동 생성

retail 대화 요원 평가를 위해 단순한 단어 일치 지표 외에 의도 일치, 사실성, 도움, 명확성, ton, 및 전체 응답 품질을 평가하는 방법이 필요합니다. LLM-as-a-judge 방법은 인간 평가에 대한 대규모 대안을 제공하지만, 생산 배포는 통치, 재현성, 비용, 스키마 일관성, 추적성, 및 신뢰성과 같은 문제를 제기합니다. 우리는 GenAI Evaluation, 대규모 retial 대화 요원 평가를 위한 규제된, 구성 요소에 따라 pipeline을 제시합니다. 이는 스키마에 제약된 LLM 점수를 포함하여 프로덕션 챗봇 로그를 정규화, 샤딩, 비동기 실행, 및 스키마 제약으로 처리합니다. 이 프레임워크는 도움, 진실성, 명확성, ton 일치, 및 번역 특정 차원을 평가합니다. 선택적인 재평가에서는만이 불완전, 형식 오류, 또는 스키마 무효한 레코드만을 처리합니다. 스키마 잠금, 버전화된 구성, 검증 로그, 및 레코드 단위 증명은 감사성의 지지합니다. 이 프레임워크는 매일 약 50,000 레코드를 처리하고 2백만 대화 이상을 평가했습니다. 검증은 4명의 훈련된 어노테이터로부터 12,980 계층적-random 인간 레이블 레코드를 사용했습니다. 분류는 14개의 의도, 156개의 하위 의도, 18개의 주요 도메인, 및 129개의 하위 도메인을 포함했습니다. pipeline은 macro F1 점수가 0.93이고 번역에 대한 인간 수용도 정확도가 89%를 달성했습니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 1일 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.