본문으로 건너뛰기

전문가급 업무 평가 도구 XpertBench: 전문가 기준 평가를 위한 새로운 접근 방식

대규모 언어 모델(LLM)의 성능이 기존 벤치마크에서 분명한 성장점을 보이지 않으면서, 전문가급 인지 능력을 특징으로 하는 개방형 업무의 평가에 대한 대중적인 문제가 남아 있습니다. 기존의 프레임워크는 좁은 도메인 커버리지, 일반적인 업무에 의존하거나 자체 평가 편향을 보입니다. XpertBench는 전문가급 도메인에서 대규모 언어 모델(LLM)의 능력을 평가하는 데 중점을 둔 새로운 벤치마크입니다.

AI 자동 생성

XpertBench: 전문가급 업무 평가 도구

XpertBench는 80개의 카테고리에서 1,346개의 세심하게 편집된 업무를 포함하는 대규모 언어 모델(LLM)의 능력을 평가하는 데 중점을 둔 새로운 벤치마크입니다. 이 업무는 금융, 의료, 법률 서비스, 교육, STEM 및 인문학의 이중 트랙 연구를 포함한 80개의 카테고리에서 수행됩니다. 이 업무는 엘리트 기관의 연구자 및 산업 경험의 풍부한 실무자들로부터 제출된 1,000개 이상의 제출을 기반으로 하며, 이로 인해 우수한 생태계 관련성과 전문가급 구체성을 제공합니다.

각 업무는 15-40개의 가중 체크포인트를 사용하는 세부적인 규칙을 포함하여 전문가급 엄격성을 평가합니다. 대규모 언어 모델(LLM)의 능력을 평가하기 위해 ShotJudge라는 새로운 평가 패러다임을 도입하여, 전문가의 몇 배샷 예시를 기반으로 자체 보상을 피하기 위해 대규모 언어 모델(LLM) 심판을 조정합니다.

현재 대규모 언어 모델(LLM)의 성능을 평가한 결과, 가장 우수한 모델이 66%의 성공률을 달성하며 평균 점수는 55%에 불과합니다. 또한 모델은 도메인별로 분산되며, 양적 사고력과 언어 합성의 강점이 겹치지 않는다는 것을 보여줍니다.

이 연구는 현재 AI 시스템에서 전문가급 간극이 존재함을 보여주고, 일반적인 보조기능에서 전문가급 협력자로의 전환을 지원하는 데 중요한 도구로 사용되는 XpertBench의 중요성을 강조합니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 1일 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.