본문으로 건너뛰기

오류의 가치가 다르다: 결과에 대한 인식이 있는 논리적 계산 자원 할당

AI 자동 생성

현대적인 논리 모델은 테스트 시간 동안의 계산량을 다양한 양으로 할당할 수 있습니다. 예를 들어, 생각 토큰, 모델 호출, 또는 컴퓨트 비용을 다른 작업에 할당할 수 있습니다. 기존의 방법들은 이러한 할당을 예측한 난이도에 따라 수행하며, 더 높은 정확도를 얻기 위해 더 많은 컴퓨트를 할당합니다. 이 방법은 모든 실패가 동일한 비용을 지불하는 것을 암시합니다. 그러나 이러한 가정은 실제로 배포 환경에서 유지되지 않습니다. 예를 들어, 로그 메시지에 있는 오타와 프로덕션 데이터베이스를 손상시키는 마이그레이션은 모두 하나의 벤치마크 실패로 간주되지만, 실제로 그들의 실세계 비용은 근본적으로 다릅니다. 이 간격을 메우기 위해, 우리는 결과가 의도된 난이도에만 의존하는 대신에, 우리는 오류로 해결되지 않는 경우에 작업이 얼마나 비용이 많이 들지 않을지 예측하는 경량 프로디서를 사용합니다. 이후, 스케줄러는 동일한 총 비용 하에서 더 큰 컴퓨트 티어 또는 더 큰 생각 비용을 할당받은 더 큰 결과 비용을 가진 작업을 라우팅합니다. 우리는 SWE-bench Lite에 대한 주요 실험을 수행하고, Multi-SWE-bench mini에서 700개의 소프트웨어 엔지니어링 작업을 포함하여 교차 데이터 집합 동작을 평가합니다. 우리의 결과는 다양한 어노테이션에서 결과와 난이도가 거의 직각선에 해당한다는 것을 보여주고, 현재의 생각 모델은 결과에 따라 컴퓨트를 충분히 할당하지 않는다는 것을 보여줍니다. 또한, 우리의 이슈만 프로디서는 300개의 SWE-bench 작업 중에서 결과 비용이 높은 작업을 결과 비용이 낮은 작업으로 오류로 인식하지 않습니다. 일치하는 컴퓨트 비용 하에서, 우리의 결과 비용에 대한 스케줄러는 난이도에 의한 라우팅에 비해 비용을 가중치로 22%에서 33%까지 줄입니다. 특히, 작업별 비용을 마진 유용성 신호로 스케일링 한 우선 순위에 대한 변형은 30%를 넘기고, 이 배포 가능한 프로디서 기반 버전은 오라클 이익의 90%를 유지합니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 1일 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.