본문으로 건너뛰기

검증된 테스트 시간 계산 할당: 동적 데모를 통해 진화하는 정답 컨텍스트

테스트 시간 계산을 확대하면 모델 성능을 크게 향상시킬 수 있지만, 기존 접근법은 정적 계산 할당 또는 고정 생성 분포에서 샘플링에 의존합니다. 이 연구에서는 계산을 어디에 할당하고 생성을 어떻게 수행할지 동시에 적응하는 테스트 시간 계산 할당 프레임워크를 소개합니다.

AI 자동 생성

테스트 시간 계산 할당 프레임워크

이 연구에서는 테스트 시간 계산 할당 프레임워크를 소개합니다. 이 프레임워크는 계산을 어디에 할당하고 생성을 어떻게 수행할지 동시에 적응합니다. 프레임워크는 첫 번째 단계로 쉽게 해결할 수 있는 질문을 식별하고 테스트 세트 자체에서 초기 질문-응답 쌍을 모으는 워밍업 단계를 시작합니다. 다음으로 적응 단계가 진행되며, 아직 해결되지 않은 질문에 대해 추가 계산을 집중시키고, 생성 분포를 진화하는 데모를 통해 조건화합니다. 데모는 성공적으로 응답한 관련된 질문에 비례하여 생성을 조건화합니다.

실험 결과

이 연구에서는 수학, 프로그래밍, 논리적 추론에 대한 벤치마크를 통해 프레임워크의 성능을 평가했습니다. 실험 결과, 프레임워크는 기존의 베이스라인보다 성능이 우수하고, 인퍼런스 시간 계산을 크게 절약했습니다.

개요

이 연구에서는 테스트 시간 계산 할당 프레임워크를 소개합니다. 프레임워크는 계산을 어디에 할당하고 생성을 어떻게 수행할지 동시에 적응합니다. 프레임워크는 워밍업 단계와 적응 단계로 구성됩니다. 워밍업 단계에서는 쉽게 해결할 수 있는 질문을 식별하고 테스트 세트 자체에서 초기 질문-응답 쌍을 모으고, 적응 단계에서는 아직 해결되지 않은 질문에 대해 추가 계산을 집중시키고, 생성 분포를 진화하는 데모를 통해 조건화합니다.

벤치마크

이 연구에서는 수학, 프로그래밍, 논리적 추론에 대한 벤치마크를 사용했습니다. 벤치마크는 모델의 성능을 평가하기 위해 사용됩니다.

결론

이 연구에서는 테스트 시간 계산 할당 프레임워크를 소개하고, 프레임워크의 성능을 평가했습니다. 프레임워크는 기존의 베이스라인보다 성능이 우수하고, 인퍼런스 시간 계산을 크게 절약했습니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 1일 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.