본문으로 건너뛰기

해상도 감소-aware bandit 절단 기법을 위한 시각 및 언어 변환기

AI 자동 생성

Transformer 모델의 구조적 후 훈련 절삭을 위한 연구를 진행했다. 구조적 단위 선택을 위해 언어와 시각 전이 모델에서 손상이 발생하는 것을 고려한 다수의 무기로부터 얻은 문제를 고정된 후보 평가 비용을 고려하여 정의했다. 각각의 단위에 대한 평가를 위해 배치당 무시(mask)한 손실을 기준으로 무시된 손실과 원래 손실을 비교한다. 이와 같은 paired 손실을 통해 배치 간 변동성을 줄일 수 있다. 이러한 손실을 바탕으로 정책을 결정할 수 있는 보상을 만들고, 정책을 결정할 때 UCB-style 정책이나 fractional-Beta Thompson Sampling을 사용한다. 마스크를 생성할 때 단위 하나를 추가하여 단계적으로 마스크를 생성한다. 선택된 단위는 원본 밀집 체크포인트에서 기능적으로 0으로 초기화되므로, 보고된 매개변수 효과는 구조적 억제가 아닌 물리적 압축이나 측정된 속도 향상에 대한 것이 아니다. WikiText-2, LAMBADA, Imagenette 데이터셋을 사용하여 GPT-2, OPT, Pythia, Qwen2.5, SmolLM2, ViT-B/16, DeiT-Tiny, Swin-Tiny 모델을 비교했다. 랜덤, 크기, 정적 중요도, 비용을 고려한 Greedy 선택과 비교했을 때, 다수의 무기 문제를 고려한 정책이 대부분의 언어 모델 비교에서 비용을 고려한 Greedy보다 손상 감소율을 더 많이 나타냈다. 보고된 연구에서 28개의 비교 중 23개의 부트스트랩 신뢰 구간은 0을 포함하지 않았으며, 11개의 paired 테스트에서 p < 0.05, 6개의 테스트에서 q < 0.05를 나타냈다. ViT-B/16, Swin-Tiny 모델의 성능 향상은 단순히 더 큰 후보 평가 비용에 의해 설명되지 않는다는 것을 나타내는 matched-evaluation 결과가 나왔다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 23시간 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.