본문으로 건너뛰기

Attention-Aware 라우팅: MoEs에서 라우팅과 주의를 결합하는 방법

Mixture-of-Experts 언어 모델에서 일반적으로 라우터는 토큰의隐藏 상태를 이용하여 EXPERT를 선택하고 중복을 줄이기 위해 EXPERT를 중복하여 사용합니다. 하지만 이 방법은 토큰의 현재 상태에만 의존하여 제한된 문맥 정보만을 사용합니다. 우리는 라우터에 시간적 및 스펙트럴 특징을 추가하여 Attention-Aware Routing (AAR)을 제안합니다. AAR은 모델의 문

AI 자동 생성

라우팅과 주의의 결합

대규모 언어 모델(LLM)에서 Mixture-of-Experts 언어 모델은 일반적으로 라우터를 이용하여 토큰의 숨겨진 상태를 기반으로 EXPERT를 선택합니다. 그러나 이 방법은 토큰의 현재 상태에만 의존하여 제한된 문맥 정보만을 사용합니다. 이를 해결하기 위해 Attention-Aware Routing (AAR)을 제안하였습니다. AAR은 라우터에 시간적 및 스펙트럴 특징을 추가하여 모델의 문맥 상태를 숨겨진 상태와 분리합니다.

AAR은 슬라이딩 윈도우 내의 주의 비중을 추출하여 라우터를 갱신합니다. 또한 기본 트랜스포머를 완전히 고정하고 라우팅 파라미터만 학습하여 라우팅을 단일 변수로 분리합니다. 이로써 라우팅과 주의가 서로 결합되어 모델의 성능을 향상시킵니다.

성능 향상과 라우팅의 영향

AAR은 GSM8K에 OLMoE에서 라우팅만 사용하는 SFT 기준점보다 성능을 향상시킵니다. 또한 라우팅과 주의는_coupled circuit_를 형성하여 라우터의 변화가 레이어 l에서 잔여 스트림을 통해 레이어 l+1의 주의 sink를 증폭시켜 주의를 재구성합니다. 주의 메커니즘 자체에 직접적인 업데이트 없이 주의를 재구성합니다.

또한 AAR은 오답이 짧아지고 올바른 답은 길이가 변경되지 않으면서 오랜 시간 동안 분기하는 생성을 줄입니다. 마지막으로 AAR은 인과 추론에 강한 깊이 민감성을 보입니다. 깊이에 따라 라우팅과 주의가 서로 대조적인 관계를 보인다는 것을 드러내며, 깊이 민감성을 통해 라우팅에 관련된 정보를 다양한 층에서 주의가 어떻게 전달하는지에 대한 통제된 프로브로 AAR을 사용할 수 있습니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 22시간 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.