본문으로 건너뛰기

듀얼-플로우 트랜스포머: 주요 프리 필 경로와 추가 디코딩 계산을 분리하는 방법

대규모 언어 모델은 더 많은 요청을 처리할수록,一次적인 학습 비용 대비 누적적인 추론 비용이 점점 더 중요해지고 있습니다. 추론의 두 가지 단계는 하드웨어를 다르게 부하를 주고 있습니다:_prompt prefill은 병렬적이고 일반적으로 계산량에 의존하는 반면, autoregressive decode는 순차적이고 종종 메모리 대역폭에 의존합니다. 전통적인 너비 또는 깊이 확대는 두 비용을 모

AI 자동 생성

대규모 언어 모델의 효율성 개선

대규모 언어 모델(LLM)은 더 많은 요청을 처리할수록, 초기 학습 비용 대비 누적적인 추론 비용이 점점 더 중요해지고 있습니다. 추론의 두 가지 단계, 즉 프롬프트 프리 필과 오토레그레시브 디코딩은 하드웨어에 다른 부하를 주고 있습니다. 프롬프트 프리 필은 병렬적이고 일반적으로 계산량에 의존하는 반면, 오토레그레시브 디코딩은 순차적이고 종종 메모리 대역폭에 의존합니다.

전통적인 너비 또는 깊이 확대는 두 비용을 모두 함께 증가시켜, 추가된 각 층은 두 단계 모두에서 평가됩니다. 그러나 우리는 추가 학습된 계산을 대신으로 지속 예측에 할당할 수 있는지 여부를 묻습니다. 이를 위해 프롬프트 전체의 주요 계산과 단일 지속적인 키-값(KV) 캐시를 보존하는 방안을 고려할 수 있습니다.

Dual-Flow Transformer

이러한 문제를 해결하기 위해 Dual-Flow Transformer를 소개합니다. Dual-Flow Transformer는 주류 흐름과 부류 흐름으로 구성되어 있습니다. 주류 흐름은 완전한 인과적 언어 모델로 프롬프트를 처리하고 KV 캐시를 기록합니다. 반면, 부류 흐름은 프롬프트 처리 시 생략되고, 최종 프롬프트 위치부터 활성화되어 지속 예측 계산을 추가하지 않고 지속 상태를 기록하거나 주류 흐름에 영향을 주지 않습니다.

두 흐름은 주요 주의, MLP, 및 출력 행렬을 공유하며, 별도의 토큰 임베딩과 가벼운 결합을 사용합니다. 공유된 가중치와 주류 캐시는 그룹된 실행 중에 로드된 가중치를 재사용하고 캐시된 키와 값을 재사용할 수 있는 기회를 제공합니다. 이러한 접근 방식은 매치된 토큰 비교에서 더 낮은 검증 손실을 달성합니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 10시간 전

AMD가 인공지능 회사 월드 랩스(Wold Labs)를 8억 달러 이상에 인수한다

AMD가 대규모 언어 모델(LLM) 및 인공지능(AI) 기술 연구소인 World Labs를 8억200만 달러 규모의 주식 교환으로 인수한다고 발표했다. World Labs는 2024년에 설립되었으며 몇 개월 만에 10억 달러 규모의 기업으로 성장했다. 이 스타트업은 첫 번째 상업 제품으로, 세계 생성 모델을 포함하는 AI 플랫폼을 출시했다.

AI 모델 16시간 전

시각성 겹침: 방향성 기원 내 개중량 모델 계통

가중치가 공개된 모델은 종종 최적화, 정렬, 병합, 다시 공개되는 과정을 거치게 되며, 모델의 기원에 대한 감사는 단순히 체크포인트가 관련되어 있는지 여부를 확인하는 것만이 아닌, 체크포인트 중 누가 먼저 만들어졌는지 또한 확인해야 하는 상황이 발생합니다. 현재까지 존재하는 모델 기원에 대한 방법들은 주로 기존에 알려진 모델을 대상으로 하는 감사 설정에 설계되어 있으며, 주어진 모델 중 한

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.