본문으로 건너뛰기

LISA: 선형 인덱스 스파스 주의(LISA) - 효율적인 장기 논리적 추론을 위한 새로운 기술

장기 논리적 추론 모델의 최근 발전으로 인해 테스트 시간 척도 패러다임 하에서 더 긴 추론 문맥 길이가 증가하고 있습니다. 그러나 표준 자기 주의의 O(n^2) 계산 복잡성으로 인해 장기-CoT 논리적 추론의 배포는 생산 환경에서 제한됩니다. 이를 해결하기 위해 우리는 LISA(LISA)를 제안합니다. LISA는 원래 모델에 플러그 앤 플레이 주의 대체 모듈로 사용할 수 있는 플러그 앤 플레이 주의 대체 모듈입니다. LISA는 원래 모델에 두 가지 가벼운 구성 요소를 병렬로 통합합니다: (1) 선형 주의 모듈이 장거리 기억을 제공하는 O(n) 시간 복잡도; (2) 광속 인덱서가 전체 문맥에서 토큰의 상위 M을 선택하여 광속 자기 주의에 입력합니다. 두 가지 Branch는 게이트 메커니즘을 통해 결합되며, n 토큰을 생성하는 데 O(n^2)에서 O(nM) (M << n)로의 예측 복잡성을 줄입니다.

AI 자동 생성

LISA: 효율적인 장기 논리적 추론을 위한 새로운 기술

장기 논리적 추론 모델의 최근 발전으로 인해 테스트 시간 척도 패러다임 하에서 더 긴 추론 문맥 길이가 증가하고 있습니다. 그러나 표준 자기 주의의 O(n^2) 계산 복잡성으로 인해 장기-CoT 논리적 추론의 배포는 생산 환경에서 제한됩니다. 이를 해결하기 위해 우리는 LISA(LISA)를 제안합니다. LISA는 원래 모델에 플러그 앤 플레이 주의 대체 모듈로 사용할 수 있는 플러그 앤 플레이 주의 대체 모듈입니다.

LISA의 구성 요소

LISA는 원래 모델에 두 가지 가벼운 구성 요소를 병렬로 통합합니다.

  • 선형 주의 모듈: 장거리 기억을 제공하는 O(n) 시간 복잡도.

  • 광속 인덱서: 전체 문맥에서 토큰의 상위 M을 선택하여 광속 자기 주의에 입력합니다.

LISA의 작동 원리

두 가지 Branch는 게이트 메커니즘을 통해 결합되며, n 토큰을 생성하는 데 O(n^2)에서 O(nM) (M << n)로의 예측 복잡성을 줄입니다.

LISA의 학습 파이프 라인

우리는 두 가지 학습 파이프 라인을 설계했습니다.

  • Stage 1: 원래 모델에 선형 주의 모듈을 통합하여 장거리 의존성을 캡처합니다.

  • Stage 2: 광속 인덱서를 추가하여 동적 토큰 선택을 허용합니다.

실험 결과

DeepSeek-distilled-Qwen 모델의 실험 결과에 따르면 LISA는 16K-token 문맥에서 50%의 추론 속도 향상을 달성하면서, 평균 성능이 5.6% 향상되었습니다.

결론

LISA는 효율적인 장기 논리적 추론을 위한 새로운 기술입니다. LISA는 원래 모델에 플러그 앤 플레이 주의 대체 모듈로 사용할 수 있으며, 두 가지 가벼운 구성 요소를 병렬로 통합합니다. LISA의 작동 원리는 두 가지 Branch를 게이트 메커니즘을 통해 결합하여 예측 복잡성을 줄입니다. LISA의 학습 파이프 라인은 두 가지 학습 파이프 라인을 포함합니다. 실험 결과에 따르면 LISA는 50%의 추론 속도 향상을 달성하면서, 평균 성능이 5.6% 향상되었습니다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 23시간 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.