본문으로 건너뛰기

영구적 메모리를 활용한 연속적 임시 변수 추론

대규모 언어 모델(LLM)은 수학적 및 멀티-호ップ 계획 작업에서 놀라운 추론 능력을 보였다. CoCoNuT(Chain of Continuous Thought) 패러다임은 모델이 잠재 공간에서 추론을 수행하고 여러 추론 경로를 동시에 탐색하는 대신 초기 단계에 단일 chain에 대한 약속을 하지 않는다. 그러나 우리는 '개념 병목 현상' 이라는 한계를 식별했다. 추론 단계마다 중간으로 숨겨진

AI 자동 생성

대규모 언어 모델의 추론 능력

대규모 언어 모델은 수학적 및 멀티-호 계획 작업에서 놀라운 추론 능력을 보였다. 연속적인 생각 체인 패러다임은 모델이 잠재 공간에서 추론을 수행하고 여러 추론 경로를 동시에 탐색하는 대신 초기 단계에 단일 체인에 대한 약속을 하지 않는다. 그러나 이 패러다임에도 한계가 존재한다. 추론 단계마다 중간으로 숨겨진 상태가 덮어씌워지며, 추론 깊이가 증가할수록 이전 단계에서 계산된 중요한 사실을 잃어버린다. 이러한 한계를 해결하기 위해, '게이트드 개념 스트림'과 같은 새로운 접근법이 제안되었다. 게이트드 개념 스트림은 모든 추론 단계에서 유지되는 '지속적인 잔여 메모리'를 유지하며, 세 개의 학습된 게이트로 제어된다: '쓰기' 게이트가 중간 사실을 메모리에 저장하고, '읽기' 게이트가 이전 상태를 검색하고, '잊기' 게이트가 불필요한 맥락을 제거한다. 이러한 접근법은 대규모 언어 모델의 추론 능력을 향상시키는 데 도움이 될 수 있다. 게이트드 개념 스트림은 실제 데이터셋에서 일관된 개선치를 달성했다. 수학 문제 데이터셋, 질문 응답 데이터셋, 일반 지식 데이터셋을 사용하여 기초 언어 모델을 기본 모델로 사용하여 게이트드 개념 스트림은 모든 종류의 데이터셋에서 개선된 성능을 보였다. 교육 깊이가 증가할수록 개념 병목 현상이 해결되었다. 이는 게이트드 개념 스트림이 대규모 언어 모델의 추론 능력을 향상시키는 데 효과적인 접근법임을 시사한다. 이러한 연구 결과는 추론 능력의 향상을 위한 새로운 방향을 제시할 수 있다.

결론

대규모 언어 모델의 추론 능력은 수학적 및 멀티-호 계획 작업에서 중요하다. 그러나 연속적인 생각 체인 패러다임의 한계를 극복하기 위해 새로운 접근법이 필요하다. 게이트드 개념 스트림은 이러한 한계를 해결하는 데 도움이 될 수 있는 접근법이다. 추후 연구에서는 게이트드 개념 스트림을 포함한 다양한 접근법을 탐색하여 대규모 언어 모델의 추론 능력을 향상시키는 데 목표를 두어야 한다. 이러한 연구는 인공지능의 발전에 중요한 역할을 할 수 있다.
원문 보기 arXiv AI

함께 읽으면 좋은 기사

AI 모델 1일 전

소니와 유니버설 뮤직 그룹이 다시 소니우에 법적 조치 시행

소니(Sony)와 유니버설 뮤직 그룹(Universal Music Group)은 다시 한 번 선오(Suno)와 법적 분쟁을 제기했습니다. 소니와 유니버설 뮤직 그룹은 새로운 모델 v6가 이전 모델의 사용자 출력을 기반으로 학습했는데, 이전 모델은 유튜브(Youtube)와 같은 출처에서 불법적으로 음악을 훔치고 학습한 것이란 이유로 저작권 침해를 주장합니다. 소니와 유니버설 뮤직 그룹은 유니버

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.