LLM PC 5월 14일
주의가 닫히는 순간: LLM이 멀티 턴 상호 작용에서 주제를 잃는 이유
대규모 언어 모델(LLM)은 단일 턴에서 복잡한 지시를 따르지만, 장기적인 멀티 턴 상호 작용에서 지시, 인격, 규칙을 잃을 수 있다. 이 감소는 행동적으로 측정되었지만, 기계적으로 설명되지 않았다. 우리는 주제 정의 토큰이 주의의 통로를 통해 더 이상 액세스할 수 없게 되며, 주제 관련 정보는 잔여 표현에서 지속될 수 있다는 채널 전환 설명을 제안한다. 주제 액세스성 비율(GAR)을 도입하여 생성된 토큰에서 목표 정의 토큰으로 주의를 측정하고, 슬라이딩 윈도우 절단 및 잔여 스트림 프로브를 결합한다. 주의가 지시를 닫는 순간, 무엇이 살아남는지가 아키텍처를 드러낸다. 다양한 아키텍처에서 전환은 질적으로 다른 실패 모드를 산출한다: 일부 모델은 주의가 사라지더라도 목표 조건된 행동을 보존하고, 다른 모델은 잔여 목표 정보가 디코딩될 수 있더라도 실패한다. 이 인코딩이 발생하는 레이어는 2에서 27까지 다양하다. 모델 내의 인과적 절단이 Mistral의 주의 통로를 강제로 닫으면, 20개 사실 보존 태스크에서 반환률이 11%에서 거의 완벽한 11%로 떨어지고, 불편한 압력 기반 대조군보다 인격 제약 위반률이 높아지며, 이 모든 효과는 예측 가능한 교차 턴에서 발생한다. 선형 프로브는 Aimed 표현에서 회귀 결과를 회복시키는 AUC가 0.99까지 모든 네 가지 주요 아키텍처에서 0.99까지 달성한다. 입력 임베딩은 기대치에 머물러 있다. 다양한 아키텍처와 모델 규모에서 주의 손실과 잔여 디코딩 가능성의 간격이 목표 조건된 행동이 주의 통로가 닫히는 경우에 살아남는지 여부를 예측한다. GAR를 진단도구로, 채널 전환 프레임워크를 제어된 기계적 설명으로, 윈도우드 주의 닫기로 실패 시간을 예측하는 파라미터 예측을 기여한다.