장기 예측 미라지? : 대규모 언어 모델(LLM) 에이전트의 장기 예측 실패 원인 규명
대규모 언어 모델(LLM) 에이전트는 짧은 및 중간 장기 예측에서 강력하게 수행하지만, 장기 예측이 필요할 때 연장된, 상호 의존적인 행동 시퀀스에 대한 에이전트가 붕괴하는 것을 관찰합니다. 대규모 언어 모델(LLM) 에이전트의 장기 예측 실패는 아직 제대로 규명되지 않았고, 이는 장기 예측 실패를 진단하고 비교하는 데 있어 원칙적인 방법을 제공하지 못합니다. 이 문제를 해결하기 위해, 우리는 HORIZON 이라는 초기 단계의 크로스 도메인 진단 벤치마크를 제안합니다. HORIZON을 사용하여, 우리는 다양한 모델 패밀리 (GPT-5 변형 및 Claude 모델) 의 최신 기술 (SOTA) 에이전트를 평가합니다. 또한, 우리는 장기 예측 실패를 진단하기 위한 트래젝토리 기반 LLM-as-a-Judge 파이프라인을 제안합니다.