대규모 언어 모델이 목표 인식에 쓸모있는가?
대규모 언어 모델(LLM)은 최근에 잘 알려진 계획 도메인에서 고전 계획자와 거의 동등한 수준으로 성능을 보여주었지만, 이 compétence은 세계 지식을 이용하는 것에instead 의แท로 상징적인 사유에 기초한 것이 아니다. 목표 인식은 LLM의 강점에 더 적합한 추론 과제이다. LLM의 세계 지식과 일치하는 것을 평가하는 것에만 의존한다. 이 연구는 LLM을 목표 인식자로 사용하는 처음으로 체계적인 zero-shot 평가를 제공한다. 본 연구의 결과는 LLM의 목표 인식 능력이 불균일한 것으로 나타났다. 일부 모델은 증거에 따라 성능을 개선하고 전체 관찰 시 랜드마크 기반 정확도에 접근하는 반면, 다른 모델은 증거가 쌓일수록 세계 지식의 전제에 고정되어 있다. 모델의 추론 경로를 통해 유의미한 차이를 발견한 결과, 이 차이는 증거 통합 차이로 인한 것이 아니라 도메인 친숙성 차이로 인한 것이 아니다. 이러한 결과는 LLM의 기본 계획 지식에 대한 일원적인 벤치마크로 목표 인식의 중요성을 강조한다.