트랙토리 이ミ테이션을 넘어서: 전략 가이드 정책 최적화 - LLM 논리 추론을 위한
강력한 언어 모델에서 약한 언어 모델로 추론 능력을 내뇨하는 데 일반적으로 사용되는 방법은 특정 해결책 경로를 모방하는 것이다. 즉, 무엇을 답변해야 하는지 말고는 어떻게 추론해야 하는지 알려주는 것이다. 이 경로 단위 모방은 인스턴스 특정 단계의 기억보다는 전이 가능 문제 해결 기술의 학습을 장려하지 못하고, 새로운 문제에 대한 일반화력을 제한한다. 우리는 Strategy-Guided Po