Regularized Centered Emphatic Temporal Difference Learning에 대한 리뷰 보기
오프-폴리시(Off-policy) 시간차분(TD) 학습에 함수 근사(Function Approximation)가 사용될 때 안정성, 투영 기하학_management(Projection Geometry), 분산 제어 controL(variance control)와 같은 구조적 트레이드오프가 발생한다. 강조된 시간차분(Emphatic TD, ETD)가 오프-폴리시 투영 기하학을 개선하는 데 도움이 되지만, 후속 추적(follow-on trace)이 높은 분산을 가질 수 있다. 우리는 벨만 오류(Bel