发布于2024-10-07 22:39:11
TD时序差分算法的off-policy version的疑问
目前对 off-policy 的理解是,生成 experience 数据的 policy 与优化出的 policy 不同。 那么如果是这样的话,与 on-policy 相比,感觉很难得到真正的最优 policy,因为它是在生成 experience 数据的...赞
评论
2
浏览
1006