RL-10-TD算法-ActorCritic02-离线算法03-赵:Off-Policy Policy Gradient 2026/10/2 13:55:07 拓冰建站 浏览量 3、off-policy Policy Gradient有了刚刚的重要性采样,我们就把这个技术应用到policy gradient当中,去实现off-policy的学习。下面其实我们有两个步骤,第一个步骤就是要得到gradient它的表达式是什么,在得到这个gradient表达式之后,我们就可以把它应用到梯度上升的方法当中去进行优化。就像上面的on-policy的情况,我们需要将policy gradient推导到off-policy的情