ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

【无标题】RL-赵-(八)-ValueBased04-ActionValue估算:Deep Q-learning02(DQN)【两网络:固定T,更新M,定期将M的参数赋给T】【经验池】

2026/9/26 3:34:30 拓冰建站 浏览量
【无标题】RL-赵-(八)-ValueBased04-ActionValue估算:Deep Q-learning02(DQN)【两网络:固定T,更新M,定期将M的参数赋给T】【经验池】 RL-赵-(八)-Value-Based04:Deep Q-learning(DQN)【两网络:固定T,更新M,定期将M的参数赋给T】【经验池】【目标:最优化网络参数⮕使得通过网络计算出的q是最优的】1、技巧01:Two Networks(两个网络)第一个技巧: 使用了两个网络,一个是main network, 另一个是target network。为什么要使用两个网络呢? 在数学上来说因为计算梯度的时候会非常的复杂,所以先去固定一个,然后再去计算另一个,这样就需要两个网络来实现。具体实现的细节:令w ww和w T w_TwT​分别表示mean network和target network的参数,它们初始化的时候是一样的。在每个iteration中,从 replay buffer【这里边包含了很多的experience的sample】 中 draw —个 mini-batch 样本{ ( s , a , r , s ′ ) } \{(s,a,r,s^{\prime})\}{(s,a,r,s′)}网络的输入包括 states ss和 actiona aa, 输出y = q ^ ( s , a , w ) y = \hat{q}(s, a, w)y=q^​(s,a,w)。y ^ \hat{y}y^​的目标值是y T ≐ r + γ max ⁡ a ∈ A ( s ′ ) q ^ ( s ′ , a , w T ) y_T\doteq r+\gamma\max_{a\in\mathcal{A}(s^{\prime})}\hat{q}(s^{\prime},a,w_T)yT​≐r+γmaxa∈A(s′)​q^​(s′,a,wT​)。然后为了更新Main Network 我们直接基于the mini-batch