RL-算法演进史05:两大策略强化学习算法系列对比【REINFORCE→Baseline→Actor−Critic→A2C→A3C→TRPO→PPO】、【DPG→DDPG→TD3→SAC】 2026/10/2 15:23:34 拓冰建站 浏览量 本章统一比较两条强化学习算法演进路线:REINFORCE→Actor-Critic→A2C→TRPO→PPOREINFORCE\rightarrow Actor\text{-}Critic\rightarrow A2C\rightarrow TRPO\rightarrow PPOREINFO