ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

RL-赵-(一):基本概念【state value(v)、action value(q)、policy(π)、reward、return、trajectory、episode】

2026/9/13 12:26:10 拓冰建站 浏览量
RL-赵-(一):基本概念【state value(v)、action value(q)、policy(π)、reward、return、trajectory、episode】 ​在强化学习Reinforcement Learning, RL中以下是一些关键的概念这些概念构成了智能体Agent如何与环境Environment进行交互的基础。下面是这些概念的详细解释1.State Value (V)定义State ValueV(s)V(s)V(s)表示在某个状态sss下智能体从该状态开始并按照某个策略π\piπ行动时预期的累计奖励。它反映了状态的好坏。公式V(s)Eπ[∑t0∞γtrt∣s0s] V(s) \mathbb{E}_{\pi} \left[ \sum_{t0}^{\infty} \gamma^t r_t \Big| s_0 s \right]V(s)Eπ​[t0∑∞​γtrt​​s0​s]其中γ\gammaγ是折扣因子rtr_trt​是在时间步ttt获得的即时奖励π\piπ是策略。解释State Value 衡量的是给定一个状态sss在按照策略π\piπ行动时智能体预期会获得的总回报。如果一个状态的值较高表示在该状态下的长期奖励较高值得采取的行动。2.Action Value (Q)定义Action ValueQ(s,a)Q(s, a)Q(s,a)表示在状态sss下采取动作aaa并继续按照某个策略π\piπ行动时从该状态和动作对开始的预期回报。公式Q(s,a)Eπ[∑t0∞γtrt∣s0s,a0a] Q(s, a) \mathbb{E}_{\pi} \left[ \sum_{t0}^{\infty} \gamma^t r_t \Big| s_0 s, a_0 a \right]Q(s,a)Eπ​[t0∑∞​γtrt​​s0​s,a0​a]解释Action Value 衡量的是给定状态sss和动作aaa采取该动作后按照策略π\piπ行动所能获得的预期总回报。它为每个状态-动作对分配一个值帮助智能体决定在特定状态下采取哪个动作。3.Policy (π)定义Policyπ\piπ是智能体在某个状态下选择动作的规则或策略。可以是确定性的每个状态下只有一个动作或随机性的每个状态下选择动作的概率分布。表示确定性策略π(s)a\pi(s) aπ(s)a表示在状态sss下选择动作aaa。随机性策略π(a∣s)\pi(a | s)π(a∣s)表示在状态sss下选择动作aaa的概率。解释策略是强化学习中的核心概念它决定了智能体在不同的状态下如何选择动作。策略可以是人工设计的也可以是通过学习过程动态生成的。4.Reward (r)定义Rewardrtr_trt​是智能体在时间步ttt获得的即时反馈表示智能体在该时刻的动作和状态组合的好坏。解释奖励是智能体与环境交互的基础反馈帮助智能体评估当前行为的好坏。奖励通常是一个标量值可能是正的表示智能体采取了正确的行为或负的表示采取了不利的行为。5.Return (G)定义ReturnGtG_tGt​是从时间步ttt开始直到未来所有时间步的折扣奖励的累积和。它的公式如下Gt∑k0∞γkrtk G_t \sum_{k0}^{\infty} \gamma^k r_{tk}Gt​k0∑∞​γkrtk​解释回报是从某一时刻ttt开始智能体能够获得的未来折扣奖励的和。它考虑了即时奖励和未来奖励的折扣影响。强化学习中的目标通常是最大化回报。6.Trajectory (轨迹)定义Trajectory 是智能体在与环境交互过程中经历的一系列状态、动作、奖励的序列。可以看作智能体在环境中的“路径”。表示τ(s0,a0,r0,s1,a1,r1,s2,a2,r2,… ) \tau (s_0, a_0, r_0, s_1, a_1, r_1, s_2, a_2, r_2, \dots)τ(s0​,a0​,r0​,s1​,a1​,r1​,s2​,a2​,r2​,…)解释轨迹表示智能体在一个 Episode 中的所有状态、动作、奖励的顺序记录了智能体如何从一个状态转移到下一个状态以及每次转移所获得的奖励。7.Episode (回合)定义Episode 是强化学习中的一个完整的交互周期通常从环境的初始状态开始到某个终止条件如到达目标、达到最大步数等结束。解释Episode 是强化学习的基本单位。一个 Episode 代表了智能体与环境之间的一次完整交互包括从初始状态开始一直到达终止状态或时间步数上限。每次 Episode 结束后环境会被重置智能体进入新的 Episode。8.State Transition (状态转移)定义State Transition 是指从一个状态sts_tst​到另一个状态st1s_{t1}st1​的转变。在每个时间步智能体选择动作并执行后环境会根据该动作返回一个新的状态。公式st1P(st,at) s_{t1} P(s_t, a_t)st1​P(st​,at​)其中PPP是环境的状态转移概率函数表示在状态sts_tst​下执行动作ata_tat​后转移到下一个状态st1s_{t1}st1​的概率。解释状态转移是环境响应智能体行动的方式它决定了智能体如何从一个状态转移到另一个状态。状态转移通常由环境的动态或转移概率函数描述。9.Markov Decision Processes (MDP, 马尔可夫决策过程)定义Markov Decision ProcessesMDP是强化学习中描述环境和智能体交互的数学框架。它由一组状态SSS一组动作AAA一个状态转移函数P(s′∣s,a)P(s|s, a)P(s′∣s,a)一个奖励函数R(s,a)R(s, a)R(s,a)以及一个折扣因子γ\gammaγ组成。MDP 的组成状态空间SSS智能体可能遇到的所有状态的集合。动作空间AAA智能体可以采取的所有动作的集合。转移函数P(s′∣s,a)P(s|s, a)P(s′∣s,a)在状态sss下采取动作aaa后转移到下一个状态s′ss′的概率。奖励函数R(s,a)R(s, a)R(s,a)在状态sss下采取动作aaa后获得的奖励。折扣因子γ\gammaγ折扣未来奖励的系数决定了未来奖励的影响程度。解释MDP 是描述强化学习环境的核心模型提供了一个数学化的框架来描述智能体如何在不同状态之间转换并基于奖励信号来优化策略。MDP 的核心假设是马尔可夫性即未来的状态仅与当前状态和动作有关与过去的历史无关。总结这些概念构成了强化学习的基础框架帮助我们理解智能体如何在环境中学习和做出决策State Value (V)和Action Value (Q)是衡量状态或动作质量的指标。Policy (π)是智能体在每个状态下如何选择动作的规则。Reward是智能体获得的即时反馈用于评估行为的好坏。Return是未来奖励的折扣和。Trajectory和Episode是智能体与环境交互的历史记录。State Transition描述了智能体如何从一个状态转移到另一个状态。Markov Decision Process (MDP)是强化学习的数学模型用来描述环境、状态转移、奖励等要素。这些概念紧密相连共同构成了强化学习的核心理论和算法基础。