RL-10-TD算法-ActorCritic03-连续动作控制01-DPG:DPG04【DQN与DPG/PPO中Critic对比:Q动作价值函数与V状态价值函数、ActorCritic策略梯度演化】
第 1 部分:DPG、PPO 中 Critic 与 DQN Critic 的原理对比:从价值函数学习到 Actor-Critic 优化机制1. 为什么强化学习需要 Critic?1.1 强化学习中的核心问题在强化学习(Reinforcement Learning,RL)中,一个智能体(Agent)不断与环境交互:状态(State)→动作(Action)→奖励(Reward) \text{状态(State)}\rightarrow\text{动作(Action)}\rightarrow\text{奖励(Reward)}状态(State)