资讯详情

RL-10-TD算法-ActorCritic03-连续动作控制01-DPG:DPG03【Actor与Critic协同训练机制:A的∇Jᶿ梯度组成:A的θ梯度×C的动作a梯度】【训练C的∇Jʷ:w梯度】

📅 2026/10/7 1:45:12 | 华诺云谱 👁 阅读
RL-10-TD算法-ActorCritic03-连续动作控制01-DPG:DPG03【Actor与Critic协同训练机制:A的∇Jᶿ梯度组成:A的θ梯度×C的动作a梯度】【训练C的∇Jʷ:w梯度】
Deterministic Actor-Critic 的梯度/Gradient:∇θJ(θ)=∑s∈Sρμ(s)∇θμ(s)(∇aqμ(s,a))∣a=μ(s)=ES∼ρμ[∇θμ(S)(∇aqμ(S,a))∣a=μ(S)]\color{red}{\begin{aligned} \nabla_{\theta} J(\theta) =\sum_{s \in \mathcal{S}} \rho_{\mu}(s) \nabla_{\theta} \mu(s)\left(\nabla_{a} q_{\mu}(s, a)\right)|_{a=\mu(s)} \\ =\mathbb{E}_{S \sim \rho_{\mu}}\left[\left.\nabla_{\theta} \mu(S)\left(\nabla_{a} q_{\mu}(S, a)\right)\right|_{a=\mu(S)}\right] \end{aligned}}
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑