恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
RL-10-TD算法-ActorCritic04-连续动作控制02:DDPG02【在线/目标Actor、在线/目标Critic、Replay Buffer、Noise与深度网络的完整作用】
首页
资讯中心
/
RL-10-TD算法-ActorCritic04-连续动作控制02:DDPG02【在线/目标Actor、在线/目标Critic、Replay Buffer、Noise与深度网络的完整作用】
RL-10-TD算法-ActorCritic04-连续动作控制02:DDPG02【在线/目标Actor、在线/目标Critic、Replay Buffer、Noise与深度网络的完整作用】
发布时间:2026/10/7 22:50:46
第一章 DDPG整体架构与核心思想1.1 DDPG算法简介深度确定性策略梯度(Deep Deterministic Policy Gradient,DDPG)是一种用于解决连续动作控制问题(Continuous Control Problem)的经典深度强化学习算法。DDPG属于:Actor-Critic(行动者-评价者)架构它同时学习两个不同类型的模型:策略模型(Policy Model)负责:根据当前状态决定执行什么动作。对应:Actor网络(Actor Network)数学表示:a=μθ(s)a=\mu_\theta(s)a