恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
RL-10-TD算法-ActorCritic03-连续动作控制01-DPG-赵:DPG07【DPG的Critic为什么会训练失败,Target Network 为什么能让 Critic 更稳定】
首页
资讯中心
/
RL-10-TD算法-ActorCritic03-连续动作控制01-DPG-赵:DPG07【DPG的Critic为什么会训练失败,Target Network 为什么能让 Critic 更稳定】
RL-10-TD算法-ActorCritic03-连续动作控制01-DPG-赵:DPG07【DPG的Critic为什么会训练失败,Target Network 为什么能让 Critic 更稳定】
发布时间:2026/10/8 23:52:44
第九章 Critic 为什么会训练失败1 Moving Target1.1 问题来源TD Target 本身依赖网络估计:y=r+γQwˉ(s′,μθˉ(s′)) y=r+\gamma Q_{\bar w}(s',\mu_{\bar\theta}(s'))y=