恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

强化学习 RL

  • 首页
  • 资讯中心
  • /
  • 强化学习 RL

相关资讯

3个坑避开备案迷雾:新手入门站长网站ip实操指南 2026/9/27 9:24:12
AI 生图实现方式汇总 2026/9/27 9:24:12
网络销售公司经营范围避坑指南与前端最佳实践 2026/9/27 9:24:12

最新资讯

群晖NAS非认证硬盘怎么用:Synology_HDD_db 四步配置
wordpress转dede避坑指南3步搞定建站报价更透明
usehooks-ts `useCountdown` 倒计时 Hook 完整指南:参数、源码原理与实战示例
网页设计公司哪家值得推荐最佳实践
2026最新设计大型网站建设避坑指南
天天用漱口水,是不是就不用刷牙了?/钟祥小灰兔科普

今日推荐

从像素到笔画:srt-whiteboard-animation骨架笔迹追踪实现(Zhang-Suen细化+8邻接追踪)
网站建设的英语怎么说?别只背单词,看完这套安全完整流程才敢上线
新手入门看这篇:建设网站加盟避坑指南与SEO实操

本周热门

从像素到笔画:srt-whiteboard-animation骨架笔迹追踪实现(Zhang-Suen细化+8邻接追踪)
网站建设的英语怎么说?别只背单词,看完这套安全完整流程才敢上线
新手入门看这篇:建设网站加盟避坑指南与SEO实操

本月精选

自研推理加速器Redwood:两周内实现PyTorch模型高效部署的实战教程
V4L2摄像头采集实战:从camera_client.rar到出图全流程解析
从“谁发明了钢琴键”到知识问答智能体:RAG与记忆工程实践

强化学习 RL

发布时间:2026/9/27 9:24:12
强化学习 RL 文章目录一、强化学习介绍1.概念2.核心组成部分5个3.RL分类(1)在线强化学习(Onlien RL) vs 离线强化学习(Offline RL)4.例子5.强化学习和其他学习方式的区别二、术语表 glossary三、强化学习算法0.分类(1)基于「价值/策略」的经典分类決定了模型到底是记住「分数」还是记住「动作」(2)根据「学习方式」分为 同策略(On-Policy)、异策略(Off-Policy)(3)根据「是否懂世界」分为 无模型(Model-Free) 和 有模型(Model-Based)1.SARSA2.Q-learning3.异同点(1)相同(2)不同(3)如何选择四、RL与SFT0.大模型训练的三步走pre-train、SFT、Alignment(1)预训练 (pre-train)(2)监督微调 (SFT)(3)偏好对齐 (Preference Alignment)1.SFT (Supervised Fine-Tuning) —— 有监督微调2.RL (Reinforcement Learning) —— 强化学习五、大模型对齐算法(Alignment)1.概念(1)PPO(Proximal Policy Optimization)(2)DPO (Direct Preference Optimization)(3)GRPO (Group Relative Policy Optimization)2.PPO、DPO、GRPO的区别(1)成本与效果的权衡(2)本质权衡 显存效率、训练稳定性、探索能力(3)各自的适用场景(4)实战设计一个类似DeepSeek R1的训练流程六、KL散度七、Agentic RL (智能体强化学习)一、强化学习介绍1.概念强化学习(Reinforcement Learning, RL)是机器学习的一个子领域是一种机器学习方法。它的核心在于“试错”(Trial and Error)。定义1强化学习就是训练一个智能体(Agent)通过与环境(Environment)进行交互通过不断的尝试(试错Trial and Error)来发现哪些行为能获得最大的奖励(Reward)从而学会做决策完成某项任务。定义2强化学习Reinforcement Learning, RL是一种让智能体agent通过“试错”来学习做决策的机器学习方法它在环境environment里采取动作action环境给它奖励reward或惩罚它的目标是在长期内获得尽可能大的累计回报。定义3强化学习智能体与环境交互、通过回报最大化来学习策略Policy在某个状态下该选哪个动作可以是确定的也可以输出概率。利用Exploration选当前看起来最好的动作拿分探索 Exploitation尝试没怎么试过的动作可能发现更好的路强化学习难点之一就是平衡这俩。2.核心组成部分5个智能体Agent做决定的人/程序比如游戏里的 AI、机器人。环境Environment智能体所处的世界游戏规则、物理世界、交易市场等。状态State当前局面是什么样棋盘局面、机器人位置等。动作Action在当前状态下能做什么走一步、转向、买/卖。奖励Reward环境对动作的反馈分数得分1、撞墙-10。智能体的学习目标通常写成最大化 长期累计奖励而不是只看眼前这一步的奖励。3.RL分类(1)在线强化学习(Onlien RL) vs 离线强化学习(Offline RL)1.数据来源(1)Online RL训练时边交互边收集新数据轨迹/transition并用这些新数据立即或很快更新策略。(2)Offline RL训练时只用预先收集好的静态数据集不再进行额外在线交互/探索。2.表格对比维度在线强化学习Online RL离线强化学习Offline RL数据来源策略与环境实时交互产生预先收集的静态数据集探索方式当前策略主动探索环境无法探索只能利用已有数据策略更新采样 → 评估 → 更新 → 再采样循环在固定数据上直接训练核心挑战样本效率、探索-利用权衡分布偏移Distribution Shift、外推误差计算成本高需持续 rollout低一次训练无需环境交互安全性训练过程可能产生危险行为训练过程安全不接触真实环境典型算法PPO、GRPO、DQNDPO4.例子训练一只“游戏 AI”状态当前画面/位置/血量动作向左/右/跳跃/攻击奖励过关 100、死亡 -100、捡到道具 10AI 一开始乱按慢慢发现哪些行为会带来更高的长期收益于是策略越来越像高手。5.强化学习和其他学习方式的区别监督学习有标准答案输入→正确标签像“做题对答案”。无监督学习没有标签主要发现结构聚类、降维。强化学习没有一步步的标准答案只有“做了之后得了多少分”而且很多奖励是延迟的比如下棋走了很多步才知道赢没赢。二、术语表 glossary缩写英文全称中文释义拓展RLReinforcement Learning强化学习SFTSupervised Fine-Tuning监督微调PPOProximal Policy Optimization近端策略优化RLHF 的强化学习阶段。最早的方法缺点是消耗显存成本高DPODirect Preference Optimization直接偏好优化消耗显存少简单快速上手微调一个demoGRPOGroup Relative Policy Optimization群组相对策略优化组均分作为baseline适合长思维链(CoT)的推理训练KL散度Kullback–Leibler divergence三、强化学习算法0.分类(1)基于「价值/策略」的经典分类決定了模型到底是记住「分数」还是记住「动作」1.基于价值(Value-Based)SarsaQ-learning。主要用于离散动作(比如玩馬里奧左、右、跳)2.基于策略(Policy-Based)REINFORCE (Policy Gradient)。可以处理连续动作(比如机器人手臂的力度控制也能学出随机策略 (剪刀石头布)3.两者结合Actor-Critic(AC 架构)是目前最强、最主流的架构①Actor (演员/策略)负责做动作②Critic (评论家/价值)负责打分代表算法PPO (ChatGPT用PPO), A3C, SAC, DDPG, TRPO(2)根据「学习方式」分为 同策略(On-Policy)、异策略(Off-Policy)決定了训练的效率和稳定性1.同策略 (On-Policy)(1)定义「边做边学」。学习的数据必须是当前最新的策略亲自跑出来的。旧数据一旦用过就得扔。(2)代表算法Sarsa, PPO, TRPO(3)优点稳定(4)缺点慢 (数据利用率低因为不能用旧经验)2.异策略 (Off-Policy)(1)定义「博采众长」。把过去的经验存进一个经验回放池 (Replay Buffer)或者学习别人的经验。(2)代表算法Q-Learning, DQN, DDPG, SAC(3)优点快(数据利用率高)(4)缺点不稳定 (难收敛)(3)根据「是否懂世界」分为 无模型(Model-Free) 和 有模型(Model-Based)1.无模型 (Model-Free)(1)比喻像学骑自行车。你不需要懂牛顿力学公式 (环境模型)你只要凭感觉试错知道怎么骑不倒就行。(2)现状目前90%的主流RL(包括PPO, DQN) 都是 Model-Free 的。因为现实世界太复杂很难建模。2.有模型 (Model-Based)(1)比喻像下围棋。你知道规则 (环境模型)知道我在这里落子下一步棋盘会变成什么样。你可以预测未来 (Planning)(2)代表算法AlphaZero(结合了搜索),World Models(3)现状效率极高 (不用真的去试错脑子里推演就行)但如果模型建錯了就会产生极大的误差。1.SARSA1.流程S → A → R → S ′ → A ′ S→A→R→S→AS→A→R→S′→A′2.Q-learningQ-learning学“动作价值”再间接得到策略 (Value-based)Q-learningRL 里一类最经典的价值函数方法(value-based)更具体地说是学动作价值函数(,)再用arg max ⁡ ( , ) \argmax_(,)argmaxa​Q(s,a)选动作。3.异同点(1)相同更新公式结构N e w Q O l d Q α × [ T a r g e t − O l d Q ] NewQOldQα×[{\rm Target}-OldQ]NewQOldQα×[Target−OldQ](2)不同1.对于Q值的更新(1)SARSA 必须实际迈出下一步(选好A’)才能回头更新上一步的价值。(2)Q-learning 不需要提前选定下一步的A’。它在更新时会假设下一步“即使我不这么走我也按最好的那种可能(Max)来算分”算法Target(目标值)计算部分解释SARSAR γ ⋅ Q ( S ′ , A ′ ) Rγ·Q(S,A)Rγ⋅Q(S′,A′)使用实际上下一步采取的动作A’的价值Q-learningR γ ⋅ m a x a Q ( S ′ , a ) Rγ·{\rm max_aQ(S,a)}Rγ⋅maxa​Q(S′,a)使用下一步所有可能动作中理论上最好的那个价值 (不管实际上会不会选它)2.本质区别(1)SARSA 是 On-Policy (同策略)(2)Q-learning 是 Off-Policy (异策略)(3)如何选择四、RL与SFT1.在当前的“大模型训练流水线”中SFT 和 RL 是继“预训练Pre-training”之后的两个关键步骤。2.可以把大模型想象成一个刚毕业的大学生(1)预训练 (Pre-training)他在大学里读了海量的书知识渊博但不懂职场规矩说话可能没头没尾甚至会胡言乱语。(2)SFT 是“入职培训”教他怎么按要求干活比如写邮件、写代码。(3)RL 是“绩效考核”通过不断的奖惩反馈让他学会如何把活干得更好、更符合老板人类的喜好。3.为什么先做 SFT 再做 RL这就像教人学做菜(1)SFT 阶段先照着菜谱学模仿标准动作至少得先把菜做熟别把糖当成盐。如果连基本的菜都做不出来直接去比赛RL肯定全是负分学不到东西。(2)RL 阶段基本功扎实了再通过顾客的评价咸了、淡了、不够鲜来微调火候最终成为特级厨师。4.一句话总结SFT 决定了模型的下限能不能用RL 决定了模型的上限好不好用。0.大模型训练的三步走pre-train、SFT、Alignmentpre-train 预训练学通识post-train 后训练包括 Fine-tuning 和 Alignment什么时候“没必要”上 post-train①只是想更新事实/知识比如公司最新政策、今年数据→ 通常 RAG/检索比训练更快更稳②只是想固定一点输出格式 → 先试 提示词约束解码/校验器不一定要训练③数据很少且高风险 → 先做小规模 LoRA 严格评测别盲目全参后训练(1)预训练 (pre-train)大规模通用语料学语言规律(2)监督微调 (SFT)用高质量指令数据/领域数据学“怎么按要求回答”(3)偏好对齐 (Preference Alignment)例如RLHF/DPO等用偏好数据让回答更符合人类偏好(安全、帮助性、少胡编等)1.SFT (Supervised Fine-Tuning) —— 有监督微调“手把手教照猫画虎”1.是什么我们给模型提供成对的高质量数据Question Answer。告诉模型“当用户问这个问题时标准答案就是这个你给我背下来以后照着这个写。”2.目的激发模型的能力让它学会**“遵循指令”**。 预训练后的模型只会“接龙”比如你说“床前明月光”它接“疑是地上霜”。SFT 后的模型学会了“回答问题”你说“请写一首关于月亮的诗”它会真的去写一首诗而不是接着你的话往下编。3.数据形式Prompt提示词 Perfect Response完美回答。4.局限性模型只能模仿训练数据。如果训练数据里没有写过某种复杂的代码模型就很难无师自通。2.RL (Reinforcement Learning) —— 强化学习“自主探索优胜劣汰”1.是什么在 LLM 领域这通常指 RLHF (Reinforcement Learning from Human Feedback)。 我们不给模型标准答案了而是给它一个问题让它自己生成几个回答。然后我们或者一个模拟人类的奖励模型给这些回答打分“这个好1分那个差-1分”。模型通过试错自己琢磨出什么样的回答能拿高分。2.目的“对齐” (Alignment)。让模型不仅能回答问题还能回答得更安全、更有逻辑、更符合人类价值观。同时RL 能帮助模型突破 SFT 的天花板通过探索找到比训练数据更好的解法比如 AlphaGo 下出了人类棋谱里没有的招数。3.数据形式Prompt Reward Signal好坏评分。4.核心优势解决了“有些东西很难写出标准答案但很容易判断好坏”的问题比如写一篇“幽默”的小说很难手把手教但很容易判断是否好笑。五、大模型对齐算法(Alignment)1.概念(1)PPO(Proximal Policy Optimization)1.地位RLHF基于人类反馈的强化学习的**“工业界标准”**也是 OpenAI 训练 ChatGPTGPT-3.5/4时使用的核心算法。2.原理 PPO 是一种经典的强化学习算法。它采用 Actor-Critic (演员-评论家)架构。Policy 策略模型/Actor模型生成回答Reward Model 奖励模型给回答打分Critic 评估模型评估这个状态的价值PPO通过比较更新Actor的参数让它下次生成分数更高的回答。为了防止模型更新步子迈得太大导致“学坏”PPO引入了“裁剪(Clipping)”机制限制每次更新的幅度。3.痛点极度消耗显存训练极不稳定。标准的 PPO 训练过程中通常需要同时加载 4 个模型 (Actor, Reference, Reward, Critic)对 GPU 资源要求极高且超参数很难调。(2)DPO (Direct Preference Optimization)1.地位RLHF 的**“简化颠覆者”**由斯坦福大学在 2023 年提出。它让很多开源模型(如Llama 3的某些微调版本)放弃了 PPO。2.原理 DPO 的核心思想是不需要显式的奖励模型Reward Model。 它通过数学推导证明可以直接利用人类的偏好数据即“A回答比B回答好”这种数据对来优化模型。它把复杂的强化学习问题转换成了一个类似于“分类”的损失函数问题。公式直觉如果不在这儿好的回答就在那儿坏的回答。让模型生成好回答的概率变大生成坏回答的概率变小。3.优点省资源不需要单独加载巨大的奖励模型和 Critic 模型。稳定训练过程比 PPO 稳定得多不容易跑飞。4.缺点 完全依赖于偏好数据的质量对于一些复杂的推理任务如奥数题可能不如 PPO 这种通过探索Explore带来的上限高这也是目前学术界争论的点。5.拓展 面试题QDPO实际上也有Reference Model为什么说它省显存A “确实DPO训练时也需要计算Reference Model 的 Log Probability。但Reference Model是冻结的(Frozen)不需要计算梯度也不需要优化器状态(Optimizer States)所以显存占用只有训练模型的一半甚至更少。而PPO的Critic是要训练的需要存梯度和状态那是实打实的显存大户。”(3)GRPO (Group Relative Policy Optimization)1.地位“效率优化版 PPO”由 DeepSeek(深度求索)在DeepSeek-V3和R1中发扬光大。2.原理GRPO依然是基于PPO的思路但它砍掉了PPO中最占资源的Critic(价值模型)。怎么做到的 传统的 PPO 需要 Critic 来告诉模型“现在的表现相对于平均水平怎么样”。GRPO 则是让模型对同一个问题生成一组(Group) 回答比如生成 64 个然后计算这组回答的平均奖励。3.优势(1)相对优势某个回答的奖励如果高于这组的平均值就鼓励该回答反之则抑制。(2)核心优势省去了 Critic 模型在大模型时代Critic 模型通常和主模型一样大。去掉它意味着显存占用大幅减少训练速度变快。适合推理(Reasoning)DeepSeek R1 使用它在数学和代码任务上取得了巨大成功证明了它在长链条推理能力培养上的有效性。2.PPO、DPO、GRPO的区别(1)成本与效果的权衡PPO、DPO、GRPO都是post-training阶段的大模型对齐算法 (Alignment)都属于RLHF(1)PPO是代价最高效果最好的。(传统在线强化学习方案训练代价最高、工程最难效果上限高但落地成本极高)。[OpenAI的GPT在早期RLHF时用的就是PPO](2)DPO是实现最简化的成本最低(训练稳定易复现)效果略低于PPO和GRPO。目前业界首选。(3)GRPO属于在DPO和PPO之间取了折中只牺牲极少效果就能大幅降低对齐成本性价比最高。(DPO成本最低PPO效果最好)。DeepSeek用的便是GRPO对齐算法GRPO是deepseek能火的一个关键原因之一在稍微牺牲了一点效果的情况下大幅度降低了成本主观打分PPO效果10分DPO效果9分GRPO效果9.5分PPO成本10分DPO成本1分GRPO成本2.5分定性DPO 离线刷题省资源上限低PPO/GRPO 在线试错费资源上限高原理GRPO 赢在用 Group Statistics 杀死了 Critic Model。应用学说话用 DPO学奥数/写代码用 GRPO。(2)本质权衡 显存效率、训练稳定性、探索能力1.这三者本质上是在权衡 显存效率、训练稳定性 和 探索能力。(1)PPO是工业界的 Baseline它是Online算法有Critic网络虽然稳但显存开销大。(2)DPO是为了去繁就简把强化学习转化成了Offline的分类问题(SFT的变种)去掉了Reward和 Critic模型省显存但失去了模型自我探索(Explore)产生新解的能力。(3)GRPO是DeepSeek为了解决PPO在超大模型上显存不够用而搞出来的优化版。GRPO用一组采样的平均分(平均奖励Mean Reward)作为Baseline以此去掉了Critic(价值函数Value Function)。特别适合长思维链(CoT)的推理训练。(3)各自的适用场景选择 PPO/DPO/GRPO 取决于我们想要模型学会什么。如果要学‘语气、格式、安全’Style SafetyDPO 是首选。因为这些任务有明确的好坏之分给数据就行不需要模型去‘顿悟’。如果要学‘数学、代码、逻辑推理’ReasoningDPO 就乏力了。因为 DPO 是由人类数据喂出来的它很难超越人类标注的上限Data Bound。GRPO/PPO 的核心优势在于 Exploration探索。在推理任务中模型可以通过采样生成多种解题路径只要结果对比如通过单元测试哪怕路径是人类没教过的模型也能获得奖励。这就是 DeepSeek-R1 能产生‘Aha Moment’顿悟时刻的原因——它是试出来的不是背出来的。” 核心得分点DPO 上限由数据决定RL (GRPO/PPO) 上限由环境反馈决定可超越人类。(4)实战设计一个类似DeepSeek R1的训练流程“我会参考 DeepSeek-R1 的 Pipeline分阶段进行1.Cold Start (冷启动)先用少量高质量的 CoT(思维链)数据做 SFT让模型学会先思考再回答的模式。2.纯RL阶段 (GRPO)这是关键。(1)重点我不会训练复杂的神经网络 Reward Model。(2)技巧对于数学/代码题直接用**规则(Rule-based)**给分。答案算对给1分跑通代码给1分格式不对给0分。(3)让模型在GRPO的机制下通过大规模采样(Group Sampling)自己去卷出最有效的思维链路径。3.迭代把RL跑出来的优秀样本收集起来再做一轮 SFT循环往复。” 核心得分点提到 Rule-based Reward规则奖励在推理任务中的巨大价值比训练一个黑盒 RM 更准、更便宜。六、KL散度1.概念KL散度 (Kullback–Leibler divergence)用来衡量两个概率分布 P 和 Q 的“差异” (更准确说是 用Q去近似P会损失多少信息)2.公式(1)离散情形 (Discrete Case):D KL ( P ∥ Q ) ∑ x P ( x ) log ⁡ P ( x ) Q ( x ) D_{\text{KL}}(P\|Q) \sum_{x} P(x) \log \frac{P(x)}{Q(x)}DKL​(P∥Q)x∑​P(x)logQ(x)P(x)​(2)连续情形 (Continuous Case):D KL ( P ∥ Q ) ∫ p ( x ) log ⁡ p ( x ) q ( x ) d x D_{\text{KL}}(P\|Q) \int p(x) \log \frac{p(x)}{q(x)} \, dxDKL​(P∥Q)∫p(x)logq(x)p(x)​dx3.作用在 RLHF / PPO 里经常加 KL 惩罚项让新策略当前模型不要偏离参考策略(通常是 SFT 模型)太远防止“为了拿高奖励”而语言质量崩、胡乱钻奖励模型空子(reward hacking)七、Agentic RL (智能体强化学习)1.如果说传统的 RLHF基于人类反馈的强化学习是让模型学会“说话得体”那么 Agentic RL 则是让模型学会“办事靠谱”。2.传统 RLS t a t e → A c t i o n → R e w a r d State \rightarrow Action \rightarrow RewardState→Action→Reward例如下围棋、控制机械臂。Agentic RLT a s k → P l a n n i n g → T o o l U s e → F e e d b a c k → A d a p t a t i o n Task \rightarrow Planning \rightarrow Tool\ Use \rightarrow Feedback \rightarrow AdaptationTask→Planning→ToolUse→Feedback→Adaptation例如自主编写代码、查阅文档并修复 Bug。3.Agentic RL 的实现通常依赖于以下“组件”的协同多轮推理与规划 (Planning) Agent 不再是一次性输出答案而是学习如何将大任务拆解为子任务如 Chain-of-Thought 或 Tree-of-Thoughts。工具使用 (Tool Use) 学习在什么时候调用搜索、计算器或数据库。RL 的目标是让模型学会“最有效地使用工具”而不是盲目调用。可验证反馈 (Verifiable Rewards) 相比于人类主观偏好RLHFAgentic RL 更偏向使用客观结果作为奖励。例子 代码是否通过了 Unit Test数学题答案是否正确自我反思与迭代 (Reflexion) 模型在收到错误反馈后通过 RL 学习如何调整接下来的策略而不是在错误路径上死磕

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号