恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
【大模型LLM学习】RLPR——模型的答案置信度作为Reward
首页
资讯中心
/
【大模型LLM学习】RLPR——模型的答案置信度作为Reward
【大模型LLM学习】RLPR——模型的答案置信度作为Reward
发布时间:2026/8/3 11:13:20
1 常用的Reward类型1.1 基于人类/模型偏好的奖励代表方法Bradley-Terry Model, DPO/IPD 隐式奖励工作原理收集(yw,yl)(y_w, y_l)(yw,yl)偏好对ywy_wyw为优选回复yly_lyl为劣选回复训练一个 Reward Model 来拟合人类的偏好。在 PPO 等算法中该 RM 的输出即为奖励信号。优点捕捉复杂、难以形式化的人类价值观如幽默感、同理心。避免了绝对分数标注的困难排序比打分容易。缺点Reward Hacking 重灾区模型容易学会迎合 Reward Model 的偏见而非真实意图如冗长偏差、格式讨好。分布外泛化差RM 在训练数据之外的区域可能给出荒谬的高分。成本高昂需要持续的人工标注或高质量 Judge Model。1.2 Rubric-based Rewards(LLM-as-Judge)工作原理预先定义包含多个维度如准确性、完整性、安全性、语气的评分细则每个维度有明确的等级描述如1-5分及对应标准。Judge Model 根据 Rubric 逐条打分并给出理由最终加权汇总为奖励信号。相比纯偏好奖励的优势可解释性强模型知道“为什么得分/扣分”而非仅得到一个标量分数。细粒度控制可针对特定维度如“减少废话”单独优化避免全局偏好模型的耦合问题。局限性LLM-as-Judge 本身就是 Hacking 来源Judge Model 可能被策略性输出欺骗给出符合量规字面意思但实质错误的高分。高方差奖励信号可能被高方差淹没。设计成本高高质量 Rubric 需要领域专家反复迭代验证。1.3 可验证奖励 (Verifiable Rewards / RLVR)适用场景数学、代码、逻辑推理、事实核查等有明确 Ground Truth 的任务用规则而非LLM来判断结果对不对。工作原理数学任务最终答案精确匹配或符号验证。代码任务运行代码测试根据结果Pass1, Fail0。相比 Rubric/RM 的核心优势真正抗 Reward Hacking编译器/验证器不会被输出欺骗奖励信号与任务真实目标完全一致。无噪声验证结果确定训练更稳定收敛更快。局限性需要准确设计verifier仅适用于可验证任务无法覆盖开放式任务对于不同任务需要设计不同的verifier2 RLPR: Extrapolating RLVR to General Domains without VerifiersRLPR是从另一个角度出发设计的把模型对答案输出打分的prob作为reward信号这样无需每个任务单独设计verifier也不需要LLM-as-judge的方式尤其适合例如deep search这种场景答案形式可能存在多个的情况例如某个问题的答案既可以是马斯克也可以是埃隆马斯克它们指向是一样的使用RLPR的方式是正确答案的情况下prob的概率高错误答案时prob的概率低无需做穷举2.1 基本思想基于一个核心观察LLM 生成正确答案的原生概率可以直接反映模型内部对推理质量的评判。在RLPR 中使用标准答案的逐 token decoding probability 作为 reward signal。现有很多 RLVR 方法依赖领域专用搭建这类验证器需要大量人工启发式规则与工程成本而 RLPR 的 reward 计算仅依赖 policy model 自身设问题QQQ对应的一条输出响应o(o0,⋯ ,oN)o (o_0, \cdots, o_N)o(o0,⋯,oN)oio_ioi代表响应内单个 token。执行概率提取流程从完整序列ooo中拆分出模型生成答案yyy剩余文本为推理过程zzz构造改造序列o′(o0′,⋯ ,oN′′)o (o_0, \cdots, o_{N})o′(o0′,⋯,oN′′)把模型生成答案yyy替换成训练集标准参考答案y∗y^*y∗将o′oo′输入 policy model得到序列概率(p0,⋯ ,pN′)(p_0, \cdots, p_{N})(p0,⋯,pN′)序列 reward 计算公式rfseq({pi∣oi′∈y∗})(2) r f_{\text{seq}}(\{p_i | o_i \in y^*\}) \tag{2}rfseq({pi∣oi′∈y∗})(2)fseqf_{\text{seq}}fseq的作用是把多个逐 token probability 聚合为单个标量 reward。如果选用序列似然归一化概率乘积fseq∏pnf_{\text{seq}}\sqrt[n]{\prod p}fseqn∏p虽然能够表征参考答案整体生成概率但存在方差过高、对同义词、微小token波动极度敏感的缺陷。举例token概率序列(0.01,0.7,0.9)(0.01, 0.7, 0.9)(0.01,0.7,0.9)和(0.05,0.7,0.9)(0.05, 0.7, 0.9)(0.05,0.7,0.9)仅首token存在小幅差异乘积形式下得分差距巨大。为此 RLPR 改用token均值fseq1∣y∗∣∑pi f_{\text{seq}} \frac{1}{|y^*|}\sum p_ifseq∣y∗∣1∑pi均值聚合得到更鲁棒的 reward signal与答案质量相关性更强。该概率奖励具备直观特性当模型输出答案yyy和参考答案语义接近时获得高 reward反之 reward 偏低。2.2 Reward Debiasing虽然基于概率的 reward 和响应质量具备强相关性但结果会被多种隐变量干扰。将概率奖励rrr的来源记作UrU_rUr做隐因子分解UrUzUothers(3) U_r U_z U_{\text{others}} \tag{3}UrUzUothers(3)UzU_zUz推理内容zzz带来的影响UothersU_{\text{others}}Uothers问题、参考答案等其余外部因素带来的干扰。直接使用原始rrr作为 reward会引入UothersU_{\text{others}}Uothers带来的偏差损害奖励有效性。RLPR 的去偏方案不经过中间推理zzz直接让模型解码参考答案y∗y^*y∗算出基准分数r′rr′。可以认为Uz≈Ur−r′U_z \approx U_r - rUz≈Ur−r′最终去偏概率奖励r^clip(0,1, r−r′)(4) \hat{r} \text{\(\text{clip}\)}(0, 1,\ r - r) \tag{4}r^clip(0,1,r−r′)(4)clip\text{\(\text{clip}\)}clip限制 reward 落在0,1区间。该形式剔除了问题UQU_QUQ、参考答案Uy∗U_{y^*}Uy∗的固有偏差。2.3 Standard Deviation Filtering传统 RLVR在Rollout时会过滤掉过难、过简单的样本只保留中等难度样本稳定训练做法是剔除全部正确/全部错误的样本例如DAPO和DUPO中。但 RLPR 的 reward 是连续值无法直接套用基于二元对错的过滤方式很难设定通用阈值区分样本好坏。通过分析精度过滤机制RLPR 提出替代方案过滤 reward 标准差过低的prompt。PR reward 被约束在 (0,1)如果一个样本所有Rollout输出全部高分 / 全部低分分数对应的标准差会很小对应样本就是极度简单/极度困难样本丢弃 reward 标准差β\betaβ的样本基于每一步训练样本的平均标准差动态更新阈值β\betaβ。2.4 RLPR的优点与E-GRPO《Repurposing Synthetic Data for Fine-grained Search Agent Supervision》类似在E-GRPO中在输出答案和标准答案不一样时会看推理过程里面提及的实体和推理标准答案所需实体的交集打一个软分数而不是直接赋0分把全错和部分错区分出来。RLPR也能够灵活的处理这种假阴性的情况文中把模型的输出人工进行了标注人工判断回答对/错作为金标准对比不同的verifierRLVR的方式AUC是很低的(容易错误把正确答案判断为错误的)RLPR的AUC非常高即使在数学等完全标准答案的数据集上RLPR未必会输给RLVR对于Deep Search、Deep Research、知识问答等任务RLPR可能是一个更好的选择