恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

DPRFuzz:两阶段强化学习实现「精准引导 + 高效探索

  • 首页
  • 资讯中心
  • /
  • DPRFuzz:两阶段强化学习实现「精准引导 + 高效探索

相关资讯

办公室扩展系统上线前,阿尔法测试为何是必做的质量关卡 2026/9/1 7:20:31
Buck/Boost开关电源参数设计:从理论公式到工程实践的完整指南 2026/9/1 7:20:31
构建高可用ASP.NET Core Web API:从代码健壮到多实例部署的实战指南 2026/9/1 7:20:31

最新资讯

EPICS Archiver Appliance在Ubuntu上的部署与配置实践
用LLM API复刻贵价SaaS:从按月订阅到按token计费
Go控制流程与循环陷阱:从入门到线上事故复盘
Go变量与类型系统深入理解与避坑指南
用Python下载arxiv论文
旋变解码实战:STM32+AD2S1210硬件配置与SPI数据读取

今日推荐

自研推理加速器Redwood:两周内实现PyTorch模型高效部署的实战教程
V4L2摄像头采集实战:从camera_client.rar到出图全流程解析
从“谁发明了钢琴键”到知识问答智能体:RAG与记忆工程实践

本周热门

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析
数字电路时序基石:深入理解建立时间与保持时间
蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

本月精选

自研推理加速器Redwood:两周内实现PyTorch模型高效部署的实战教程
V4L2摄像头采集实战:从camera_client.rar到出图全流程解析
从“谁发明了钢琴键”到知识问答智能体:RAG与记忆工程实践

DPRFuzz:两阶段强化学习实现「精准引导 + 高效探索

发布时间:2026/9/1 7:20:31
DPRFuzz:两阶段强化学习实现「精准引导 + 高效探索 模糊测试Fuzzing是目前最有效的漏洞挖掘技术之一而 AFLAmerican Fuzzy Lop是最具代表性的覆盖率引导 fuzzing 工具。然而AFL 的变异过程存在两大痛点确定性变异阶段穷举式遍历变异策略和位置计算开销大Havoc 随机变异阶段随机拼接变异策略链产生大量无效样本。北航团队提出 DPRFuzz首次将强化学习RL引入 AFL 两大变异阶段实现「精准引导 高效探索」。论文标题DPRFuzz: Enhancing Vulnerability Mining With Two-Stage Reinforcement Learning发表期刊IEEE Transactions on Industrial Informatics, Vol.21, No.11, November 2025作者单位北京航空航天大学、北京邮电大学开源代码http://github.com/Lastfarewell2/RLFuzz01 方法介绍DPRFuzz 采用两阶段 RL 优化策略①确定性变异策略优化DQN TRPO——将变异过程建模为马尔可夫决策过程通过 Q 值函数预测最有效的变异算子变异策略 × 变异位置利用经验回放机制加速训练通过 KL 散度约束新旧策略的相似性保证策略更新的稳定性同时提升经验利用率。两者结合既能高效探索又能稳定收敛。②Havoc 随机变异优化改进的 TS 算法——将 Havoc 阶段的选择建模为多臂老虎机问题利用 Beta 分布建模各策略的有效概率引入多智能体投票机制多个代理从不同角度学习变异奖励输出全局最优的变异策略链。小结DQN/TRPO 负责「精准预测有效变异算子」改进 TS 负责「高效生成变异策略链」两阶段协同互补增强。02 关键机制价值-策略双导向模型——DQN 负责 Q 值预测TRPO 约束策略更新两者结合解决确定性变异阶段的盲目性问题。改进的 Thompson Sampling——用 Beta 分布建模变异策略有效概率轻量级平衡探索与利用。多智能体投票机制——多个代理从不同角度学习变异奖励协同输出全局最优策略链。轻量化设计——单轮变异额外时间小于 1.5 秒性价比极高。小结四个机制形成「精准预测 → 高效生成 → 协同优化 → 轻量落地」的完整闭环。03 实验结果在 8 个真实程序readelf、nm、objdump、tcpdump、jpegtran、tiffsplit、minigzip、xmllint上运行 24 小时对比 AFL、AFL、AFLSmart1变异算子预测准确率AFL-TTTRPOTS在 nm 上对 11 种变异操作实现最高 EPParith 8/8 操作 EPP 达 8.35较原版 AFL 提升 8.16。2边缘路径发现tiffsplit 路径数提升 87.2%tcpdump 24 小时 EPN 达 332624.2%。3有效输入生成tcpdump IG 值达 8537较原版 AFL 提升 76.7%。4Crash 发现总计 312 个 crashvs AFL 原版 73 个tcpdump 提升 239 个。5性能排序AFL-TT AFL-DT AFL-TRPO AFL-DQN证明联合优化优于单一模型。小结两阶段 RL 协同优化覆盖率提升 10%crash 数量显著增加。04 零日漏洞发现DPRFuzz 在真实软件中发现了 5 个零日漏洞•apng2gif内存泄漏可导致系统崩溃•jpegtran×2、tiffsplit内存损坏•qpdf×2内存分配器漏洞处理加密/多页/旋转 PDF 时崩溃 总结DPRFuzz 首个将 RL 引入 AFL 两大变异阶段提出价值-策略双导向模型DQN/TRPO解决确定性变异盲目性设计轻量级探索-利用平衡机制改进 TS优化 Havoc 策略链24 小时实验证明覆盖率提升 10%发现 5 个零日漏洞。将漏洞发现从「穷举 随机」升级为「智能引导 高效探索」标志着 RL 与 Fuzzing 的深度融合成为漏洞挖掘新方向。 欢迎留言讨论• 你认为 RL Fuzzing 的结合会催生下一代金手指纹工具吗• 强化学习在二进制安全领域还有哪些潜力场景 点赞 收藏 分享你的支持是我们持续解析高水平软件安全论文的最大动力

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号