恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

Miles:高性能企业级强化学习框架,为大规模模型后训练带来多项突破!

  • 首页
  • 资讯中心
  • /
  • Miles:高性能企业级强化学习框架,为大规模模型后训练带来多项突破!

相关资讯

微软推 Project Zenith 优化 Windows 体验,开发者本地运行超 300 亿参数模型不是梦 2026/9/6 13:42:44
海尔12kg波轮洗衣机深度评测:省钱663元背后的选购逻辑 2026/9/6 13:37:44
自动化批量任务实战:提链流程编排与工程实现解析 2026/9/6 13:37:44

最新资讯

意识模拟的不可计算性:从图灵机到神经科学的理论挑战
Python整洁代码与编码规范:从能跑到能维护的工程化实战
户外电源怎么选?从1度电、磷酸铁锂到正浩电小二大疆全解析
Qt/C++手搓可视化PID调参控件
100英寸电视选购与安装避坑指南:康佳100G10深度解析
电机控制到车规芯片平台开发:嵌入式工程师的进阶路线图

今日推荐

超人会飞不算本事:系统稳定依赖清晰规则与边界设计
超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论
基于CNN的调制信号识别:MATLAB实现时频图分类实战

本周热门

超人会飞不算本事:系统稳定依赖清晰规则与边界设计
超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论
基于CNN的调制信号识别:MATLAB实现时频图分类实战

本月精选

自研推理加速器Redwood:两周内实现PyTorch模型高效部署的实战教程
V4L2摄像头采集实战:从camera_client.rar到出图全流程解析
从“谁发明了钢琴键”到知识问答智能体:RAG与记忆工程实践

Miles:高性能企业级强化学习框架,为大规模模型后训练带来多项突破!

发布时间:2026/9/6 13:42:45
Miles:高性能企业级强化学习框架,为大规模模型后训练带来多项突破! 面向大规模模型后训练的企业级强化学习网站、文档、快速开始、支持的模型、Miles 扩散模型等相关链接待补博客、Slack (#miles-rl)、新闻等相关链接待补。2026 年各月动态如下[2026/08] Miles v0.1 版本发布可阅读博客文章Miles v0.1生产级后训练[2026/07] 有多条动态包括迈向原生 Blackwell 的 8 位和 4 位强化学习Miles 中的端到端 MXFP8 和 NVFP4 强化学习SGLang 和 Miles 为 Kimi K3 提供首日支持Miles 引入策略内蒸馏SGLang 和 Miles 为前沿多模态模型 Inkling 提供首日支持借助 MilesDeepSeek - V4 闪存强化学习训练登陆 AMD Instinct MI355X[2026/06] SGLang 和 Miles 为 NVIDIA Nemotron 3 Ultra 提供首日支持[2026/05] 一个 token 都不落下Miles 中的 token 输入 - token 输出[2026/04] 数秒内更新 1T 参数大规模分布式强化学习中的 P2P 权重传输DeepSeek - V4 首日支持通过 SGLang 和 Miles 实现从快速推理到经过验证的强化学习。关于 MilesMiles 是一个高性能、适用于企业的强化学习框架专为大规模模型后训练而设计。它将用于高吞吐量采样的 SGLang 与可扩展训练的 Megatron - LM 相结合具备在万亿参数规模下进行强化学习所需的精度、稳定性和可观测性特性。对于希望直接训练 HuggingFace 实现的运行也提供了 PyTorch FSDP2 后端不过相关配方、并行策略和最大规模的模型都基于 Megatron - LM。详见训练后端。“千里之行始于一次采样。”性能全异步强化学习采样和训练工作进程相互解耦支持可配置的策略内和策略外调度经过优化的流水线减少了空闲时间还提供可定制的异步采样和评估模式。详见全异步强化学习。快速智能体采样生成过程在 SGLang 上运行通过路由器将请求分发到各个引擎保留每个请求的元数据并对集群进行健康检查。针对多轮智能体工作负载进行了优化。快速权重更新即使是像 Kimi - K2.6 这样的万亿参数模型新的权重也能在数秒内通过 P2P RDMA 快速路径更新到引擎中适用于分布式设置。低精度训练支持 MXFP8 和 NVFP4 训练采用数值稳定的强化学习配方减少因精度问题导致的偏差。同时也支持 FP8、INT4 QAT、BF16 和 FP16。LoRA 和多 LoRA低秩适配器可以在少量 GPU 上训练前沿规模的模型并且相同的适配器可以直接加载到 SGLang 中进行采样。正确性和弹性Token 输入 - Token 输出TITO支持所有模型和黑盒封装在采样和训练之间无需进行解 token/重新 token 化的往返操作。采样路由重放R3在训练器的前向传播过程中重放采样期间记录的专家路由消除了在大规模运行中导致不稳定的混合专家MoE路由不匹配问题同时通过计算和通信重叠降低成本。容错能力当 SGLang 引擎出现故障时Miles 能够恢复并继续运行无需重启或暂停。Miles 支持的运行内容首日模型支持DeepSeek - V4、Kimi - K3、GLM - 5.2、Inkling 和 Nemotron 在发布当天即可支持。除了发布首日支持的模型外几乎所有前沿模型都能在 Miles 上运行包括 Kimi - K2.6 和 Qwen3.5。详见模型。广泛的硬件支持通过 ROCm 支持 NVIDIA GB300、GB200、B300、B200、H200、H100 和 A100以及 AMD MI300X、MI325、MI350 和 MI355X。详见安装了解每个 GPU 的支持状态和相应的容器镜像。丰富的配方支持支持 GRPO、GSPO、PPO 和 REINFORCE 等强化学习算法以及监督微调SFT和策略内蒸馏。智能体环境通过与 Harbor、HUD、NeMo Gym、OpenEnv、Verifiers 等的连接器来训练编码和计算机使用智能体每个连接器都可以插入适合它的采样层并在 AgentENV、Daytona、E2B 或 Modal 上使用任务沙箱。详见智能体环境。扩散模型在 Miles - diffusion 中支持基于 sglang - diffusion 采样引擎和 FSDP2 训练器的 Flow - GRPO、DiffusionNFT 和 SFT。快速开始安装 Miles、快速开始、支持的模型、核心概念、启动脚本演练、训练后端、贡献指南等相关链接待补。致谢Miles 派生自 slime并集成了 SGLang、Megatron - LM 和 torch_memory_saver。Miles 的发展离不开众多团队的支持从硬件和云服务提供商到模型实验室、智能体基础设施团队和学术界。引用如果 Miles 在你的研究或产品中发挥了作用请引用它misc{miles2026, title Miles: Enterprise - Grade Reinforcement Learning for Large - Scale Model Post - Training, author Miles Team, year 2026, howpublished \url{https://github.com/radixark/miles}}

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号