恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

[论文笔记] mixSGA HMoE BrownoutMoE

  • 首页
  • 资讯中心
  • /
  • [论文笔记] mixSGA HMoE BrownoutMoE

相关资讯

Harmony os 技术实战|拼豆制图45:上传生成链路如何用状态机替代散落字符串 2026/8/25 13:29:52
拆解多设备屏幕适配:原生鸿蒙页面的实现路径与调试方法 2026/8/25 13:29:52
华为鸿蒙CodeGenie修改代码用glm5.2和deepseek-v4-pro的差别 2026/8/25 13:29:52

最新资讯

Flint 内购集成完全指南:如何用 PurchaseTracker 跟踪购买状态并解锁高级功能
树状数组(BIT)原理与lowbit位运算详解
dragUI架构全景图:Vuex状态管理与本地存储如何记住你的每一次设计
判断VQVAE是否“学废了“的两个神奇指标:deep-vector-quantization中perplexity与cluster_use详解
Java Excel导入导出的健壮校验设计与POI实战
从NeRF到Relightable3DGaussian:实时点云重光照的5大技术突破与实现路线对比

今日推荐

三步把QQ空间历史说说导出到本地:GetQzonehistory 极简指南
洛谷 P7912:[CSP-J 2021 T4] 小熊的果篮 ← 双向链表
Transformers.js 网页端图像抠图实战:零后端 3 行代码返回透明 PNG

本周热门

Nextcloud 桌面客户端:把同步交给它,你只管改文件
如何将 HTML 转成 Word 文档且格式不丢失?html-to-docx 使用教程
Anki 批量操作卡片完整指南:一次搞定上千张,不再逐张修改

本月精选

如何用DamaiHelper实现演唱会门票的智能自动化抢购:完整技术解决方案指南
第4篇:59 倍性能差距的索引瓶颈定位——一次教科书级的全表扫描调优
终极歌词批量下载神器:5分钟解决离线音乐库歌词同步难题

[论文笔记] mixSGA HMoE BrownoutMoE

发布时间:2026/8/25 13:29:52
[论文笔记] mixSGA HMoE BrownoutMoE 三篇 MoE 相关论文对比梳理三篇论文分别从注意力层 KV 缓存优化、异构专家架构设计、MoE 线上推理服务部署优化三个不同维度对混合专家模型做创新下面分别解析核心思想、创新点、差异对比。1. Mixture of Weight‑shared Heterogeneous Group Attention Experts for Dynamic Token‑wise KV OptimizationEMNLP 2025mixSGA基于共享权重的异构组注意力专家混合模型用于动态逐令牌键值优化问题背景大模型推理 KV 缓存占用内存巨大GQA 等静态分组 KV 方案采用固定分组粒度无法适配不同 token 的重要程度要么丢弃低优先级 token要么统一粗粒度分组造成性能损失。核心方案 mixSGA把 MoE 思想应用到注意力模块不是 FFN 专家构建一组异构分组注意力专家各个专家拥有不同 KV 分组大小。逐 token 专家选择路由依据学习得到 token 重要性分数把不同 token 路由到不同 KV 粒度的注意力专家保留全部 token不做丢弃重要 token 分配细粒度 KV普通 token 分配粗粒度 KV。专家之间权重共享注意力投影层权重共享控制参数量开销。辅助损失函数约束路由接近 one‑hot保证训练、推理行为一致。实验效果在相同 KV 缓存预算下Llama3、OPT、Gemma2 等模型上指令微调、继续预训练任务获得更低困惑度、更高 ROUGE‑L降低 KV 内存占用优化注意力计算开销。定位注意力层架构创新解决 KV Cache 内存瓶颈。2. HMoE: Heterogeneous Mixture of Experts for Language Modeling用于语言建模的异构专家混合模型问题背景传统 MoE 全部使用同尺寸专家但输入 token 语义复杂度差异巨大简单 token 和复杂 token 需要的模型容量不一样同构专家很难适配不同难度样本参数利用效率低。核心方案 HMoEFFN 专家采用异构尺寸专家网络大小各不相同具备不同模型容量。支持 Top‑K固定激活专家数量、Top‑P动态自适应激活专家数量两种路由复杂 token 分配到大容量专家简单 token 分配小容量专家。专门设计训练损失提升小专家被激活概率缓解异构专家带来的激活负载不均衡。实验效果同等激活参数量下相比传统同构 MoE 获得更好语言建模性能同等性能下降低计算 FLOPs。定位Transformer FFN 层架构创新改变专家本身网络大小异构专家原生模型架构。3. BrownoutMoE: Structure‑Aware Expert Grouping for Efficient and Accurate LLM Web‑based ServicesarXiv:2607.04164面向结构感知的专家分组实现高效且准确的基于 Web 的 LLM 服务arXiv问题背景MoE 在线 Web 服务存在专家访问严重倾斜少量热专家处理绝大多数 token大量冷专家极少被调用GPU 利用率低。之前 BrownoutServe 采用按索引顺序简单合并专家为联合专家 (united expert)会把行为差异大专家合并蒸馏后精度损失大。核心方案 BrownoutMoE面向线上推理服务系统优化离线对原始专家做分组合并蒸馏在线做 SLO 感知动态降载brownout 降压保供范式。将分层专家分组建模为离散策略优化问题使用GRPO 强化学习搜索最优分组初始化依靠专家输出相似度层次聚类优先把行为相似专家划分同一组。两阶段流水线GRPO 搜索分组策略 → 分组一致知识蒸馏得到可部署联合专家模型。控制平面 SLO 感知延迟控制器线上根据 P90 延迟动态调整阈值冷专家 token 可路由到蒸馏后的联合专家牺牲少量精度保障响应时延 SLO。实验效果对比顺序分组基线精度退化最高减少 71.4%吞吐最高提升 2.24×基于 Qwen1.5‑MoE‑A2.7B 验证。定位MoE 推理服务系统优化不修改原生 MoE 网络结构后处理方式对已有训练完成 MoE 模型做专家合并蒸馏面向 Web 线上部署。三篇论文关键差异总表表格论文优化对象创新层面是否修改原生模型架构核心技术目标收益mixSGAAttention 注意力层 KV 缓存模型架构✅修改注意力模块异构分组注意力专家、token‑wise 路由、权重共享降低 KV Cache 内存开销HMoEFFN 专家网络模型架构✅修改 FFN 专家尺寸大小异构 FFN 专家、异构路由损失提升参数利用率、降低 FLOPsBrownoutMoEMoE 推理部署服务系统 后训练蒸馏❌不改动原生模型离线做专家合并蒸馏GRPO 专家分组搜索、联合专家蒸馏、SLO‑aware brownout 控制提升线上推理吞吐保障服务时延 SLO控制精度损失补充区分要点mixSGA 把 MoE 思想迁移到注意力HMoE、BrownoutMoE 聚焦传统 FFN MoEHMoE 是训练阶段原生异构专家架构BrownoutMoE 是对已经训练好的 MoE 做后处理属于服务侧优化BrownoutMoE 继承 BrownoutServe 的联合专家与 brownout 降载思想解决它顺序分组带来精度损失的短板。

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号