恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

深度 | V4 上国芯真正的瓶颈是那张网:52% 时间在通信,互连墙卡住千亿模型

  • 首页
  • 资讯中心
  • /
  • 深度 | V4 上国芯真正的瓶颈是那张网:52% 时间在通信,互连墙卡住千亿模型

相关资讯

FastReport .NET C# 报表开发工具最新版|支持打印、设计与跨平台部署 2026/8/26 19:42:33
如何免费给老 Mac 装上最新 macOS?完整实操指南 2026/8/26 19:42:33
Git 本地项目上传至gitlab保姆级教程 2026/8/26 19:42:33

最新资讯

数学建模竞赛必备:Lingo优化软件从入门到实战指南
从零开始AI Agent开发:核心技术、实践路径与典型应用
构建高可用后端系统的核心组件与架构实践
忆阻器从原理到工程实践:RRAM测试、神经形态计算与存算一体全解析
国赛大纲深度解读:从战略地图到实战计划的竞赛指南
Sequelize ORM 实战指南:从模型定义到关联查询与性能优化

今日推荐

Python random 模块常用函数详解:从入门到实战
Hermes接入团队协作后,我推翻了三个效率假设
免费AI大模型调教指南:打造专属网文写作助手

本周热门

Nextcloud 桌面客户端:把同步交给它,你只管改文件
如何将 HTML 转成 Word 文档且格式不丢失?html-to-docx 使用教程
Anki 批量操作卡片完整指南:一次搞定上千张,不再逐张修改

本月精选

如何用DamaiHelper实现演唱会门票的智能自动化抢购:完整技术解决方案指南
第4篇:59 倍性能差距的索引瓶颈定位——一次教科书级的全表扫描调优
终极歌词批量下载神器:5分钟解决离线音乐库歌词同步难题

深度 | V4 上国芯真正的瓶颈是那张网:52% 时间在通信,互连墙卡住千亿模型

发布时间:2026/8/26 19:42:33
深度 | V4 上国芯真正的瓶颈是那张网:52% 时间在通信,互连墙卡住千亿模型 深度 | V4 上国芯真正的瓶颈是那张网52% 时间在通信互连墙卡住千亿模型核心观点DeepSeek V4 这个 384 专家、top-6 的千亿 MoE被政策逼上国产芯片后真正的瓶颈早已不是 FLOPS而是那张 scale-up 互连网。昇腾 910C 上 52.2% 的设备时间花在通信而文献里 all-to-all 占比是 45%–67% 的结构常量对面英伟达的 NVLink 6 已经做到每芯片 3.6TB/s 在线带宽 SHARP 网内归约昇腾 UB 总线官方口径还停在「数百 GB/s」。跑得动算不完、算得快发不动——这才是国芯千亿模型的第二张墙。证据等级[A] 官方/一手 [B] 2可靠来源 [C] 单一来源 [D] 个人判断一、被算力叙事盖住的第二张墙过去半年「V4 上国芯」的讨论几乎全被两道账占据性能账单卡多少 FLOPS和产能账昇腾 950 什么时候放量。上一期我拆了软件税——200 个算子重写、30 人年。但有一个结构性变量被系统性低估通信。V4 是个 1.6T 总参、每 token 激活 49B 的 MoE——384 个路由专家、top-6 路由。这类模型的算力结构里藏着一个先天矛盾这类模型的算力结构里藏着一个先天矛盾专家分布在不同的节点上每个 token 得先把自己的数据「投递」给命中的专家dispatch等专家算完再把结果「汇拢」回来combine。这两步全对全all-to-all通信是串行的——计算能靠流水线藏一部分通信的串行依赖很难藏。通信开销有多大多篇一手论文反复量化过LSH-MoENeurIPS 2024说 all-to-all「平均占训练时间 45%、最高 67%」而且「不随规模缩小」OccultICML 2025等也给出「大规模训练中超过 40%」的同类结论 [B]。华为自己的生产系统论文给出了最贴近 V4 的数字CloudMatrix384 上的 xDeepServe 测出 dispatch 平均 234 微秒、combine 312 微秒dispatchcombine 至少占 MoE 执行时间 25%、在 decode 时延里约 36% [A]。把昨天河套-哈工大团队的 52.2% 放进去一张「互连墙」的轮廓就清晰了。二、技术深潜MoE 的通信机构造与国芯互连的物理差距V4 用细粒度专家并行EP把 384 个专家铺到超节点上。以 top-6 路由为例任何 token 都可能命中 6 个不同位置的专家——于是每个 token 至少跨节点投递一次、收拢一次。每 token 只激活 49B、总参却有 1.6T绝大多数专家权重都「沉」在别处token 的跨节点命中率极高。这就是为什么 EP 的 all-to-all 是「高对分带宽、高时延敏感」的持续风暴不是偶尔一次的同步。关键在时延而不是单纯带宽。华为论文里 XCCL 的数字暴露得很清楚小于 1MB 的点对点时延低于 20 微秒——这已经很好。但一旦走上 all-to-all 集体路径dispatch 就是 234 微秒、combine 是 312 微秒 [A]集体路径时延是点对点原语的 15 倍。差距不在物理链路而在集体通信的调度与拓扑。这告诉我们的不是「加带宽就行」而是集体效率本身才是优化的主战场。上图V4 的 MoE 结构把通信变成每层每 token 的一次性串行风暴国芯互连与 NVLink 6 差约一个数量级。打开两边的官方数据NVLink 数字为 NVIDIA 官方 [A]昇腾 UB 为华为论文口径 [A]指标NVIDIA NVLink 6华为昇腾 UB 总线每芯片在线带宽3.6 TB/s36 链路「数百 GB/s、比 RoCE 快数倍」最大机架聚合NVL72 总计 260 TB/s无同等公开数字网内归约SHARP网内 reduction/multicastXCCL 靠调度算法弥补集体路径时延无公开数字dispatch 234μs / combine 312μs最扎眼的是「网内归约」这一行。NVIDIA 的 NVLink 6 Switch 里嵌了 SHARP 引擎把梯度归约、token 聚合做在交换芯片上不占 GPU 计算和链路带宽这正是今天 Hot Chips 官方披露 Rubin 时讲的「counted writes」——用计数器取代 flag-and-ack 握手省掉同步回执流量 [A]。国产侧对应的功夫在 XCCL 的调度算法上LocMoEarXiv:2401.13920在昇腾集群靠局部性感知路由把每轮训练缩短 12.68% 到 22.24% [A]。也就是说国芯缺网内归约硬件只能用软件调度把伤补回一部分补不回全部。诚实标注一处公众流传的「昇腾 950DT 互连 2TB/s」我没在一手来源里核实到华为官方口径是「数百 GB/s」[C]灵衢 2.0 的具体带宽我也没有可验证的官方数字——这是本篇证据最薄的一处。若它属实国芯 scale-up 的追赶速度比我描述的快届时应上调判断。三、竞争格局互连墙决定三种路线的物理上限剥到互连层「V4 上国芯」其实是三种物理路线的分野。昇腾走「封闭全栈 专有总线」UB 总线、XCCL、CloudMatrix 形态都是它自己的。好处是能把 dispatch/combine 联合优化到 25%–36%低于行业 45% 的平均线坏处是这套东西出了华为生态就无法复用——它本质就是昇腾的「NVLink」闭源、不可互通。开放开源路线UCIe、CXL、以太网/UEC对国芯有强烈的镜像意义中国买不到 NVLink 级的专有规模所以国产 scale-up 天然更倾向「无损以太网 智能网卡/光」——阿里的 UBoE 就是这个方向的一个入口 [C]。但开放路线的代价是更低的对分带宽效率和更贵的软件栈这正是 MoE all-to-all 最怕的。NVIDIA 在这一层是「规则制定者」NVLink 6 的 3.6TB/s SHARP 把通信占比物理性往下压这是国芯用软件调度追不上的硬差距。上图NVIDIA scale-up 几乎每代翻倍而昇腾 UB 官方口径停在「数百 GB/s」差约一个数量级。四、市场与生态政策把模型推上芯片芯片却连着一张没到的网政策端最硬的变量昨天拆过七部委 75% 国产采购红线、9 月 1 日生效 [B]。但放到互连层看有个被忽略的错位——政策强制的是「芯片」国产化芯片之间那张网优先级排在后面。买昇腾 910C 是合规项但让这 384 片芯片真正连成一台能跑 V4 的千亿机器靠的是 UB 总线和 XCCL那才是华为真正锁死客户的护城河 [D]。企业侧落地印证了这张网的价值密度。华为 CloudMatrix384 上跑的是 DeepSeek、Kimi、GLM、Qwen、MiniMax峰值解码 2400 token/s/910C、TPOT 约 50ms [A]——当互连UB 全对全 全局共享内存到位时国芯确实扛得起千亿推理。昨天的每日互动案例一台八卡 Atlas 800 扛下 V4-Flash说明低激活率 KV 压缩缓解的是内存带宽墙而这张墙之外跨节点的互连墙依然在 [B]。token 经济和互连绑在一起。V4-Pro 定价把产能直接绑上昇腾 950 的放量节奏 [B]而放量背后真正卡的不只是 950 芯片本身还有让 950 连成超节点的互连和调度软件。上图政策把模型逼上国产芯片但芯片间的互连层才是千亿 MoE 真正的瓶颈。五、战略启示与我的判断对芯片厂商昇腾的护城河不在 FLOPS而在那张 UB 总线 XCCL 的互连闭环——这是寒武纪们靠 vLLM 白手套追不上的物理层壁垒 [D]。但这也是天花板只要 UB 在线带宽还停在「数百 GB/s」V4 这类 384 专家 MoE 的通信占比就压不进英伟达那块。对模型厂商V4 的架构选择低激活率、强 KV 压缩缓解的是内存带宽墙对冲的却不是互连墙——all-to-all 占比是 MoE 的结构常量 [B]。所以「为国产芯片做架构适配」的下一个台阶不在精度结构而在能否靠专家局部性路由和通信调度把 all-to-all 流量压下去。对采购方与投资者政策红线把「买国芯」变成合规项但真实性能现在多了一层变量——互连。盯数据别只盯单卡 FLOPS要看两张墙内存带宽墙已被 V4 的 KV 压缩缓解和互连墙仍在。信通院 AISHPerf 的集群/互连维度会是这场核账最可能出独立数据的地方 [B]。我判断「V4 上国芯」的下一场仗已经从芯片转到了互连——52.2% 的通信占比说明芯片算力到位后网络才是新的分配器。我预判未来一年国芯的竞争焦点会从「谁的 FLOPS 高」转向「谁的互连能把 all-to-all 压到 30% 以下」灵衢/UBoE 的下代带宽会比芯片本身更值钱。我原以为昇腾 950DT 量产会是训练侧国产化的转折点但把 52.2% 放进文献的 40–67% 区间看互连带宽才是那个没被核账的隐藏变量。先不下结论在信通院或独立第三方的集群基准出现之前所有「千亿模型上国芯」的速度数字都要先问一句——那是算出来的还是通信省下来的。参考来源部分NVIDIA NVLink 6 官方规格3.6TB/s、NVL72 260TB/s、SHARP华为 CloudMatrix384 / xDeepServeUB 总线、XCCL、2400tok/sarXiv:2508.02520LSH-MoEall-to-all 平均 45%NeurIPS 2024arXiv:2411.08446LocMoE昇腾集群局部性路由省 12.68–22.24% 训练arXiv:2401.13920Hot Chips 2026NVIDIA Rubin 官方披露counted writes信通院 DeepSeek-V4 国产化适配测试AISHPerfAI 辅助深度研究人工视角解读。每日更新。

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号