恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

AI芯片架构大揭秘:英伟达GPU与谷歌TPU的设计、扩展及软件全解析

  • 首页
  • 资讯中心
  • /
  • AI芯片架构大揭秘:英伟达GPU与谷歌TPU的设计、扩展及软件全解析

相关资讯

腾讯开源WeKnora:企业级RAG框架的模块化设计与工程实践 2026/8/25 6:49:16
告别C盘空间焦虑:从原理到实践的Windows系统化清理策略 2026/8/25 6:49:16
QClaw自动化工具在世界杯预测市场的1000元量化实验 2026/8/25 6:49:16

最新资讯

OpenClaw:42个AI技能协同的智能体操作系统实战解析
2026智能招聘系统:流程协同与算力调度的技术突破
2026硅谷裁员实况解读:AI行业爆火,却疯狂裁人
天气丹小样源头工厂怎么选?代工老炮教你绕开仿品坑、拿到真正的院线级韩方滋养护肤品
单卡部署26B大模型:vLLM与量化技术如何实现300+ Token/s推理速度
【量化交易】2.2.1-必知的量化交易基础

今日推荐

三步把QQ空间历史说说导出到本地:GetQzonehistory 极简指南
洛谷 P7912:[CSP-J 2021 T4] 小熊的果篮 ← 双向链表
Transformers.js 网页端图像抠图实战:零后端 3 行代码返回透明 PNG

本周热门

Nextcloud 桌面客户端:把同步交给它,你只管改文件
如何将 HTML 转成 Word 文档且格式不丢失?html-to-docx 使用教程
Anki 批量操作卡片完整指南:一次搞定上千张,不再逐张修改

本月精选

如何用DamaiHelper实现演唱会门票的智能自动化抢购:完整技术解决方案指南
第4篇:59 倍性能差距的索引瓶颈定位——一次教科书级的全表扫描调优
终极歌词批量下载神器:5分钟解决离线音乐库歌词同步难题

AI芯片架构大揭秘:英伟达GPU与谷歌TPU的设计、扩展及软件全解析

发布时间:2026/8/25 6:49:16
AI芯片架构大揭秘:英伟达GPU与谷歌TPU的设计、扩展及软件全解析 AI芯片架构2018年国际计算机体系结构研讨会上约翰·轩尼诗和大卫·帕特森发表图灵讲座《计算机体系结构的新黄金时代》。20世纪80年代轩尼诗和帕特森开展获图灵奖研究时单线程CPU性能年增长52%到2018年降至3%。特定领域架构应运而生以谷歌TPU v1为例其在神经网络推理方面吞吐量是CPU29倍能效高80倍。他们预测未来十年新型计算机体系结构将迎来寒武纪大爆发如今有数十种架构正大力研发专注AI计算。已实现实际部署的架构有GPU、脉动阵列加速器、Cerebras晶圆级引擎和Groq LPU。英伟达领先AMD紧随OpenAI和Meta向AMD下达6GW订单。TPU用于训练Gemini还将为Anthropic提供芯片Anthropic在Trainium芯片上运行Claude。Cerebras为OpenAI提供推理服务Groq LPU并入英伟达。问题所在AI计算主要由矩阵乘法主导Transformer模型是一系列矩阵乘法运算。训练前沿模型需执行10^25次乘加运算。矩阵乘法形式取决于工作负载训练和预填充是大规模矩阵 - 矩阵乘法计算强度高解码阶段是矩阵 - 向量乘法计算强度下降。推理系统通过批处理将GEMV运算转换为GEMM运算提高计算强度。架构问题是“内存墙”问题即计算能力增长而内存带宽跟不上。每种架构针对数据移动问题有不同策略。英伟达GPU英伟达GPU是大规模并行处理器设计理念是可编程芯片在主机CPU协调下通过CUDA编程适合运行可并行化工作负载。每代产品在流多处理器上添加加速原语不改变编程模型同芯片可用于多种场景。发展历程2006 - 2027年有多代架构和型号如2006年Tesla架构G802027年Rubin Ultra架构等。架构由面向吞吐量的核心、深层内存层次结构和少量调度硅芯片组成。核心是流多处理器每个芯片封装有多个SM。每个SM内部结构相同包含四个子分区共享L1/共享内存块和张量内存加速器。线程组织成线程束同步执行。计算CUDA核心负责除矩阵乘法外的操作绝大部分计算吞吐量来自张量核心。张量核心执行融合矩阵乘加运算不同代产品的张量核心功能不断提升矩阵乘法对发出指令的线程依赖减小提高了Transformer注意力内核执行效率。内存片上内存层次结构由硬件管理缓存结合软件提示片外是HBM。不同层次数据移动逐渐与线程束解耦每代产品让线程束操作减少。线程束专业化Hopper时代编程习惯是线程束专业化通过mbarrier和异步事务屏障实现细粒度生产者/消费者握手成为现代注意力内核参考标准。数值精度FP32曾是默认精度各代产品不断降低精度并采用缩放方案恢复精度同时集成更多硅芯片提高每瓦吞吐量。设计理念包括可编程性、通过大规模多线程隐藏延迟、线程束封装的矩阵乘法、异步内存层次结构、分摊SIMT开销。扩展有纵向扩展和横向扩展两种方式。纵向扩展将多个GPU绑定到一致内存域可直接通过NVLink访问其他GPU的HBM。纵向扩展架构由NVLink和NVSwitch组成定义了HGX 8 - GPU主板等多种形式。高密度连接依赖无源铜不同代产品在纵向扩展上不断升级。横向扩展在机架和集群级别连接内存域数据通过RDMA传输。横向扩展架构源于英伟达对Mellanox收购不同代产品在横向扩展带宽等方面有提升。从铜缆到光纤转换发生在机架边界Rubin推出后光学层集成到交换机ASIC中。NVLink Fusion开放纵向扩展网络。软件CUDA是编程模型开发者编写内核在多线程上启动。每代新产品引入新硬件并在PTX和SASS中暴露。软件栈包括cuBLAS、cuDNN、CUTLASS等。FlashAttention针对英伟达芯片手动优化。软件栈大部分由英伟达之外的人编写英伟达还提供专业技术支持。谷歌TPUTPU是矩阵乘法机器设计理念是专注密集矩阵乘法让XLA编译器提前规划内存使用。每代产品扩大集群规模用于训练和服务谷歌工作负载。发展历程2015年TPU v12017年TPU v2等。

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号