恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

拆开 R1 的图纸:128K 上下文、MLA、MoE 与多标记预测

  • 首页
  • 资讯中心
  • /
  • 拆开 R1 的图纸:128K 上下文、MLA、MoE 与多标记预测

相关资讯

Ink TUI 终端界面开发:React 渲染命令行界面 2026/10/10 16:06:02
SpringBoot2+Vue3校园生活信息平台:前后端分离实践与部署 2026/10/10 16:01:02
gitee推送更新失败问题记录:remote: error: hook declined to update refs/heads/master 排查与TaoToken辅助定位 2026/10/10 16:01:02

最新资讯

ASPDF在Classic ASP中生成PDF的实战指南
2026年最新8款AI编程工具入门教程深度实测
PJ85718DM+STM32F765ZI工业温测方案:RS-485直驱与双核协同设计
Docker进阶之路(1)
Docker沙箱与容器池:在线代码安全执行的核心技术
分布式 ID 唯一性保障:数据库号段模式在高并发宕机时的安全性防御

今日推荐

UE动画修改实战:从资产编辑到重定向与蒙太奇驱动
统计随机数生成器攻击下的KLJN安全密钥交换协议Matlab仿真
政务API安全治理:资产测绘、低代码编排与行标对标实践

本周热门

UE动画修改实战:从资产编辑到重定向与蒙太奇驱动
统计随机数生成器攻击下的KLJN安全密钥交换协议Matlab仿真
政务API安全治理:资产测绘、低代码编排与行标对标实践

本月精选

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证
2026 大模型集体涨价:用 Python 做企业 Token 成本测算与选型避坑(附配置)

拆开 R1 的图纸:128K 上下文、MLA、MoE 与多标记预测

发布时间:2026/10/10 16:06:02
拆开 R1 的图纸:128K 上下文、MLA、MoE 与多标记预测 拆开 R1 的图纸128K 上下文、MLA、MoE 与多标记预测【免费下载链接】DeepSeek-R1探索新一代推理模型DeepSeek-R1系列以大规模强化学习为基础实现自主推理表现卓越推理行为强大且独特。开源共享助力研究社区深入探索LLM推理能力推动行业发展。【此简介由AI生成】项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R12025 年 1 月DeepSeek-R1 以纯强化学习驱动推理的姿态亮相开源即引爆社区。但多数讨论集中在训练配方——冷启动数据、GRPO、蒸馏——而对它赖以生存的底座结构着墨不多。R1 并非从零设计的新模型它站在 DeepSeek-V3-Base 的肩膀上671B 总参数、128K 上下文、61 层变换器再加上 MLA、MoE、MTP 三件套。本文将直接打开这份开源图纸config.json、modeling_deepseek.py与权重索引从源码级别拆解这四个关键技术点整体骨架、多头潜在注意力、混合专家路由以及常被误解的多标记预测。一、整体骨架61 层变换器与 128K 上下文从哪来仓库的config.json给出了模型的第一份体检报告{ architectures: [DeepseekV3ForCausalLM], num_hidden_layers: 61, hidden_size: 7168, vocab_size: 129280, max_position_embeddings: 163840, rope_scaling: { type: yarn, factor: 40, original_max_position_embeddings: 4096 } }README.md中明确写着DeepSeek-R1 与 R1-Zero 均基于 DeepSeek-V3-Base 训练。模型主体由嵌入层、61 层DeepseekV3DecoderLayer与最终 RMSNorm 构成modeling_deepseek.py中DeepseekV3Model的layers nn.ModuleList([...])循环第 1362–1367 行。每层内部遵循标准的 Pre-Norm 残差结构先input_layernorm再做自注意力残差相加后经post_attention_layernorm进入 FFNDeepseekV3DecoderLayer.forward第 1197–1217 行。上下文长度是外界最容易误读的参数。官方标注的上下文为128K而max_position_embeddings被设置为163840——这是通过 YaRN 长度外推得到的安全上限原始训练窗口 4096缩放因子 404096 × 40 163840config.json中beta_fast: 32, beta_slow: 1, mscale_all_dim: 1.0等参数均服务于 YaRN 的注意力熵修正。modeling_deepseek.py中DeepseekV3Attention._init_rope第 697–741 行会根据rope_scaling的类型动态选择DeepseekV3YarnRotaryEmbedding并在softmax_scale上乘入mscale修正因子第 689–695 行。换言之128K 不是训练出来的死参数而是4096 基线 长度外推的工程成果。二、MLA把 KV 缓存压缩进 512 维潜在空间长上下文的代价首先是显存传统 MHA 中每个注意力头都要缓存完整的 K、V 矩阵128K 上下文下显存以 TB 计。DeepSeek 的解法是多头潜在注意力MLA它把每个头各存各的 K/V改写成全体共享一份低秩潜在向量。config.json中的关键参数kv_lora_rank: 512, q_lora_rank: 1536, qk_nope_head_dim: 128, qk_rope_head_dim: 64, v_head_dim: 128, num_attention_heads: 128对应modeling_deepseek.py中DeepseekV3Attention.__init__第 630–687 行的投影拓扑Q 侧低秩压缩q_a_proj把 7168 维输入压到 1536 维经q_a_layernorm后用q_b_proj展开回 128 头 × 192 维q_head_dim qk_nope_head_dim qk_rope_head_dim再在 forward 中切分为无位置信息部分nope 位置信息部分pe。K/V 侧是 MLA 的核心kv_a_proj_with_mqa将输入直接压到512kv_lora_rank 64qk_rope_head_dim维其中 512 维潜在向量经kv_a_layernorm后由kv_b_proj解压为 128 头的 Knope 部分与 V而 64 维的 RoPE 部分独立施加旋转位置编码第 775–800 行。于是 KV 缓存里真正要存的不再是 128 头 × (128128) 维的完整 K/V而是512 维潜在向量 64 维 RoPE 共享向量。这正是 V2 起沿用的设计把每次解码都要读的缓存压到最低把每次前向都要算的解压放到计算侧。代价是每步多一次kv_b_proj解压矩阵乘但换来的是 KV 缓存量级的数量级下降——128K 上下文因此成为可负担的配置而不是演示用的玩具数字。三、MoE671B 参数每次只激活 37BR1 的参数量常被引为671B 满血版但真正决定推理成本的是激活参数。README.md的模型下载表给出了两个数字总参数 671B激活参数 37B。这 18 倍的差距来自混合专家MoE架构。config.json的 MoE 配置n_routed_experts: 256, num_experts_per_tok: 8, n_shared_experts: 1, moe_intermediate_size: 2048, first_k_dense_replace: 3, moe_layer_freq: 1, n_group: 8, topk_group: 4, scoring_func: sigmoid, topk_method: noaux_tc, routed_scaling_factor: 2.5, norm_topk_prob: trueDeepseekV3DecoderLayer用一段条件判断决定每层用 MoE 还是稠密 MLP第 1151–1159 行前 3 层保持稠密first_k_dense_replace 3从第 3 层起全部换成 MoEmoe_layer_freq 1。每层 MoE 由 256 个路由专家moe_intermediate_size 2048的DeepseekV3MLP 1 个共享专家组成DeepseekV3MoE第 475–520 行共享专家对每个 token 恒被激活负责承载通用知识。路由选择在MoEGate.forward第 422–473 行中完成值得注意的有三点打分函数是 sigmoid 而非 softmax。每个专家得到独立概率互不挤占天然适配多专家协作的设定。分组路由256 个专家被均分为 8 组每组 32 个先用e_score_correction_bias修正分数取每组 top-2 得分之和选出 top-4 组topk_group 4再仅在入选组的 128 个专家内取 top-8。这是一种先粗筛、后精选的两级路由避免路由分数在 256 个专家上直接 top-k 导致的选择偏差。无辅助损失noaux_tctopk_method noaux_tc意味着不靠负载均衡辅助损失约束专家利用率而依赖e_score_correction_bias在推断阶段做纠偏。forward中最后还有一步norm_topk_prob归一化 routed_scaling_factor 2.5的权重放大第 467–471 行防止激活权重过小稀释输出。推理路径moe_infer第 534–608 行按 token 归并到各专家分批计算再按 topk 权重加权求和、加回共享专家输出y self.shared_experts(identity)。这套8 路由 1 共享的激活模式就是 37B 激活参数的来源——每 token 只经过 9 个专家规模的 FFN而非 256 个。四、MTP训练提速与投机解码的双重身份多标记预测Multi-Token PredictionMTP常被误读为推理时一次生成多个 token 的魔法。从仓库看它在架构里的真实位置是主干之外的附加模块config.json中num_nextn_predict_layers: 1权重索引model.safetensors.index.json中可以看到完整的第 61 组权重主干是 layers.0–60model.layers.61.embed_tokens.weight # MTP 的输入嵌入 model.layers.61.enorm.weight # 输入 RMSNorm model.layers.61.eh_proj.weight # 嵌入-隐藏投影 model.layers.61.hnorm.weight # 隐藏态 RMSNorm model.layers.61.shared_head.norm.weight model.layers.61.shared_head.head.weight # 与主模型共享的输出头对应 DeepSeek-V3 的 MTP 设计每个 MTP 模块是一个轻量 Transformer 层输入为前一位置的嵌入投影 主模型当前隐藏态经enorm → eh_proj → 注意力 → hnorm后用共享的 lm_headshared_head预测下一个 token。配置里num_nextn_predict_layers 1表示只做一个额外的下一步预测。MTP 的价值分两层训练侧传统因果 LM 每个位置只监督一个 tokenMTP 让每个位置同时监督下一个与下下个 token等于在相同语料上提高了 token 利用率训练收敛更快同时 MTP 模块与主干共享嵌入和输出头额外参数开销极小。推理侧MTP 模块天然可充当投机解码speculative decoding的草稿模型——先用轻量的第 61 层模块预测 1 个候选 token再用完整主干并行验证命中即可一次解码多个 token把串行生成压成预测-验证的流水线。这正是 671B 级模型能在推理时保持相对低成本输出的关键工程细节之一也是 vLLM/SGLang 等框架能针对该架构做深度优化的前提。五、效果佐证架构红利最终落在评测表上架构设计的最终裁判是评测数据。README.md第 4 节给出了 R1 与 Claude-3.5-Sonnet、GPT-4o、o1-mini、o1-1217 的横向对比AIME 2024 达 79.8高于 o1-1217 的 79.2MATH-500 达 97.3Codeforces Rating 2029、SWE Verified 49.2AlpacaEval2.0 胜率 87.6。相比同底座的 DeepSeek V3推理类指标呈跃升式改善——这既归功于 RL 训练管线也离不开 MLA/MoE 把长思维链CoT变成可负担计算的底层能力R1 会生成长达数万 token 的推理过程若没有低 KV 缓存的 MLA 与低激活参数的 MoE这一推理模式在成本上难以成立。对开发者而言这份图纸最有价值的启示或许在于推理能力的边界由训练方法决定但推理成本的边界由架构决定。R1 把两者结合的方式——RL 驯化能力、MLA/MoE/MTP 驯化成本——已经直接反映在config.json的每一行参数里等待每一位读者亲自复现与验证。【免费下载链接】DeepSeek-R1探索新一代推理模型DeepSeek-R1系列以大规模强化学习为基础实现自主推理表现卓越推理行为强大且独特。开源共享助力研究社区深入探索LLM推理能力推动行业发展。【此简介由AI生成】项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R1创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号