恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
综合得分落后 Kimi K3、只接近 Grok 4.6:DeepSeek 的护城河真就只剩性价比?
首页
资讯中心
/
综合得分落后 Kimi K3、只接近 Grok 4.6:DeepSeek 的护城河真就只剩性价比?
综合得分落后 Kimi K3、只接近 Grok 4.6:DeepSeek 的护城河真就只剩性价比?
发布时间:2026/10/10 19:16:16
综合得分落后 Kimi K3、只接近 Grok 4.6DeepSeek 的护城河真就只剩性价比【免费下载链接】DeepSeek-V4-Pro-0813项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-V4-Pro-0813DeepSeek-V4-Pro 正式版0813上线后网络上流传最广的一条评价是新大模型综合得分仍落后于 Kimi K3比较接近于 Grok 4.6这在发布之前就都知道。紧随其后的推论更刺耳DeepSeek 的护城河似乎只剩性价比一旦发布外网还是讨论、试用、比较一大片这只能算是好兆头。这条情报式的评论把两个问题摆到了台面上第一DeepSeek 是不是真的预知了自己在基准上的落后位置第二把护城河归结为性价比是否低估了这家公司真正在攒的东西。本文不打算替任何一方站台而是回到仓库源码与官方公布的基准数据逐项拆解这三件事发布前就知道会落后的说法从哪来、性价比叙事还站不站得住、以及 Benchmark 之争里到底谁在借机带节奏。发布前就知道会落后这话从哪来说发布前就知道并非事后诸葛。DeepSeek 官方在仓库根目录的 README.md 中第一张表就摆出了与 Kimi K3、Fable-5、Opus-4.8、GLM-5.2 的全面对比——注意不是挑自己赢的项而是把全部 10 项基准连输的细节都贴在最显眼的位置。BenchmarkDeepSeek-V4-Pro-0813Kimi K3Opus-4.8Fable-5 (w/ fallback)HLE (wo / w tools)42.7 / 60.043.5 / 56.049.8 / 57.953.3 / 63.0Terminal Bench 2.187.988.385.088.0NL2Repo61.5-69.7-Cybergym83.380.078.383.1DeepSWE62.767.558.070.0Toolathlon-Verified74.176.576.277.9Agents Last Exam25.727.625.7-AutomationBench (Public)31.830.827.229.1DSBench-FullStack †71.173.771.677.2DSBench-Hard †67.263.071.768.3逐项对照后综合落后于 Kimi K3的粗线条结论需要打上三个补丁其一在 w/ tools 的 HLE 上0813 反而是反超的60.0 对 56.0这直接对应了 0813 版本agentic capabilities 大幅增强的官方定位——README 开头就写明该版本superseding the preview version, with greatly enhanced agentic capabilities。也就是说在带上工具解决真实任务这条赛道上DeepSeek 不仅没落后还领先了 Kimi K3 一个身位。其二互有胜负而非全面溃败。Cybergym83.3 对 80.0、AutomationBench31.8 对 30.8、DSBench-Hard67.2 对 63.0上 0813 均领先 Kimi K3真正拉开差距的是 DeepSWE62.7 对 67.5和 Toolathlon74.1 对 76.5这类重工具调用的长链路任务。这个细分结果与头条原话比较接近于 Grok 4.6的定性是吻合的——处于第一梯队尾部但和头部之间确实存在肉眼可见的缝隙。其三发布前就知道的真正含义是版本迭代的确定性。对比 README 表中上一代 preview 版本的数据DeepSWE 从 12.8 涨到 62.7、Cybergym 从 52.7 涨到 83.3、Terminal Bench 2.1 从 72.1 涨到 87.9几乎全线翻倍。所谓的早就知道会落后本质是行业对 DeepSeek 后训练路径的预判它用一版时间把 agentic 能力从勉强能用推到了逼近头部这种进步速率本身就在预期之内因此正式版的基准格局没有意外。把没有意外渲染成落后是偷换了概念——进步幅度最大的模型恰恰是最不该被说成不行的那一个。护城河只剩性价比先看钱都省在了哪护城河性价比的说法之所以流行是因为 Pro 版定价确实克制第一财经的报道口径是价格为 flash 版的三倍横向对比海外闭源旗舰仍处低位MIT 权重又摆在明面上看起来就是便宜大碗。但性价比只是结果真正形成壁垒的是支撑低价格的成本结构而这部分恰恰藏在仓库源码里。打开 config.json先看到的是参数量级1.6T 参数规模、384 个路由专家、每 token 激活 6 个专家外加 1 个共享专家。这是典型的稀疏 MoE 设计但真正决定推理成本的不是专家数量而是三件事第一DSpark 投机解码把猜测做成了模型结构的一部分。投机解码speculative decoding并非新概念但 DeepSeek 没有外挂一个小 draft 模型而是把草稿生成直接训练进主模型尾部——inference/model.py 中的DSparkBlock挂在mtp.*命名空间下通过main_proj汇聚主模型第 58/59/60 层的隐状态再用DSparkMarkovHead词表映射到 512 维 markov rank和DSparkConfidenceHead做逐 token 采样与置信度判定。config.json 中dspark_block_size: 5、dspark_target_layer_ids: [58, 59, 60]定义了单次预判 5 个 token 的粒度。在 vLLM 部署时只需一行--speculative-config {method:dspark,...}即可开启目标与草稿权重来自同一份 checkpoint省去了一整套额外小模型的部署与显存开销——这是成本结构的第一道压缩。第二FP4/FP8 混合量化把显存和带宽双双压低。仓库的 inference/convert.py 里有一段容易被忽略的关键函数cast_e2m1fn_to_e4m3fn权重转换时把 FP4e2m1fn专家权重无损地展开为 FP8e4m3fn并在注释里推演了精度边界——FP4 最大值 6.0 乘以 2^6384 恰好落在 e4m3 的 448 上限之内。这意味着主模型权重可以用 FP8 存储、专家权重可进一步压到 FP4配合 config.json 中expert_dtype: fp4与kv-cache-dtype fp8的部署组合显存占用相比 BF16 直接砍半以上。这不是简单的压缩糊弄精度而是 QAT量化感知训练路线的一部分——inference/model.py 中Indexer的注释明确写着We performed QAT here。第三注意力机制为百万 token 上下文做了整套降本设计。max_position_embeddings: 1048576不是堆算力堆出来的而是靠三层结构撑住前 128 token 的滑动窗口、每层按compress_ratios如 128、4 交替压缩历史 KV、以及Indexer用学习到的打分器从压缩后的 KV 中挑选 top-1024 位置做稀疏注意力index_topk: 1024。Indexer内部还自带了 Hadamard 旋转的 Compressor 和 FP4 模拟量化让该看哪里的判断本身也走低精度路径。配合前 3 层用哈希路由n_hash_layers: 3按 token id 查表tid2eid决定专家省去打分计算长上下文的每 token 推理成本被压到了与短文本同数量级。把这些串起来看性价比的本质是把昂贵的部分长上下文、高并发、海量推理通过架构设计转译成了便宜的算力。投机解码省的是延迟、量化省的是显存、稀疏注意力和哈希路由省的是计算量——这是一套可以被任何拿到权重的人复用的方法论MIT 协议见 LICENSE让这套结构完全透明。同行拿到 DeepSeek 的权重不仅拿到一个模型还拿到一份如何用最低成本运行 1.6T 模型的完整说明书inference/ 目录下是纯 Python tilelang 的推理实现kernel.py 中手写的 FP8/FP4 GEMM 与稀疏注意力 kernelencoding/ 目录下是完整的消息编码、DSML 工具调用、三级 reasoning effortlow/high/max见 encoding_dsv4.py参考实现。如果护城河只是便宜那任何人都可以用补贴跟进但如果护城河是便宜的方法论本身开源那跟进者要么抄作业、要么得自己重新走一遍同样的工程路线——这才是和单纯低价完全不同的竞争壁垒。Benchmark 之争谁在借机带节奏围绕 0813 的舆论交锋观察者网用了正式版来了但只来了一半的标题21 财经称顶尖模型开启肉搏华尔街见闻则渲染深夜突袭。这些叙事并非全无根据但也各有指向——拆开看舆论场至少有三种不同的带节奏。第一种把评测语境抽掉只留一个分数。README 的脚注写得很清楚code-agent 类公开基准全部以 DeepSeek Harness 的 minimal 模式作为 agent 框架评测且使用max级 reasoning effort、temperature 1.0、top_p 0.95而 DSBench-FullStack 与 DSBench-Hard 是内部测试集外部无法复现。这意味着表里的数字天然带着自家评测环境的烙印横向对比不同厂商的数字时评测框架、推理预算、工具环境都可能改写结果。用落后 Kimi K3 5 分这种单点结论去否定一个刚把 DeepSWE 从 12.8 拉到 62.7 的版本属于典型的不看过程只看快照。第二种把发布策略渲染成实力不足。只来了一半指向的其实是纯文本、无多模态、并发限制500等产品短板这确实是真实约束深夜突袭则指向官方在发布节奏上的选择。但把产品形态的取舍等同于能力天花板就是另一种带节奏——0813 的定位在 README 中写得毫不含糊聚焦 agentic 能力的正式化把 DSpark 这类此前只在 preview 中亮相的结构随正式版开源。一个模型选择先打透单一方向再补齐模态是路线问题不是败退信号。第三种也是最值得玩味的蹭 DeepSeek Harness 的热度。情报快照中#DeepSeekHarness火了#与财联社V4 全系列上线后DeepSeek Harness 开发者预览版开放测试同步出现。Harness 是支撑 0813 高分评测的 agent 框架官方把它以预览版形式开放本质是把评测时用的那套工具变成开发者也能用的生态入口。舆论焦点如果只停留在谁分数高就会忽略一个事实DeepSeek 正在做的不是单一模型的军备竞赛而是把模型 评测框架 低成本部署方案打包成一个完整的技术栈对外输出——MIT 权重是入口Harness 是粘合剂DSpark 与量化链路是成本护城河。回到最初的问题综合得分落后 Kimi K3、只接近 Grok 4.6是真的但护城河只剩性价比是假的。如果把护城河定义为单一基准上的第一名DeepSeek 确实还没站上去如果把护城河定义为让整个行业都必须以它为参照系的成本结构与方法论开源那么 0813 这份仓库——从 DSpark 的投机解码实现、FP4/FP8 的无损转换管线、百万 token 的稀疏注意力工程到 MIT 许可下可自由复用的推理与编码代码——已经给出了一份比任何 benchmark 分数都更硬的答卷。分数可以追赶方法论一旦开源并被社区消化就再也收不回去了。【免费下载链接】DeepSeek-V4-Pro-0813项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-V4-Pro-0813创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考