恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

256个专家只激活3B参数:Ornith-1.5-35B-A3B MoE架构为什么能赢过稠密大模型

  • 首页
  • 资讯中心
  • /
  • 256个专家只激活3B参数:Ornith-1.5-35B-A3B MoE架构为什么能赢过稠密大模型

相关资讯

JavaScript语言全面概述:从历史到现代实践 - JavaScript学习系列文章 2026/8/25 10:44:38
Odoo模块扩展与视图继承实战:从原理到企业级定制开发 2026/8/25 10:39:38
如何5分钟上手Boxcars:一份JSON配置部署静态网站服务器+反向代理完整教程 2026/8/25 10:39:38

最新资讯

2026储能容量补偿收益测算:各省差异分析与尽调实务
基于AI大模型的JSON文件高质量汉化实战:告别垃圾机翻
【信息科学与工程学】计算机科学与自动化——第一百五十九篇 湖仓一体架构01
告别手动P图:从Pillow到ImageMagick的自动化图像处理实战指南
【多智能体】AI 邮件 GTM 联系代理案例讲解
AI图表自动化:从文本描述到专业架构图的技术实践

今日推荐

三步把QQ空间历史说说导出到本地:GetQzonehistory 极简指南
洛谷 P7912:[CSP-J 2021 T4] 小熊的果篮 ← 双向链表
Transformers.js 网页端图像抠图实战:零后端 3 行代码返回透明 PNG

本周热门

Nextcloud 桌面客户端:把同步交给它,你只管改文件
如何将 HTML 转成 Word 文档且格式不丢失?html-to-docx 使用教程
Anki 批量操作卡片完整指南:一次搞定上千张,不再逐张修改

本月精选

如何用DamaiHelper实现演唱会门票的智能自动化抢购:完整技术解决方案指南
第4篇:59 倍性能差距的索引瓶颈定位——一次教科书级的全表扫描调优
终极歌词批量下载神器:5分钟解决离线音乐库歌词同步难题

256个专家只激活3B参数:Ornith-1.5-35B-A3B MoE架构为什么能赢过稠密大模型

发布时间:2026/8/25 10:44:38
256个专家只激活3B参数:Ornith-1.5-35B-A3B MoE架构为什么能赢过稠密大模型 256个专家只激活3B参数Ornith-1.5-35B-A3B MoE架构为什么能赢过稠密大模型【免费下载链接】Ornith-1.5-35B-A3B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3BOrnith-1.5-35B-A3B 是 Ornith-1.5 家族中基于 MoEMixture of Experts混合专家架构的多模态推理模型总参数约 35B但每个 token 只激活约 3B 参数推理成本接近小模型却在 SWE-bench Verified、Terminal-Bench 等编码与 Agent 基准上全面超过 Gemma-4-31B 等稠密模型。一、什么是 MoE把全员加班改成按需点将传统稠密模型处理每个 token 时所有参数都要参与计算模型越大、每次推理越贵。MoE 的思路是把每一层里最重的专家网络FFN 模块拆成很多个小组再配一个路由器Router每个 token 只选少数几个专家来处理。这样总参数大→ 知识容量大能记住更多模式激活参数小→ 单次推理计算量小、速度快Ornith-1.5-35B-A3B 的名字就概括了它的身份35B是总参数A3BActivated 3B是每 token 实际激活的参数。二、256个专家、每层选8个它是怎么分配的打开 config.json能看到核心 MoE 参数关键配置数值含义num_experts256每层配备 256 个专家 FFNnum_experts_per_tok8每个 token 只激活 8 个专家num_hidden_layers40语言主干共 40 层hidden_size2048隐藏层维度moe_intermediate_size512单个专家内部宽度vocab_size248320词表规模也就是说每层有 256 个专家路由器为每个 token 挑选 8 个约 3%。256 个专家 × 40 层就是它 35B 总参数的大头所在而每次前向传播真正干活的只有 3B 左右这就是 A3B 的由来。从权重清单 model.safetensors.index.json 还能看到一个重要细节每层除了 256 个可选专家外还额外配了 1 个shared_expert共享专家。 为什么需要共享专家被选中的 8 个专家只负责个性化能力而所有 token 都会经过的共享专家则承载通用语言能力两者相加保证任何 token 都有稳定的基础能力托底。这是当前 MoE 模型的常见稳健设计。三、不只是 MoE线性注意力让长上下文更便宜config.json里的layer_types字段揭示了另一个隐藏亮点——注意力混合结构每 4 层中有3 层是linear_attention线性注意力只有第 4 层是full_attention完整注意力层还采用 GQAnum_key_value_heads2仅 2 个 KV 头这意味着 262,144256Ktoken 的上下文窗口下历史信息的记忆与计算开销大幅降低长文档、大代码库场景不再被 KV Cache 拖垮。这也是为什么官方推荐在 2×80GB GPU 上以 256K 上下文部署并用--enable-prefix-caching复用前缀。四、3B激活参数凭什么碾压稠密巨兽MoE 的优势不是玄学而是三个因素的叠加容量与成本的解耦稠密模型想要更强能力只能把每个 token 的计算量一起做大Ornith-1.5-35B-A3B 用 256 个专家堆出 35B 容量推理却只花 3B 的算力——装得下大知识跑得快。稀疏激活 专家分工路由器让不同专家逐渐擅长不同类型的任务语法、数学、代码、工具调用……token 按需点将。对比同规模的 Qwen3.6-35B-A3B 和稠密的 Gemma-4-31BOrnith-1.5-35B-A3B 在 Agent 编码类基准上领先幅度最大正说明这种分工在多步骤工具使用上收益最高。自改进训练放大了架构红利根据 READMEOrnith-1.5 的突破在于端到端自改进循环模型持续自己生成训练任务、构造求解脚手架、用强化学习打磨策略。好的架构MoE 线性注意力提供了能力上限自改进训练把上限兑现了出来。五、官方基准成绩一览以下为 README 公布的五次独立运行均值节选基准Ornith-1.5-35B-A3BQwen3.6-35B-A3BGemma-4-31B稠密Qwen3.5-397BSWE-bench Verified79.073.452.076.4SWE-bench Pro59.649.535.751.6Terminal-Bench 2.1 (Terminus-2)67.852.542.153.5NL2Repo46.229.415.536.8GPQA Diamond89.286.084.388.4可以看到一个只跑 3B 参数的 MoE 模型在多数编码/Agent 项上追平甚至超过了 397B 的 Qwen3.5——这就是稀疏激活对稠密大模型的降维打击。六、新手部署速查2×80GB 显卡跑满 256K 上下文完整参数bf16约70GB官方推荐 2×80GB GPU 部署并保留 256K 上下文的显存余量运行时要求Transformers ≥ 5.8.1、vLLM ≥ 0.19.1 或 SGLang ≥ 0.5.9关键启动参数--tensor-parallel-size 2、--max-model-len 262144、开启前缀缓存并启用推理解析器--reasoning-parser qwen3与工具调用解析器建议采样参数通用任务temperature0.6, top_p0.95, top_k20与 generation_config.json 一致上下文不够用时官方验证过 YaRN 缩放factor4.0 可扩到约 1M token⚠️ 注意Ornith-1.5-35B-A3B 是推理模型助手回复会先输出think…/think思考块再给答案服务端需开启 reasoning parser否则思维链会混进正文。七、写在最后为什么值得你关注这个模型对新手而言Ornith-1.5-35B-A3B 的价值可以浓缩成三句话MoE 让大模型变得可部署——35B 容量 3B 激活成本双 80G 卡即可本地跑 Agent 编码256 专家 1 共享专家的组合兼顾了专业分工与基础稳定线性注意力 256K 上下文让它能吞下整个代码库成为真正可用的终端编码 Agent。想深入了解架构与自改进训练细节可直接阅读仓库内的 README.md含全部评测口径说明与 config.json全部结构参数。【免费下载链接】Ornith-1.5-35B-A3B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号