恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

276B 总参 / 12B 激活,8 卡 B200 跑 648 tok/s:Inkling‑Small 技术解读**2

  • 首页
  • 资讯中心
  • /
  • 276B 总参 / 12B 激活,8 卡 B200 跑 648 tok/s:Inkling‑Small 技术解读**2

相关资讯

MidiEditor技术架构赋能:开源MIDI编辑解决方案的现代化实践 2026/8/5 8:58:12
白宫前沿AI安全测试框架深度解析:从自愿评测到事实标准的AI安全治理技术路径 2026/8/5 8:58:12
智能汽车OTA场景化测试体系建设:如何把用户投诉转化为测试用例 2026/8/5 8:58:12

最新资讯

8.3[A]
Scilab频域分析实战:从FFT原理到窗函数与功率谱估计
SMUDebugTool终极指南:免费开源的AMD Ryzen处理器深度调试与性能优化完整教程
如何快速掌握锐龙处理器调试?SMUDebugTool完整使用指南
3个实用功能彻底解决Zotero中文文献管理难题:茉莉花插件完整指南
Docker入门指南:从Hello World到容器化部署实战

今日推荐

AI小程序创业陷阱大起底(92%新手踩坑的3个致命错误)
为什么92.7%的AI 3D生成项目卡在UV重拓扑?资深TD曝光内部验证过的5步自动化修复协议
三升四,比成绩下滑更可怕的,是孩子开始「认命」

本周热门

ncmdumpGUI:一键解锁网易云音乐ncm文件的终极解决方案
分布式配置中心选型实战:Nacos与Consul在创业场景下的对比
MoneyPrinterPlus实战指南:AI视频批量生成与自动化发布完整解决方案

本月精选

如何用DamaiHelper实现演唱会门票的智能自动化抢购:完整技术解决方案指南
第4篇:59 倍性能差距的索引瓶颈定位——一次教科书级的全表扫描调优
终极歌词批量下载神器:5分钟解决离线音乐库歌词同步难题

276B 总参 / 12B 激活,8 卡 B200 跑 648 tok/s:Inkling‑Small 技术解读**2

发布时间:2026/8/5 8:58:12
276B 总参 / 12B 激活,8 卡 B200 跑 648 tok/s:Inkling‑Small 技术解读**2 975B 的模型跑不动现在有个 276B 总参、12B 激活的 MoE8 张 B200 就能跑出 648 tok/s还在多项基准上反超了自家大哥 —— 这不是标题党是 Thinking Machines 刚开源的 Inkling‑Small。一句话背景由前 OpenAI 核心成员组建的 Thinking Machines Lab在发布旗舰模型 Inkling975B不到两周后迅速推出第二款作品 ——Inkling‑Small。体量大幅收缩多项能力却反超大版本。规格速览架构MoE 混合专家解码器总参数276B激活参数12B模态原生多模态支持文本、图像、音频输入上下文窗口256K / 1M tokens对比初代 Inkling975B 总参 / 41B 激活Inkling‑Small 总参仅为前者的 1/4激活参数压缩至 1/3。基准实测推理、编程全面反超来自第三方评测机构 Artificial Analysis 的独立测试结果Artificial Analysis 智能指数上二者几乎持平Inkling‑Small 拿到 40原版 Inkling 为 41。在 Humanity’s Last Exam、GPQA Diamond、SciCode、SWE‑Bench Verified、Terminal Bench 2.1 多项评测中Inkling‑Small 全部实现反超。尤其在智能体工具调用、代码修复、硬核推理这类任务上小版本表现全面超越体量更大的原版模型。短板事实知识依然是硬门槛知识能力上二者差距明显AA‑Omniscience 知识指数 Inkling‑Small 为 -9原版 Inkling 达到 2事实类任务准确率 31% 对比 40%。核心结论推理能力可以依靠蒸馏 RL “练出来”但海量背景知识仍然需要足够参数量来承载。效率优势更少 Token更低成本Artificial Analysis 智能指数评测统计了各模型完成单任务的平均输出 tokenInkling‑Small 约 24K原版 Inkling 约 25KDeepSeek V4 Flash 约 45KGPT‑5.4 mini (xhigh) 达到 78KInkling‑Small 输出更加精简落到生产环境直接带来更低延迟与推理成本。技术解密三步炼成 “小钢炮”优化预训练配方利用晚于大版本启动的时间差调整预训练数据配比和训练超参打下底座能力。On‑policy 在线策略蒸馏以 Inkling 作为教师模型执行在线策略蒸馏产出预览版检查点完成能力复刻。两周智能体强化学习基于蒸馏后的预览检查点专门针对智能体编码任务持续跑满两周 RL。蒸馏只是打底RL 才是实现能力反超的关键。部署门槛8 卡 B200 即可运行硬件推荐 8×B200采用 NVFP4 量化推理框架选用 SGLang。开启 DSpark 解码速度可达 648 tok/s关闭 DSpark 为 288 tok/s。LMSYS 给出评价276B 总参 / 12B 激活是 MoE 做强化学习的 “甜点位”LoRA 微调与全参数微调都具备现实可行性。谁该关注这款模型做 AI Agent 的开发者SWE‑Bench 分数达到 80.2%工具调用能力接近 GPT‑5.4 mini输出 token 更少。做垂直领域微调的团队12B 激活参数LoRA 微调可跑在单卡 A100/H100不需要庞大集群。跑高频推理业务的业务方每 FLOP 产出优于原版 Inkling长期可以降低 API 调用成本。⚠️不适合场景强依赖海量静态事实知识、要求高事实准确率的知识库问答场景。如果你对 Inkling‑Small 的私有化部署或者 LoRA 微调感兴趣可以关注 openstarry我们会持续输出 MoE 模型落地的最佳实践。下一步你可以做什么如果团队有 8 卡 B200 或者等效算力可以直接拉官方镜像做推理测试计划做 LoRA 微调官方文档已经提供示例脚本欢迎在评论区分享你的实测结果一起验证这一款 “小钢炮”关注 openstarry后续持续输出 MoE 系列模型的微调实战与部署踩坑记录官方页面https://thinkingmachines.ai/news/inkling-small/

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号