恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

Inkling:975B参数原生多模态“美国开源新王”,专为企业定制而生!

  • 首页
  • 资讯中心
  • /
  • Inkling:975B参数原生多模态“美国开源新王”,专为企业定制而生!

相关资讯

OPD爆火:大模型蒸馏,从抄知识变成抄判断力 2026/8/3 2:17:30
SpringBoot高校超市管理系统开发实战 2026/8/3 2:17:30
UE5 CommonUI框架实战:构建现代化游戏菜单系统 2026/8/3 2:17:30

最新资讯

Vue+SSM构建考研互助平台的技术实践与优化
微软终于松口:Windows 11 要为 8GB 内存“瘦身“了
【高阶·融合】如何以可观测性驱动 AI 安全合规持续验证:从遥测采集到机器可验证证据的七层闭环架构
GitLab惊现高危RCE漏洞:普通用户竟能直接接管服务器?深度解析Oj解析器内存损坏攻击链
Edge AI与TinyML实战:从模型压缩到设备端部署
射频加热技术原理深度解析:从介电损耗到工业应用

今日推荐

无线一体式手持三维扫描仪推荐:摆脱电脑束缚的工业检测新选择
3个让你工作效率翻倍的Umi-OCR实战技巧:免费离线文字识别完全指南
[具身智能-181]:PC+服务器+具身机器人:构建具身智能从仿真到量产的闭环迭代混合架构

本周热门

ncmdumpGUI:一键解锁网易云音乐ncm文件的终极解决方案
分布式配置中心选型实战:Nacos与Consul在创业场景下的对比
MoneyPrinterPlus实战指南:AI视频批量生成与自动化发布完整解决方案

本月精选

如何用DamaiHelper实现演唱会门票的智能自动化抢购:完整技术解决方案指南
第4篇:59 倍性能差距的索引瓶颈定位——一次教科书级的全表扫描调优
终极歌词批量下载神器:5分钟解决离线音乐库歌词同步难题

Inkling:975B参数原生多模态“美国开源新王”,专为企业定制而生!

发布时间:2026/8/3 2:22:30
Inkling:975B参数原生多模态“美国开源新王”,专为企业定制而生! 当整个AI行业都在卷榜单、拼SOTA时有一个团队选择了一条截然不同的路——它问了一个看似简单却极其务实的问题如果开源模型的首要价值不在于性能的摸高而在于能力、成本、多模态和可微调性之间的平衡会怎样模型地址https://modelscope.cn/models/thinkingmachines/Inkling一、为什么这个模型值得你停下来读如果你接触过大模型企业落地你一定对这样的困境习以为常想用开源模型做二次微调要么模型太大跑不动要么能力单一不够用要么开源协议限制多。企业需要一个能真正用自己数据持续改造的模型底座——但市面上很难找到。但Inkling给出了一个颠覆性的答案975B总参数、每次仅激活41B的MoE架构原生支持文本、图像、音频多模态输入上下文窗口高达100万tokenApache 2.0协议完整开放——专为企业二次微调打造。更绝的是它的创造者Thinking Machines LabTML由OpenAI前CTOMira Murati、前应用研究VP翁荔等“OpenAI梦之队”联合创立。成立5个月便完成20亿美元种子轮融资估值120亿美元创下AI行业种子轮纪录。但TML却以业内少有的坦诚姿态主动放弃了SOTA叙事“Inkling并非当今最强的模型开源闭源都不是。”在他们看来开源模型的首要价值是在能力、推理成本、原生多模态和可微调性之间找到平衡成为企业可以用自己数据持续改造的模型底座。这不是在现有模型上做点微调——它是从企业定制这个终极目标出发重新定义了“开源模型应该怎么做”。二、核心亮点四大杀手锏2.1 ★ 975B参数MoE架构每次只激活41BInkling最核心的设计是稀疏混合专家MoE架构维度Inkling总参数量9750亿975B每次激活参数410亿41B架构66层纯解码器Transformer MoE专家配置256个路由专家top-6 2个共享专家上下文窗口最高100万token预训练数据45万亿token文本、图像、音频、视频数据来源效果拥有975B模型的“知识储备”却只有41B模型的推理成本。这就是MoE的魔力——参数多但不贵能力强但不慢。架构上大体沿用DeepSeek-V3的MoE设计每层256个路由专家加2个共享专家每个token激活6个路由专家。2.2 ★ 原生多模态文本、图像、音频“一网打尽”Inkling不是“文本模型外挂视觉模块”——它是从头原生支持多模态图像通过分层块编码器编码任意基于像素的图像格式建议每维40px–4096px音频通过离散token编码16kHz采样率的WAV格式建议不超过20分钟视频训练数据中也包含视频内容所有模态均被投影到共享的隐藏空间中由解码器联合处理音频输入以dMel频谱图形式送入图像被切成40×40像素的patch通过四层hMLP编码两者经过轻量嵌入层后与文本token一起处理整个过程不依赖外部编码器。2.3 ★ “可控思考深度”同样的结果只用1/3的tokenInkling最值得关注的设计是**“可控思考深度”controllable thinking effort** 开发者可以通过reasoning_effort参数在0.2到0.99之间调节模型的推理投入在性能和成本之间找到最优平衡点。实际效果在Terminal Bench 2.1智能体编程基准上Inkling达到与Nemotron 3 Ultra相同分数时生成的token量只有后者的约三分之一。对于需要大规模调用模型的生产场景这意味着成本和延迟的显著下降。2.4 ★ Apache 2.0开源 量化全家桶从企业到个人都能用Inkling的开源程度令人叹为观止版本格式适用场景BF16原版Safetensors最高精度企业级部署NVFP4量化4-bit显存占用大幅降低FP8量化RedHatAI提供精度几乎无损vLLM就绪GGUFllama.cpp本地CPU/GPU部署最低硬件要求BF16检查点2TB聚合显存示例8张B300或16张H200NVFP4量化版600GB起步虽然门槛不低但Apache 2.0协议意味着可自由用于商业及非商业用途——企业可以放心地用自己数据做二次微调并商业化。三、性能表现美国开源阵列登顶3.1 第三方综合评分登顶美国开源模型第三方机构Artificial Analysis结果显示Inkling以41分的综合得分超越了英伟达Nemotron 3 Ultra、谷歌Gemma 4 31B以及OpenAI的GPT-OSS-120B登顶美国开源模型。3.2 核心基准测试成绩effort0.99全力模式基准测试Inkling对比模型AIME 202697.1%Nemotron 3 Ultra 94.2%SWE-Bench Verified77.6%Nemotron 3 Ultra 70.7%GPQA Diamond87.2%—MMMU Pro视觉73.3%Gemini 3.1 Pro 82.5%MMAU音频77.2%Gemini 3.1 Pro 82.5%StrongREJECT安全98.6%同类最高FORTRESS对抗性测试78.0%同类开源模型最高数据来源3.3 与主流模型全面对比基准InklingNemotron 3 UltraKimi K2.5DeepSeek V4 ProGemini 3.1 ProReasoning HLE (text only)29.7%26.6%29.4%35.9%44.7%HLE (with tools)46.0%————数据来源3.4 ★ Inkling-Small12B激活参数的“反超小弟”更令人震撼的是TML同期发布了Inkling-Small预览版维度Inkling-Small总参数量2760亿276B每次激活参数120亿12B体量仅为Inkling的1/4数据来源最亮眼的是这个“12B小弟”在多项基准上直接实现了对“万亿大哥”的性能反超基准Inkling-SmallInkling975BHLE带工具46.6%46.0%GPQA Diamond88.3%87.2%IFBench指令遵循83.4%79.8%SWE-Bench Verified77.4%77.6%几乎持平如何做到的用Inkling当老师做on-policy蒸馏先出预览版检查点从这个检查点接着跑了整整两周的智能体编码强化学习“学生超过老师”的结果证明了TML跑通了一条能反复出模型的产线——第一个模型是作品第二个模型是产能证明。实测显示8张B200、TP8、NVFP4环境下用SGLang跑Inkling-Small开DSpark可达648 tok/s解码速度。四、快速上手4.1 模型下载# ModelScope 下载gitlfsinstallgitclone https://modelscope.cn/models/thinkingmachines/Inkling4.2 Tinker Playground在线体验在Tinker Playground上直接试用Inkling。4.3 Hugging Face Transformers部署fromtransformersimportpipeline model_idthinkingmachines/Inkling-NVFP4pipepipeline(image-text-to-text,modelmodel_id)messages[{role:user,content:[{type:image,image:image_url},{type:text,text:分析这张图片的内容},],},]outputpipe(messages,max_new_tokens2000,return_full_textFalse,reasoning_effortmedium,# 0.2 - 0.99 可调)代码来源4.4 可控思考深度参数effort值适用场景0.2 – 0.5快速响应、成本敏感场景0.5 – 0.8日常对话、常规任务0.8 – 0.99复杂推理、Agent任务4.5 第三方推理服务Inkling已上线Vercel AI Gateway、Modal等第三方推理服务平台。五、总结与思考Inkling的价值远不止于“又出了一个开源模型”。它真正值得深思的地方在于第一它重新定义了开源模型的价值主张。不是“性能最强”而是**“最能改的底座”** 。TML的收入来源是靠微调服务自研平台Tinker专门卖模型定制服务——所以他们比谁都清楚一个模型好不好不只看跑分更看能不能被企业真正用起来。第二它证明了“可控思考深度”的商业价值。用1/3的token达到相同的效果——对于大规模调用的生产场景这意味着成本和延迟的断崖式下降。第三它展示了“后训练蒸馏”的威力。Inkling-Small用1/4的体量反超了Inkling——模型大小不是能力的唯一决定因素训练方法的迭代同样关键。第四它代表了“美国开源反击”的战略意义。在中国开源模型主导开源AI生态的当下TML用975B参数、Apache 2.0协议、原生多模态的Inkling在美国开源模型阵列中登顶。当然Inkling也有明显局限BF16版本需要2TB聚合显存门槛极高在多模态的某些细分领域如MMMU Pro与闭源顶尖模型仍有差距Inkling-Small目前还是预览版正式权重尚未全部释放。但它打开了一扇门如果开源模型的未来不一定是“更大更强”而是“更懂企业、更好定制、更讲求成本与性能的平衡”呢模型地址https://modelscope.cn/models/thinkingmachines/Inkling欢迎下载、部署、微调——一起探索企业级开源模型的另一种可能。

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号