恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
阿里 Qwen3.8 正式发布:2.4 万亿参数的国产旗舰,Arena 榜单仅次于 Claude
首页
资讯中心
/
阿里 Qwen3.8 正式发布:2.4 万亿参数的国产旗舰,Arena 榜单仅次于 Claude
阿里 Qwen3.8 正式发布:2.4 万亿参数的国产旗舰,Arena 榜单仅次于 Claude
发布时间:2026/8/5 7:38:06
8月3日阿里巴巴正式发布新一代基座大模型Qwen3.8总参数量2.4万亿在编程Coding和专业办公Cowork方面能力大幅提升。发布当天放榜的权威三方榜单Arena中阿里Qwen模型仅次于Anthropic的Claude系列整体性能处于全球大模型第一梯队。这是继Kimi K3之后国产大模型两万亿俱乐部迎来的又一位成员。港股阿里巴巴早盘股价持续拉升截至发稿涨近6%。资本市场的反应比任何评测榜单都来得更诚实。这篇文章按时间线拆解这场发布看看2.4万亿参数背后阿里到底在下一盘什么棋。7月19日的预告半个月前就埋下的伏笔这场发布并不是突然发生的。7月19日下午阿里千问大模型官方账号发文预告Qwen3.8-Max预览版模型首发上线阿里Token Plan、Qoder及QoderWork三个产品。预告里写得很直白Qwen3.8很快将发布并开源新模型参数达到2.4T。可能是除了Fable 5外最强大的模型。这句话在开源社区里被反复引用因为它直接给新模型定了位瞄准的是全球最强闭源模型的席位。半个月后的8月3日正式版如约而至。从预览版到正式版的节奏掐得比很多人的预期更紧。预览版先给三个产品线用等于提前在真实流量里做了压测。Token Plan是阿里面向API重度用户的订阅计划Qoder是编程助手QoderWork是面向工作场景的智能体产品。三个产品覆盖了消费侧、开发侧、办公侧三种完全不同的负载形态。用真实产品验证模型再用正式版承接全部流量这套打法在商业上相当稳健。2.4T参数与95B激活稀疏MoE的又一次跃迁Qwen3.8-Max是千问系列中尺寸最大、性能最强的旗舰模型。在模型架构上Qwen3.8通过稀疏MoE架构与混合注意力机制的联合优化首次将千问大模型的总参数量拓展到2.4T。总参数2.4T激活参数只有95B。这个数字组合意味着什么参数总量决定了模型的知识容量上限激活参数决定了单次推理的实际计算量。把2.4T参数塞进95B的激活预算里靠的是MoE把模型拆成无数个专家子网络每次推理只唤醒最相关的那一小部分。稀疏激活的本质是用更少的计算量换取更大的知识容量。混合注意力机制的加入则让模型在处理长上下文时不再被全量注意力计算拖垮。这两个设计的直接结果是更高的推理效率更快的推理速度以及整体性能的新突破。Qwen3.8支持视觉理解上下文长度达到1M Tokens。一百万Token的上下文意味着模型可以一次性吞下整本技术手册、整份代码仓库的说明文档再开始工作。长上下文与视觉理解的组合是Agent类应用最需要的底座能力。从架构选择上可以清楚看到Qwen3.8不是为聊天设计的是为执行设计的。MoE与混合注意力的组合在业界并不新鲜但把总参数推到2.4T同时保持95B的激活量需要的工程积累远超一般团队的能力范围。专家路由的负载均衡、长上下文下的注意力稀疏化、多模态输入与文本输入的共享专家分配每一环都是硬骨头。千问团队敢把这三个难题一起做进旗舰模型说明这套架构已经在内部验证了足够长的时间。Arena榜单仅次于Claude的国产旗舰发布当天放榜的权威第三方榜单Arena中阿里Qwen模型仅次于Anthropic的Claude系列。整体性能处于全球大模型第一梯队这个表述第一次和国产开源模型放在一起显得如此顺理成章。在权威Vision Arena榜单中Qwen3.8-Max排名全球第二。视觉榜单的含金量不亚于文本榜单因为多模态能力正在成为旗舰模型的标配战场。文本与视觉双线并进说明这次发布不是单项补强而是整体换代。Arena榜单的排名来自全球用户的匿名盲测投票不是实验室自报分数。这意味着Qwen3.8在真实使用体验层面已经追上了过去两年被认为不可逾越的差距。盲测投票的样本来自全球开发者、研究人员和普通用户他们在不知道模型身份的情况下对比回答质量。这种评测方式最贴近真实使用感受也最难被刷分操纵。仅次于Claude系列这个结果等于全球用户用脚投票投出来的结论。一串可以核对的分数Qwen3.8在指令遵循IF Bench评测中斩获82.8分。科学推理GPQA Diamond取得92.6分。在视觉推理BabyVision评测中Qwen3.8-Max在无工具条件下取得82.0分超出部分主流模型近两倍。在评估智能体电脑操作能力的OSWorld-Verified评测中Qwen3.8-Max以86.1分位居主流模型首位。把这几组数字放在一起看会更清楚Qwen3.8的侧重在哪里评测项分数位置IF Bench 指令遵循82.8全球前列GPQA Diamond 科学推理92.6全球前列BabyVision 视觉推理无工具82.0超出部分主流模型近两倍OSWorld-Verified 电脑操作86.1主流模型首位Vision Arena 视觉榜单—全球第二CodeArena 编程榜单—全球第四指令遵循、科学推理、视觉推理、电脑操作、编程五个维度全部进入全球前列。这不是单项冠军而是六边形战士。尤其值得注意的是OSWorld-Verified的86.1分。这个基准模拟的是模型像人一样操作电脑的完整流程看屏幕、点按钮、填表单、读反馈。它是Agent能力最直接的度量衡之一也是从会聊天到会干活的分界线。模型在OSWorld上的分数直接决定了它能不能胜任自动化办公、自动化运维这类高价值任务。86.1分位居首位意味着至少在电脑操作这个维度上Qwen3.8已经是最能干的模型。如果说两年前的大模型比赛比的是谁更会说话那么现在比的是谁更会办事。OSWorld这类基准的出现本身就是行业风向转变的标志评测标准在从对话能力向执行能力迁移。Coding从写好函数到交付项目编程能力是前沿大模型的核心能力之一Qwen3.8实现了自主编程的新突破。在权威CodeArena榜中Qwen3.8位居全球第四。两年前的前沿模型能写好函数、补全代码成为程序员的有力帮手。而如今的Qwen3.8可以从一个空文件夹出发自主完成一个十数天的真实项目交付全程无需人干预。注意这句话的每一个限定词空文件夹真实项目十数天全程无需人干预。这不是demo级的代码生成而是把软件工程里的需求拆解、架构设计、编码实现、测试修复、文档编写全部打包进了一次自主执行。编程能力的评价标准已经变了从能不能生成代码变成能不能把项目跑起来。对开发者来说这意味着人机协作的粒度可以进一步下探人类负责定义目标模型负责执行过程。十数天的项目周期对应的是真实业务系统的开发量级不是玩具项目。从函数补全到项目交付中间跨越的是工程能力的整条链路。这条链路里最难的环节不是写代码而是保持目标一致十几天的时间里模型需要记得最初的需求抵抗中途的各种干扰持续向最终目标推进。这也是为什么自主编程比代码生成难出一个量级生成只需要局部正确交付要求全局一致。RecreationBench从零复刻一个应用千问团队构建了一个名为RecreationBench的应用复刻基准用来测试长程任务能力。在这个基准里模型没有源代码也无法联网只通过交互与反馈去理解一个应用。结果Qwen3.8从零复刻出了整个应用。这意味着模型已经展现出前沿水准的混合多模态智能体能力。它通过迭代编程—交互反馈的反复循环把视觉编程Visual Coding推向新的高度。模型先看界面再猜逻辑再动手写再看反馈再改。这已经不是一个生成器而是一个工程师。从零复刻应用与普通代码补全之间隔着整个软件工程方法论的距离。这类长程任务考验的是模型的记忆保持、错误修正和目标管理能力任何一环断裂都会导致任务失败。Qwen3.8能完成从零复刻说明它的Agent能力已经通过了最严格的压力测试。这个能力放到真实世界里就是你给我描述一个系统我还你一个能跑的实现。对企业来说这意味着很多重复性的开发需求可以完全交给模型人力只负责验收和迭代。Cowork真实环境与算力联合强化学习除了CodingQwen3.8的另一条主线是Cowork专业办公能力。面对完全不同的专业任务、评判标准和计算需求Qwen3.8通过真实环境和算力的联合强化学习RL扩展实现了数百种高价值、高频专业任务的真实表现提升。普通模型的RL训练是在模拟环境里打游戏Qwen3.8的RL是在真实的工作流里干活。在主流的智能体框架中Qwen3.8都可以稳定可靠地交付生产级成果。这背后的训练成本极高但效果也极其直接模型不是在考试卷上刷分而是在工位上干活。数百种专业任务的覆盖面意味着它不再是某一个垂直场景的专用模型而是可以横跨多种工作类型的通用执行体。联合RL的关键词是联合环境是真实的算力是真实的反馈也是真实的。这样的训练信号密度远高于任何人工标注的合成数据。从效果上看Cowork能力决定了模型在Agent产品里能不能真正顶上去干活而不是只当个问答机器人。RL扩展的真正价值在于把知道怎么做变成真的会做。这也是为什么阿里要把训练放到真实环境和算力里合成的训练数据可以教模型回答问题但教不会模型处理真实世界的噪声和不确定性。千问办公Agent产品与模型同步落地阿里今日同步推出了Agent产品千问办公Qwen3.8已经接入其中。模型发布当天就有配套的Agent产品落地这个节奏值得注意。过去的一年里各家厂商的路径分化得很明显有的先发模型再找场景有的先做产品再等模型。阿里选择了第三条路模型和Agent产品同一天发布从第一天起就让模型在真实办公场景里跑。这符合Agent时代的竞争逻辑模型能力只是起点谁能更快地把能力封装进可用的产品谁就掌握了分发入口。千问办公的定位是把专业办公任务从人操作软件变成模型操作软件人审核结果。办公场景是最适合Agent落地的战场流程标准、反馈明确、价值可量化。模型接进办公产品意味着从第一天就有真实用户在真实任务上打磨它。这种发布即使用的节奏和传统大模型发布后等生态的模式形成了鲜明对比。阿里云生态里沉淀了海量的企业级应用场景财务、人力、法务、供应链、客服每个场景都是一座金矿。千问办公把这些场景串起来等于把Qwen3.8直接送到了最能产生价值的地方。这也是大模型竞争从模型军备竞赛走向场景落地竞赛的缩影。价格每百万Token输入12元、输出36元今日起全球开发者都可以通过千问AI平台获得Qwen3.8的API服务。国内定价每百万Tokens输入12元、输出36元隐式缓存命中仅1.5元。国际定价同样激进输入与输出的国际价格仅为Opus5的40%与24%。把价格换算成百分比看起来会更直观计费项国内价格每百万Token相对Opus5输入12元40%输出36元24%隐式缓存命中1.5元—相近的智能更低的成本这是开源生态最熟悉的进攻方式。对开发者来说这意味着用Opus5一个零头的成本就能跑起一个同档次的模型。隐式缓存命中1.5元的价格更是为Agent循环这类高重复度的调用场景量身定做。Agent任务里系统提示词、工具定义、上下文窗口往往反复命中缓存缓存价格直接决定单次任务的总成本。把缓存打到1.5元等于给Agent开发者发了一张长期折扣券。价格战的本质是成本结构战谁的单位算力成本更低谁就能把价格压得更久。阿里敢定这个价说明它在推理侧的规模效应已经跑通了。对独立开发者来说这个价格直接改变了Agent应用的商业模式以前跑一个复杂的Agent任务token成本可能吃掉全部利润现在可以放心地让模型多思考、多调用工具。成本下降解放的是使用习惯而使用习惯决定生态的繁荣程度。真武M890超节点1.5倍的Agentic推理提升阿里真武M890超节点也已成功适配Qwen3.8。通过芯片、云平台与千问大模型的全链路优化显著提升推理效率、降低推理成本。在Agentic推理场景中最多可实现1.5倍性能提升。注意这个数字背后的含义Agent推理和普通对话推理的负载特征完全不同。Agent需要频繁的工具调用、长上下文维持、多轮状态管理对推理系统的要求苛刻得多。真武M890针对这类场景做全链路优化说明阿里已经预见到Agent将是旗舰模型的主战场。软硬件协同优化正在成为大模型竞争的下一个分水岭。同样的模型在不同推理系统上的成本和延迟可以相差一倍以上。把芯片、云平台和模型放在一起调优正是阿里云相对独立芯片厂商的独特优势。芯片厂商只能优化通用的推理路径而阿里云可以针对Qwen3.8的MoE路由、注意力机制和工具调用模式做定制优化。这种模型定义芯片优化方向的做法正在成为大厂的新壁垒。对使用云服务的开发者来说1.5倍的性能提升意味着同样的预算可以支撑更多的并发请求或者把响应时间压到更短。下周开源Max与27B的双重布局Qwen3.8-Max预计下周开源同时还将开源Qwen3.8-27B。一个2.4T参数的旗舰模型选择开源这在全球范围内都是极具冲击力的决定。开源意味着任何人都可以下载权重、本地部署、微调定制。27B的小尺寸版本则覆盖了另一类需求资源受限的边缘场景、私有化部署、以及希望深度定制的中小团队。大模型开源这条路从Qwen系列的第一代走到今天一直是阿里最坚定的战略。每一次发布都在把开源模型的性能上限往上推一截。而这次上限被推到了仅次于Claude的位置。开源与闭源的双轨竞争正在进入白热化阶段。2.4T旗舰开源还有一层生态意义给整个开源社区提供了一等公民级别的底座。社区可以在它上面做微调、做蒸馏、做垂直模型整个开源生态的起点都会被抬高。这也是为什么开源圈把这次发布称为分水岭时刻。不过也要提醒一句2.4T的权重下载和部署门槛不低需要多卡集群才能跑起来普通开发者更现实的路径是用API或者等27B版本。阿里同时开源两个尺寸正是为了让不同资源条件的开发者都能上车。开发者的第一行代码对开发者来说Qwen3.8接入应用的方式和OpenAI兼容接口保持一致。如果你已经在用OpenAI的SDK那么切换到Qwen3.8只需要改两个参数。下面是调用Qwen3.8 API的真实示例可以直接运行from openai import OpenAI client OpenAI( api_key你的千问API密钥, base_urlhttps://dashscope.aliyuncs.com/compatible-mode/v1, ) response client.chat.completions.create( modelqwen3.8-max, messages[ {role: system, content: 你是一名资深后端工程师。}, {role: user, content: 设计一个订单系统的幂等接口说明关键设计点。}, ], max_tokens2048, temperature0.7, ) print(response.choices[0].message.content)这段代码里base_url指向阿里云DashScope的OpenAI兼容模式model参数填qwen3.8-max。其余的部分和调用任何OpenAI兼容接口没有任何区别。Agent场景下的调用方式也很直接工具调用function calling沿用OpenAI的格式。模型返回tool_calls字段你的Agent循环解析后执行工具再把结果传回给模型。从对话到工具调用从单轮到多轮迁移成本被压到了最低。这正是开源旗舰模型生态的威力接口标准统一切换成本趋近于零。对于已经在生产环境跑着Agent服务的团队这意味着一次改配置就能完成模型升级。唯一需要评估的是数据合规和网络链路其余全部无缝衔接。对于已经有OpenAI迁移经验的团队这个过程可能只需要一个下午。迁移成本越低新模型被采用的速度就越快这是大模型市场最朴素的规律。两万亿俱乐部的攻守转换Qwen3.8的发布把国产大模型的竞争带进了新阶段。Kimi K3的2.8万亿参数、Qwen3.8的2.4万亿参数两万亿俱乐部里已经站着两家。更重要的是这两家的路线形成了有趣的对照一家在闭源与开源的边界上游走一家把旗舰模型彻底开源。开源模型的性能天花板每被抬高一寸闭源厂商的定价权就被削弱一分。阿里选择在这个时间点把2.4T参数的旗舰开源等于在告诉市场最强的模型不一定要藏起来卖。从行业格局看这次发布有三个层面的影响。第一层是价格锚点12元输入、36元输出、1.5元缓存的定价会把同档模型的全球定价再往下拉一截。第二层是开源天花板2.4T旗舰开源后闭源模型的差异化空间被进一步压缩竞争焦点被迫转向产品、服务和生态。第三层是Agent赛道千问办公同步落地OSWorld 86.1分意味着Agent应用有了更便宜的国产底座。对开发者来说这是最好的时代全球第二梯队的性能开源权重1.5元的缓存命中价格下周就能拿到手。剩下的问题只有一个你打算拿它做什么。