恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
GPT-5.6 Luna 降价 80%:从 24% 到 90% 的缓存命中率,OpenAI 的价格战打在了工程层
首页
资讯中心
/
GPT-5.6 Luna 降价 80%:从 24% 到 90% 的缓存命中率,OpenAI 的价格战打在了工程层
GPT-5.6 Luna 降价 80%:从 24% 到 90% 的缓存命中率,OpenAI 的价格战打在了工程层
发布时间:2026/8/4 4:04:55
2026 年 7 月 30 日OpenAI 宣布 GPT-5.6 系列 API 调价。最轻量的 Luna 输入价格从每百万 token 一美元降到零点二美元输出价格从六美元降到一点二美元降幅百分之八十。中档的 Terra 降价百分之二十旗舰 Sol 价格不动但新增了更快的推理选项。距离 GPT-5.6 系列 7 月 9 日上线只过去了二十一天。二十一天就降价百分之八十这在 OpenAI 的定价历史上没有先例。官方给出的理由是推理效率提升。但真正值得追问的是效率提升到底发生在哪里。这篇把账一笔一笔算开。第一笔账三档价格差多少先把账本摊开看。型号输入价美元/百万 token输出价美元/百万 token定位Sol5.0030.00旗舰推理Terra2.50 → 2.0015.00 → 12.00均衡Luna1.00 →0.206.00 →1.20轻量快速这是 GPT-5.6 系列的三档定价。Sol 是旗舰负责复杂推理。Terra 是均衡档负责日常业务。Luna 是轻量档负责高吞吐低延迟场景。这次降价之后Luna 的输入价格已经低于很多国产推理服务的同类模型。甚至和 GPT-4o mini 当年的定价区间接近了。一个中等规模的 SaaS 产品假设每月调用十亿 token输入输出各一半。降价前 Luna 的成本大约是三千五百美元一个月。降价后变成七百美元一个月。每月省两千八百美元年化超过三万三千美元。对用量规律的中型产品来说这轮降价把 Luna 从跑量时要精打细算的选项变成了可以放心跑量的默认选项。但价格表只是结果不是原因。第二笔账客户实测的效率账OpenAI 在公告里附了一条来自客户的实测数据这条数据才是整件事的关键。Blitzy 的 CTO Sid Pardeshi 说Luna 是他们自 GPT-4o mini 以来看到的 agentic 行为最大的一次跃迁。他们从单次结构化输出调用切换到了完整的工具调用 Agent 循环。prompt cache 的复用率从百分之二十四提升到百分之九十。在数千次生产调用里Luna 处理了二点二倍的上下文却输出了八点五倍更少的 token成本比 GPT-5.4 mini 低百分之八十七。这几个数字放在一起能看出很多门道。缓存复用率从二十四到九十意味着同一批前缀 token 被反复计费的次数大幅下降。输出 token 减少八点五倍意味着模型学会了更经济的表达。成本下降百分之八十七是这两个因素叠加的结果。OpenAI 敢降价百分之八十是因为它的单位成本真的降下来了。这不是市场营销是成本结构的变化。模型开始自己优化自己的运行效率这件事的连锁反应才刚开始。第三笔账缓存机制改了什么要理解这次降价必须理解 GPT-5.6 的缓存机制变化。GPT-5.6 引入了更可预测的 prompt caching包括显式缓存断点和三十分钟最小缓存寿命。所谓缓存断点就是开发者在系统提示词里用特殊标记明确告诉 API 缓存边界在哪里。以前缓存是黑盒命不命中看运气。现在缓存边界由开发者控制成本变得可预测。三十分钟最小缓存寿命意味着一段内容写进缓存后至少三十分钟内不会失效。对于高频的 Agent 循环这是巨大的利好。缓存写入按模型未命中输入价的 1.25 倍计费。缓存读取继续享受百分之九十的折扣。超过 27.2 万输入 token 的请求整个请求按输入两倍、输出一点五倍计费。这意味着长上下文请求的成本结构彻底变了。以前你为了省钱会尽量缩短系统提示词。现在你可以把一份很长的系统提示词稳定放在缓存里每次只付读取费。对 Agent 场景来说这是质的改变。Agent 循环里每一轮都要带同样的系统提示和工具定义这部分正是缓存命中的黄金区域。缓存命中率从二十四到九十背后是显式缓存断点让开发者可以精确控制缓存边界。边界控制住了命中率自然就上去了。第四笔账一段真实代码的账空谈机制没有意义直接看代码。下面这段是带显式缓存断点的真实调用示例可以在本地直接跑。from openai import OpenAI client OpenAI(api_keyyour-key) # 显式缓存断点在这两个标记之间系统提示会被缓存 system ( |start_cache_write| 你是一个代码审查助手负责检查 Python 项目的安全漏洞。 审查规则第一检查 SQL 注入风险第二检查不安全的反序列化 第三检查硬编码密钥第四检查权限校验缺失。 输出格式JSON 数组每个元素包含 severity、location、description 三个字段。 |end_cache_write| ) resp client.responses.create( modelgpt-5.6-luna, input[ {role: system, content: system}, {role: user, content: 审查这段代码\n code} ], ) # 同一循环的下一轮系统提示命中缓存只付读取费 resp2 client.responses.create( modelgpt-5.6-luna, input[ {role: system, content: system}, {role: user, content: 继续审查\n code2} ], )这段代码的关键在系统提示里的两个标记。第一轮调用时标记内的内容写入缓存按写入价计费。第二轮及之后的每一轮标记内的内容从缓存读取只付百分之十的读取价。如果 Agent 循环有一百轮前两轮之后九十八轮都只付读取费。这就是缓存命中率从二十四拉到九十的工程实现。对照 Blitzy 的实测一轮 Agent 循环的成本可以下降一个数量级。第五笔账选型账怎么算三档模型现在变成了三套成本模型。Sol 五美元输入、三十美元输出适合需要最强推理的复杂任务。Terra 两美元输入、十二美元输出适合中等推理强度的日常业务。Luna 零点二美元输入、一点二美元输出适合高吞吐低延迟的批量场景。当 Luna 的价格低到 GPT-4o mini 的档位很多原本不敢用大模型的场景开始变得可行。分类、抽取、路由、简单的 Agent 循环这些任务用 Luna 的成本可以忽略不计。但要注意Luna 的推理能力有上限。需要复杂推理的任务省下的钱会在返工里加倍花出去。正确的做法不是无脑切 Luna而是按任务复杂度分层。高价值低频率的任务走 Sol。中价值中频率的任务走 Terra。高频率低价值的任务走 Luna。再加上缓存策略一个中等规模产品的 API 成本可以压缩一个数量级。第六笔账长上下文定价的账这次调价还有一个容易被忽略的细节就是长上下文定价规则。GPT-5.6 系列全部模型拥有 105 万 token 的上下文窗口。但超过 27.2 万输入 token 的请求输入按两倍计费输出按一点五倍计费。这个规则对 Agent 场景影响很大。很多团队喜欢把所有上下文一股脑塞进一次请求。一次请求塞到五十万 token账单直接翻倍。同样的内容拆成两次请求配合缓存断点反而更便宜。这就是长上下文时代的新记账方式。上下文长度不是免费的午餐超过阈值就要加钱。聪明的做法是把稳定的长内容放进缓存区把变化的内容放在请求尾部。尾部每轮变化但长度短按正常价计费。头部内容长但命中缓存只付百分之十。一进一出总成本比单次大请求低得多。这笔账很多团队还没有算明白。第七笔账对国产模型的压力账Luna 零点二美元的输入价对国内模型厂商不是好消息。之前国产推理服务能打价格战靠的是比 OpenAI 低得多的定价。现在 Luna 直接杀到零点二美元折合人民币不到一块五。国内很多同类模型的价格优势瞬间消失。更麻烦的是Luna 背后是 OpenAI 的整个工程体系。缓存机制、显式断点、三十分钟最小寿命这些是成本控制的基础设施。国产模型要跟进降价就得先建起同样的成本控制能力。只靠压缩利润空间打价格战撑不了多久。这轮降价的真正压力不是价格本身而是价格背后的工程能力。第八笔账缓存命中率的账回到 Blitzy 那个数字缓存复用率从二十四到九十单独拿出来算一笔。假设一个 Agent 任务跑一百轮循环每轮系统提示加工具定义一共两万 token。两万 token 里一万八千是稳定内容两千是每轮变化的部分。缓存命中率二十四的时候稳定内容大部分没有命中缓存每次都要按输入价重付。一百轮下来稳定内容被重复计费约一百八十万 token。缓存命中率九十的时候稳定内容几乎全部命中缓存每次只付百分之十。同样一百轮稳定内容的实际计费降到约十八万 token。一亿 token 规模的月度任务这笔差距就是几十倍的账。这才是成本下降百分之八十七的真相。不是模型变便宜了是同样的能力用更少的钱跑完了。单位 token 的价格没有变单位任务的成本变了。理解了这一点就理解了 OpenAI 降价的底气。第九笔账开发者改怎么接对开发者来说这轮降价带来的不是选择题而是必答题。还在用旧模型跑高吞吐业务的团队应该立刻评估切 Luna。切的时候注意三件事。第一把系统提示和工具定义固化成常量不要每轮动态拼。第二在稳定内容的边界放上缓存断点标记。第三单轮输入超过 27.2 万 token 的请求拆开重写。这三件事做完成本基本能降一个数量级。不做的团队等于每个月把钱白白扔掉。另外提醒一句Luna 适合的是高吞吐场景不是复杂推理场景。把 Sol 的活交给 Luna省下的钱会在返工里还回去。分层用模型配合缓存策略才是这轮降价的最大红利。第十笔账从四 mini 到 Luna 的价格轨迹把 Luna 的价格放进历史坐标里看会更清楚。GPT-4o mini 当年发布时输入价零点一五美元输出价零点六美元。那是 OpenAI 第一次把入门档价格打下来。之后两年入门档模型的价格一直在缓慢下探但始终没有突破那个区间。GPT-5.4 mini 的定价和四 mini 相比并没有本质变化。这次 Luna 零点二美元的输入价已经逼近当年四 mini 的水平。但 Luna 的能力比四 mini 高了一个时代。它有完整的工具调用能力有原生 Agent 循环支持有一百零五万上下文窗口。用当年入门档的价格买到今天的前沿档能力这才是这次降价真正惊人的地方。模型能力的代差在缩小价格却在向历史低位靠拢。这两条曲线的交叉是 Agent 应用爆发的信号。第十一笔账Sol 加速的账这次调价还有一个容易被忽略的细节就是 Sol 新增的快速推理选项。Sol 的价格没有变输入五美元输出三十美元。但同样的价格推理速度更快了。对延迟敏感的生产环境来说这是另一种形式的降价。同样花三十美元以前能等到的响应现在更快返回。单位时间内的吞吐量提升了单位任务的成本其实也降了。OpenAI 没有把所有牌都押在 Luna 上。高端用速度换价值低端用价格换规模。两头夹击中间档的 Terra 降价百分之二十正好卡住腰部市场。三档模型三套竞争策略这次调价是一次完整的定价体系重构。第十二笔账一次真实任务的全成本账把前面的账合起来算一次真实任务的完整成本。假设你做一个代码审查 Agent每天跑五百个任务。每个任务平均三十轮循环每轮系统提示加工具定义两万 token。每天稳定内容的调用量是三亿 token。用旧模型缓存命中率百分之二十四输入价一美元。稳定内容里只有百分之二十四命中缓存其余百分之七十六按全价计费。每天稳定内容的成本大约两千二百美元。换 Luna 之后输入价零点二美元缓存命中率百分之九十。每天稳定内容的成本降到大约四十美元。这只是输入侧的稳定内容还没算输出和变化部分。即使把输出和其他开销全部算上日成本也能从三千美元级别降到三百美元级别。一个月下来一个 Agent 产品的 API 成本从九万美元降到九千美元。这个量级的成本下降直接改变产品的商业模型。以前只能卖给大客户的 Agent 服务现在中小客户也买得起了。以前算不过账的自动化场景现在全部变成可行。这才是降价百分之八十的真正含义。第十三笔账成本结构健康的账最后算一笔长远的账。OpenAI 这次降价的底气来自成本结构的优化不是补贴。缓存机制的完善让相同的算力服务更多请求。显式断点让缓存命中率可预测算力利用率大幅提升。输出 token 减少八点五倍说明模型本身的效率也在提升。这些是实打实的工程改进不是烧钱换市场。补贴式降价不可持续工程式降价可以持续很久。因为每一次工程优化都在为下一轮降价储备弹药。对手跟进的是价格OpenAI 领先的是成本能力。价格可以随时改成本能力需要长期积累。这场价格战的终局是成本能力的比拼。谁的成本结构更健康谁就能在价格上笑到最后。算总账价格战打在了工程层这次降价的真正含义不是 OpenAI 开始打价格战。而是模型推理的成本结构被工程手段改写了。缓存命中率从二十四到九十输出 token 减少八点五倍这两件事和模型参数无关和工程优化有关。当 OpenAI 能把一个模型的单位成本压到竞争对手难以跟进的位置价格就成了最锋利的竞争武器。对开发者来说这轮降价最实际的价值是Agent 循环的成本终于降到可以放心跑量的水平。以前跑一个百轮 Agent 循环光 token 费就让人心疼。现在同样的循环成本只有原来的十分之一。这意味着很多以前算不过账的自动化场景现在都能跑起来了。未来六个月谁能把缓存策略用明白谁的 API 账单就能比同行低一个数量级。这场价格战的终点不是谁更便宜而是谁的成本结构更健康。OpenAI 已经出牌了接下来看别人怎么跟。第十四笔账二十七万两千 token 阈值的账长上下文定价规则里二十七万两千这个数字值得单独算一笔。为什么阈值定在这里官方没有解释。但从工程角度推测这个数字和缓存分片的物理布局有关。超过这个阈值缓存系统需要跨分片管理成本结构完全不同。对开发者来说重要的是记住这个数字然后在设计请求时避开它。一次请求塞进三十万 token输入价格直接翻倍。同样的内容拆成两段每段十五万就落在正常价区。配合缓存断点两段都能命中缓存成本反而更低。这就是长上下文时代的请求设计学。以前上下文越长越省钱因为省了拼接的麻烦。现在上下文越长越费钱因为触碰了阈值。设计 Agent 循环时必须把请求长度当作第一优先级的约束。把稳定的长内容放进缓存区把变化的内容放在尾部。这个模式在 GPT-5.6 的定价体系下是成本最优解。第十五笔账缓存写入费的账缓存写入按未命中输入价的一点二五倍计费这个规则也要算明白。很多人看到一点二五倍就皱眉觉得写入太贵。但实际算下来写入费在总成本里的占比很小。一次写入之后无数次读取读取只要百分之十。写入贵一点二五倍读取便宜九成怎么算都划算。真正要避免的是频繁触发缓存失效。如果系统提示每次都在变缓存永远写不进去等于白交写入费。把系统提示和工具定义做成常量是使用缓存的第一原则。动态内容放在缓存区之外保持缓存区的稳定。缓存区越稳定写入费的摊薄效果越好。一个设计良好的 Agent缓存写入费可以摊薄到总成本的百分之二以下。第十六笔账对 MCP 生态的账这轮降价对 MCP 生态的影响值得单独说。MCP 协议下的 Agent 循环每一轮都要携带工具定义。工具定义越长缓存命中的收益越大。以前工具定义三万字每轮都按全价重付成本感人。现在工具定义放进缓存区每轮只付百分之十。MCP Server 数量越多工具定义越长省的钱越多。这等于给 MCP 生态发了一张补贴券。多工具、长定义的 Agent 场景在这轮降价里收益最大。那些因为工具调用成本太高而被砍掉的设计现在可以重新捡起来。Agent 的架构自由度变大了。这也解释了为什么 OpenAI 在公告里特意强调 agentic 能力。降价不是目的让 Agent 场景跑起来才是目的。第十七笔账AWS 同步降价的账OpenAI 的公告里还有一句话价格调整将开始滚动到 AWS。这句话的含金量被很多人低估了。AWS 上的企业客户是 OpenAI 最稳定的一批收入来源。这些客户走 Bedrock 或 SageMaker 调用模型价格跟着降。企业级 Agent 部署的成本基准一夜之间被改写。以前企业内部评估 Agent 项目算账算不过去。现在 Luna 的价格让内部项目的 ROI 模型全部重算。这轮降价会直接推动企业 Agent 项目的立项潮。成本下来了试点项目就能转正。转正的项目越多OpenAI 的调用量越大。降价换规模规模再摊薄成本这是正循环。AWS 的渠道能力把这个正循环的半径扩大了数倍。第十八笔账算账的姿势本身最后提醒一句算账的姿势比数字本身更重要。模型价格会持续下降缓存机制会继续演进今天的最优解明天可能就过时。与其死记价格表不如掌握成本模型的分析方法。拿到任何一个新模型先拆解它的计费维度。再算清自己的调用结构哪些内容稳定、哪些变化、请求有多长。把这两个变量放到一起成本最优解自然浮现。这次降价是一个很好的练习样本。看懂它就掌握了未来所有模型调价的读法。