恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
GPT-6 Astra 48 小时实测:3D 重建封神,写作却退步 80 分
首页
资讯中心
/
GPT-6 Astra 48 小时实测:3D 重建封神,写作却退步 80 分
GPT-6 Astra 48 小时实测:3D 重建封神,写作却退步 80 分
发布时间:2026/9/9 2:43:08
GPT-6 Astra 48 小时实测3D 重建封神写作却退步 80 分TL;DR 速览能力分裂空间理解/3D/Agent 任务封神写作能力明显退步Elo 跌约 80 分核心转向Astra 从回答问题转向自主执行任务桌面操控完成率 72.6%定价争议每百万 token 输入 $10、输出 $50是上代 Sol 的 2.5 倍判断标准综合智能分几乎持平上代拼的不是更聪明而是能干活OpenAI 把发布会变成了一场公开压力测试9 月 3 日OpenAI 正式发布GPT-6 Astra。拿到早期访问权的开发者在 48 小时内把这次发布变成了一场公开压力测试。结果沿一条清晰的分界线呈现Astra 在空间理解、机械操作与自主代理任务上是迄今最强的模型但多名同一批测试者认为它在写作上不如自己的前代产品 GPT-5.6 Sol。OpenAI 总裁 Greg Brockman 在发布简报里宣布AGI 时代已经到来。但同一批人给出的实测却是冰火两重天。最强的一面空间、3D 重建、游戏开发Astra 最惊艳的表现集中在视觉理解与空间感知多个独立案例相互印证。曼哈顿复刻。投资人、前 HyperWrite CEO Matt Shumer 让 Astra 在 Unreal Engine 里工作了一周最终生成了一份逐街还原的曼哈顿复制品。他随后又让 Astra 构建一个生存世界、并用模型的独立副本驱动其中每个角色隔夜运行后发现——这些角色已经开始自发对话。杭州 24 分钟进城。一位以 SuSu 为名的开发者让 Astra 在24 分钟内用 Three.js 重建了杭州及周边城镇包含西湖、雷峰塔、茶园和湿地支持地标点击与昼夜切换是可交互的微缩杭州而不是一张静态图。3D 模型在浏览器里就能跑无需下载。一张照片出可编辑几何体。Tom Krcha 输入一张房屋外观图得到包含家电和玩具细节、以 60 帧每秒运行的完整室内可编辑几何体。一天造出联机射击游戏。前 Apple/Coinbase 开发者 Rishi Prasad 用一天时间构建了浏览器射击游戏 AstralWar支持权威多人服务器、12 人房间、手柄和语音聊天他评价是视觉保真度对 Claude Opus 5 的巨大跃升。计算机操控Astra 的招牌Astra 真正的核心能力是计算机使用computer use——模型直接驱动鼠标和键盘操作真实桌面而不是丢给你一份操作指引。在 OSWorld 2.0 基准上OpenAI 报告的完成率是72.6%每任务约 40 分钟高于 Sol 的 65.7%每任务 75 分钟。在 ScreenSpot-Pro测试模型能否独立定位和点击屏幕元素上OpenAI 和外部评测都把它放在低九十远超 Sol 的七十多。有一个测试特别直观日本插画师 TaiyakiSun 把一张手绘线稿交给 Astra要求它像人类上色师一样在 Clip Studio Paint 里用鼠标完成上色。Astra 自己创建图层、缩放视图、选择画笔并填充画面整个过程插画师只是在旁边观看——这次操作消耗了他 100 美元 Pro 计划 21% 的配额。音乐一个意外之喜Astra 是语言模型不是音乐模型但它在音乐上的表现超出预期。博主 Auggie 维护一项非正式基准要求模型用 LilyPond 格式创作一段巴赫风格的四声部合唱。Astra 创下该测试的最高分无任何声部进行错误还用了拿波里六和弦是该基准中第一个写出经过音的模型。医生兼 AI 测试者 Derya Unutmaz 则让 Astra 在约 11 分钟内构建了一架包含巴赫全部六首勃兰登堡协奏曲的可演奏虚拟钢琴。当然要客观Astra 的音乐理解来自乐谱和文字数据而非音频训练所以这些成绩对文本模型很出色但和 Suno 等专用音乐 AI 比仍有差距。最弱的一面写作退步AI 味明显写作是 Astra 最被批评的领域多名独立测试者的评估指向同一结论。编辑风格匹配度 Elo 下滑。Louis-François Bouchard 运营一项以 Elo 评分衡量模型编辑风格匹配度的内部基准。Astra 以 1995 分排第 11其前代 Sol 以 2156 分排第 6。他评价出人意料地令人失望。经济损失基准下跌约 80 分。独立评测机构 Artificial Analysis 记录到Astra 在涵盖 44 种职业的经济价值任务基准 GDPval-AA v2 上下滑约80 个 Elo 分在客户支持和长上下文推理上也出现小幅退步。真实验证。量化投资专家 Giuseppe Paleologo 让 Astra 就最优投资组合多元化提出新颖见解得到的回复被他评价为显而易见与夸大其词的混合文风一眼可辨是机器生成结论是真正的创造力仍然遥不可及。AI 检测机构 Mia AI Lab 认为 Astra 缺乏个性建议回避一切创意写作任务。测试者 Ingar Haaland 让 Astra 模仿其个人风格写作结果没能通过 AI 检测工具 Pangram 的检测。值得说明的是也存在反例Cognition 的 Silas Alberti 表示 Astra 的写作让 Devin 的测试报告更清晰Every 的员工 Katie Parrott 让 Astra 起草了自己对模型的评测初稿该媒体 CEO 读后没有察觉不是她本人写的。但这些个例压不过多数测试者对AI 味的一致批评。定价与综合表现贵了 2.5 倍赢在能干活Astra 的定价是每百万输入 token 10 美元、输出 token 50 美元是前代 GPT-5.6 Sol 的 2.5 倍。但高溢价背后它的综合领先优势其实有限。据 Artificial AnalysisAstra 在 Intelligence Index 上得分 61.2Sol 为 60.9Anthropic 的 Claude Fable 5.1 为 65.7——Astra 只比 Sol 高了 0.3 分却被比自己便宜的对手甩开。这个数据说明了一件关键的事Astra 不是靠更聪明取胜而是靠能干取胜。它把答案进化成行动把推理落地成任务执行。这是从会问会答到能动手干活的范式转变也是为什么 Greg Brockman 敢说AGI 已到来而 Gary Marcus 却批评黄仁勋没有证据、没有定义这是对科学问题的企业式接管。我如何测 Astra从值不值得用的角度看综合来看Astra 是一场能力分裂的发布没有传说的那么神也绝不是平庸。如果你侧重创意、写作、内容生产——不建议优先上 Astra。它的写作 Elo 明显退步、AI 味重、单次生成成本还是上代 1.8 倍。这个赛道你手上的工具可能更划算。如果你侧重空间建模、3D 重建、游戏开发、自主 Agent、桌面自动化——Astra 是当前最强的选择没有之一。24 分钟重建一座城、45 分钟出一款 3D 游戏、72.6% 的桌面任务完成率这些数字是实打实的生产力。Astra 是那种越用越觉得它像生产力工具的模型。如果你在乎成本——注意它的定价是 Sol 的 2.5 倍。一个实测引用的约 $0.26/方案的生成成本、21% 配额的一次上色任务都在提醒你Astra 的强是有价格标签的强。那些低成本高回报的用例才是真正适合企业上车的场景。我的判断Astra 兑现了 OpenAI 的押注也暴露了代价GPT-6 Astra 是一次方向性的押注OpenAI 赌的是AI 的能力增量在行动而不在思考。从 48 小时实测看这个赌注部分兑现了——3D 重建、游戏开发、桌面操控这些能动手的能力确实封神但代价是相对的思考与表达能力写作被牺牲了还叠加了 2.5 倍的定价。对开发者我的建议是按任务类型而非模型名气来选型写作内容选别家动手干活选 Astra省钱求均衡看性价比。别被AGI 到来的宣传带偏也别因为写作退步就全盘否定——Astra 不是万金油它是某几个领域的天花板。