恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

Claude满分、GPT 99分,何恺明团队把AGI考试打穿了

  • 首页
  • 资讯中心
  • /
  • Claude满分、GPT 99分,何恺明团队把AGI考试打穿了

相关资讯

CSS(层叠样式表)基础 2026/10/6 2:52:11
【HOGP】规范精讲[4]: 吃透BLE HID主机规范——HOGP中HID Host全流程设计与实现 2026/10/6 2:47:11
OpenDDE Harness:LLM 智能体抗体设计实战——本地部署 Aureka 开源抗体药物发现引擎 2026/10/6 2:47:11

最新资讯

文件批量重命名14种方法:从手动到脚本的效率升级
麒麟V10救援模式实战:桌面进不去也能修复
ASPICE配置管理落地指南:从版本控制到变更影响分析的完整链路
Electron静默打印实战:从打印机匹配到钱箱联动的完整方案
Openclaw集成实战:从CLI到API,自研工具接入自动化代理框架全解析
Spring Boot+Vue超市进销存源码实战:部署避坑与改造

今日推荐

2026 AI 开发全家桶落地指南:TaoToken 统一 Key 打通 IDE 插件、Agent 与自动化代码审查全链路配置实测
MR25H40CDF+STM32F031C6工业级高可靠数据存储方案
MRAM+STM32工业断电数据保全实战指南

本周热门

MR25H40CDF + PIC18F65K40:工业记录仪高可靠存储实战
基于STM32的数控恒压恒流电源设计:从硬件到PID调参全解析
LT9211 MIPI重定时器原理与双路扇出实战指南

本月精选

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证
2026 大模型集体涨价:用 Python 做企业 Token 成本测算与选型避坑(附配置)

Claude满分、GPT 99分,何恺明团队把AGI考试打穿了

发布时间:2026/10/6 2:52:11
Claude满分、GPT 99分,何恺明团队把AGI考试打穿了 何恺明团队的新论文在X上炸了十一期间刚挂上arXiv的VISTA论文显示过去半年全世界最顶尖的大模型全是被「蒙着眼睛」赶上AGI考场的。同一个Claude Opus 5在官方标准测试里只拿了可怜的40分。何恺明团队只不过帮它摘掉了眼罩让它亲眼看游戏画面顺手递给它一本能随时往回翻的「相册」。结果Claude直接把ARC-AGI-3的25个公开游戏全部打穿拿下100分满分而且它走的步数甚至比第一次玩的人类还少了一半多。18个从没见过的游戏没人给它一句说明AI自己摸清规则一路通关知名AI博主Mark Kretschmann在X上写道「给Agent一个『再看一眼』的能力差别可能非常大。」过去几个月为了打穿ARC-AGI-3各路代码大神写了几千行代码搞世界模拟器。何恺明团队的判断是大模型的脑子早就够用了卡住它的是眼睛和记性。大模型被一张数字表坑了半年ARC-AGI-3是Keras之父François Chollet和ARC Prize基金会今年3月出的AGI考卷。一堆交互式像素小游戏开局没有任何说明和规则全靠玩家自己摸索试错。分数算法极其严苛。官方找来近500名人类小白实测AI不光要通关步数还不能比人类多才能拿满分。可官方考场递给大模型的只是一张64×64的数字表。人类看到的小人、机关和路线到了模型那里只剩4096个数字。这相当于让人闭着眼听别人报坐标去玩《超级马里奥》。同一帧画面左边是官方递给模型的数字表右边是VISTA让它直接看的图VISTA团队做的第一件事就是把数字表换回图片。别的什么都没改GPT-5.6 Sol的分数就从13.33分跳到了47.32分。看图还更省算力。一个数字格子要吃掉约4000个Token一张512×512的图片只要308个。一局跑下来文本版烧掉7190万Token图片版只要3070万分数还更高。光是换上一双真正的眼睛大模型就捡回了34分。只把数字换成图片GPT-5.6 Sol的分数涨了三倍多能通关的游戏从1个变成9个让AI过目不忘一步多拿24分光能看见还不够。一局游戏动辄几百步多模态模型的通病是图片看一遍上下文一满就删或者压缩成几句文字摘要。等模型想回头核对细节时那一帧早就灰飞烟灭了。VISTA的核心杀招就是一本无损视觉记忆「相册」。游戏吐出的每一帧画面连动画帧在内全按编号原样存档。模型想看哪一帧随时调用inspect翻出来几帧并排对比、角落放大都行还能用read_pixels读出精确颜色。最重要的是翻相册不算步数只有真在游戏里操作才计步。团队把这套机制叫作「显式注意力」翻哪一帧、看哪一块全由模型自己说了算。它还随身带着两个笔记本GUIDE.md记游戏规则WORKING.md当草稿纸。VISTA的一个回合模型看画面、想规则需要时翻相册最后才走一步论文里记录了一个极度「像人」的操作瞬间。在BP35游戏第3关画面出现了一个橙色方块。模型点了一下橙块变成了X。它先停了下来把上一回合的最后一帧和刚才的三帧动画调出来并排回放。几回合后它又发现点X能让橙块重新长出来当场写道「这就是我要的工具用它搭天花板挡住会要命的上升。」这一关第一次玩的人类要走44步它只用了34步。点完橙块模型先把前后4帧动画调出来逐帧比对看懂了才接着走到了《吃豆人》里迷宫里的豆子吃一颗少一颗。模型干脆在第13回合和第36回合两次强行翻回开局第一帧去记迷宫地图找路。给模型多塞上下文、多给像素是很多人的第一反应。论文测下来这两招都不灵。上下文从默认的200K开到780K每局Token从3070万涨到1.057亿成绩却从99分退到93.9。图片也是这样。放大到16倍每帧Token涨到1229个成绩只剩88.3只放大4倍成绩是99.7比默认的8倍还高。论文的解释是图片太大多出来的Token白白占掉上下文模型却没有因此看得更明白。上下文从200K拉到780K、图片从8倍放到16倍分数都不升反降多给不一定更好VISTA整套设计走的都是这个思路团队在博客里说他们刻意追求极简。系统里没有一个新训练的模型每个游戏的提示词都是同一份一共四句话没有一个字教它具体怎么玩。VISTA给模型的全部提示词代码派卷了一夏天它一页笔记就追平这个夏天刷爆ARC-AGI-3的高分方案比如Tycho和Schema都是让大模型给每个游戏写一套能运行的程序硬造一个模拟器来反复试错。光跳棋游戏LF52一个Schema就写了整整4000行Python。而VISTA里的模型只用自然语言在笔记里写了三句话就搞定了同样的规则。同一条跳棋规则左边是程序路线的代码全部约4000行右边是VISTA的模型自己记的三句笔记按论文的说法VISTA是第一个不靠写程序就在ARC-AGI-3上做到满分或近满分的系统。这一点放到游戏之外更要紧真实世界里没有谁能提前给你写好一套4000行的模拟器。Claude Opus 5打通了25个游戏的全部183关每个游戏都是100分总共走了7302步只有人类的0.43倍。GPT-5.6 Sol同样全部通关拿到99分。m0r0这个游戏人类要走1107步Claude只用了219步。两份成绩在ARC Prize官方平台上都有记分卡。ARC Prize官方平台上的记分卡183关全部通关25个游戏全是满分25个游戏挨个比蓝条全都比灰条短蓝色是Claude灰色是第一次玩的人类这套纯机械、0训练的Harness极其泛用。把它塞进带透视的3D画面里照样拿下84.12分。套上GPT-5.6 Sol扔进34个网页游戏包含马里奥、2048、我的世界等任务成功率63.3%直接压过人类小白55.3%。就连静态的看图题也能用上。BabyVision的一道连线题不用VISTA时模型把驼鹿和兔子连反了用上VISTA放大一看就答对了。哪怕是用官方实现几乎交了白卷1.89分的320B开源模型套上VISTA后硬生生被抬到了66.93分暴涨35倍一年三篇何恺明团队死磕视觉ARC测试的主流解法一直是被大语言模型垄断的文本推理。但何恺明团队偏不信邪一年连发三篇死磕同一件事ARC是视觉问题。第一篇VARC1800万参数的小号视觉模型从零训练纯看图就追平了人类平均分。第二篇NAT-ARC先让模型在ImageNet上看猫看狗补课抽象推理跟着变强。第三篇就是VISTA小模型都不练了直接给前沿大模型配上「相册」。何恺明组一年三篇ARC论文押的都是「ARC是视觉问题」串起三篇论文的是何恺明的博士生胡珂雅本科出自上海交大ACM班三篇里两篇一作、一篇二作。VISTA另外两位共同一作是MIT博士生Qiushi Han和Linlu QiuMIT副教授Cathy Wu也在作者之列。曾经靠ResNet和MAE封神的何恺明这一次把视觉路线一路推进了AGI考场。这也是在挑战整个行业的默认路线。过去几年大家拼命把模型做大、把推理拉长智能的进步几乎都押在模型本身。VISTA让同一个Claude从40分打到满分靠的却是模型外面的一双眼睛和一本相册。ARC Prize联合创始人Mike Knoop也判断越来越多的「学习」会发生在模型权重之外。通往AGI的下一程比的是谁能让模型看清世界、记住世界。原文链接Claude满分、GPT 99分何恺明团队把AGI考试打穿了-36氪我的专辑《人工智能生命体 新启点》CSDN平台https://blog.csdn.net/2501_91883294/article/details/147616608?sharetypeblogdetailshareId147616608sharereferAPPsharesource2501_91883294sharefromlink

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号