恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

谷歌WikiSkill论文精读:模型可以换经验留下来,9B反超27B

  • 首页
  • 资讯中心
  • /
  • 谷歌WikiSkill论文精读:模型可以换经验留下来,9B反超27B

相关资讯

开源OpenContext调研:给AI工具一块共享大脑,让项目上下文持久化 2026/9/29 20:04:58
YOLOv11 草莓成熟度检测系统 草莓成熟度检测数据集 2026/9/29 20:04:58
2026年,洪梅镇这座水乡小镇,正在悄悄发生哪些新变化? 2026/9/29 20:04:58

最新资讯

嵌入式Debug四类排查法:从现象到根因的系统化调试指南
Windows 11 部署 WeKnora:搭建私有化 RAG 知识库实战
Spirula Studio路线图前瞻:本地BA、词树索引与多设备统一,3D高斯泼溅训练器还能再快多少?
Awesome-finance-skills的alphaear-signal-tracker:用强化/弱化/证伪方法论追踪投资信号完整指南
串口报文收发全解析:从组帧、CRC校验到状态机与超时处理
Redis原生接入MCP与Skill:AI Agent缓存与记忆层实战

今日推荐

模型优化器实战:从FP32到INT8的推理加速与精度平衡
LangGraph+FastAPI构建可审计AI编码助手
基于图像预处理与几何特征的人脸脸型发型搭配系统实现

本周热门

从像素到笔画:srt-whiteboard-animation骨架笔迹追踪实现(Zhang-Suen细化+8邻接追踪)
网站建设的英语怎么说?别只背单词,看完这套安全完整流程才敢上线
新手入门看这篇:建设网站加盟避坑指南与SEO实操

本月精选

自研推理加速器Redwood:两周内实现PyTorch模型高效部署的实战教程
V4L2摄像头采集实战:从camera_client.rar到出图全流程解析
从“谁发明了钢琴键”到知识问答智能体:RAG与记忆工程实践

谷歌WikiSkill论文精读:模型可以换经验留下来,9B反超27B

发布时间:2026/9/29 20:04:58
谷歌WikiSkill论文精读:模型可以换经验留下来,9B反超27B 谷歌 WikiSkill 论文深读模型可以换经验留下来9B 反超 27B调研日期2026-09-28 · 论文WikiSkillarXiv 2608.27454Google Research 弗吉尼亚理工 2026-08 发布公众号上读到一篇讲「谷歌 WikiSkill」的文章一个 90 亿参数模型带上从任务成败中反复修订的技能在五项基准上平均 47.4%跑赢了没有技能加持的 270 亿参数模型39.4%——**模型权重没变做事的方法变了。**这类把经验沉淀成 Agent 技能的论文这几年很热但 WikiSkill 的价值在于它真正把经验做成了可独立、持续更新的知识层。我把论文全文核对了一遍这篇是完整解读。一、核心结论经验果然「存得下来、能反超、还能继承」论文来自 Google Research 与弗吉尼亚理工大学2026-08-27 发布arXiv 2608.27454标题即《WikiSkill: Compiling Agent Experience into Persistent…》。一句话先针对不同任务离线演化技能再让 Agent 带着这些方法接受测试。观测数据9B 带技能 vs 27B 无技能47.4% vs 39.4%5 基准平均9B 无技能自身对照未达标基线27B 也带技能63.3%更强模型同样受益Qwen 系列增益4B 12.3、9B 17.5、27B 23.9 个百分点电子表格最突出27B 从 40.8% →81.7%约两倍研究覆盖数学推理、网页搜索、电子表格、长文档问答、文本家务模拟五类技能按每项基准分别演化训练/验证/测试互不重叠每种配置从空技能集跑三次取平均。二、经验三层结构Raw → Wiki → Skills论文把积累经验落成了三层明确存储层级存什么谁用Raw不可改写的执行轨迹供回溯演化环节查证Wiki错误模式、有效策略、修改历史持续整理提议者分析、维护Skills当前采用的完整工作方法SKILL.md 脚本 参考执行 Agent三个 Agent 分工执行者按当前技能做任务维护者对照成功/失败轨迹检查具体操作与错误原因提议者查阅 Wiki 原始记录基于标准答案与成败摘要提出修改。默认配置里执行 Agent 用 SkillsWiki 供演化分析。三、技能会退、教训不退的迭代机制论文最有意思的一段是在 ALFWorld 文本家务模拟里Qwen 反复取物、检查、移动一直不推进。第 0 轮提了个宽泛的目标导向行动技能验证没提高即被拒第 1 轮参考失败记录改成更具体的防循环规则“不要把物品放回原来的位置”通过验证第 4 轮再补充同一物品同一操作只执行一次。规则管理很清晰每轮只对单个技能做新增或局部修改放独立验证集评估分数必须严格超过历史最佳才接受打平或下降就回退。但 Wiki 不随技能回滚——修改内容、验证分数、接受/拒绝结果都保留为下一轮留下线索。这解释了为什么网页搜索任务里 28% 的获准修改出现在第 5–7 轮前期积累仍能催生有效新方法。四、经验真能跨模型传吗既能也会传错论文做了直接交换实验双向都有结论任务·执行模型自身技能换用其它模型技能ALFWorld · Qwen-9B63.4%用 27B 技能70.2%数学 · Gemma-31B56.7%用 4B 技能73.1%表格 · Gemini-Flash无技能 50.5%用 4B 技能18.1%明显倒退长文档问答里更典型4B 用自己演化的技能从 30.2% - 28.5%同一套技能交给 27B 却从 42.1% 升到 52.9%。发现有用方法和把方法执行到位是两种能力。但表格任务的负迁移也提醒4B 为了避免错误发展出的单行 Python、字符串转换等具体补丁反而限制了 Gemini 用完整脚本——经验含可复用方法和为某模型量身定做的补丁换执行者必须重新验证。五、局限性论文自己的坦诚验证集每项只有 10–40 题距离真实工作长期稳定进化还有距离实验把当前技能全文直接放进 prompt没检验技能库扩大后的检索与触发只接受立即提分的修改可能放弃有助于后续改进的铺垫Wiki 无自动修剪机制长期运行怎么处置冗余/过期知识未知成本不低每轮仅维护 Wiki 提修改就约 11–21 次模型调用数小时、数百次环境操作的超长任务尚未覆盖关联与启发WikiSkill 的Raw→Wiki→Skill三层结构和我一直在做的人持久化知识库思路高度同构都主张先把经验编译成独立、持续更新的知识再沉淀为可复用技能。Karpathy 的 LLM Wiki 思路保留已整理知识让后续工作接着前面积累往下做在这篇论文里有了更工程化的落地。一句话结论WikiSkillarXiv 2608.27454Google 弗吉尼亚理工用「原始轨迹 → 经验 Wiki → 执行技能」三层结构 三 Agent 分工 严格验证/回退把 Agent 经验首次做成可查证、可继承、可跨模型复用的知识资产9B 反超 27B 实证了经验本身也是竞争力但离生产级还有检索、修剪、长任务、成本四道坎——方向正确价值在经验货币化这个命题。局限依据是论文 多篇知乎/技术博客交叉未复现实验无 GPU 环境跑 9B/27B未做本机 demo论文为研究性工作无可直接运行的可复现工程包具体单任务数据来自论文表非本机实测下一篇预告我把 WikiSkill 的「Raw→Wiki→Skill」理念映射到日常 Agent 工作流写一份普通人也能用上的「Agent 经验沉淀」落地模板。

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号