恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

强化学习之父 Sutton 批判大模型:被人类知识限制,Oak Lab 欲开辟新路线!

  • 首页
  • 资讯中心
  • /
  • 强化学习之父 Sutton 批判大模型:被人类知识限制,Oak Lab 欲开辟新路线!

相关资讯

AI聊天记录风险分析:基于NLP与意图识别的本地部署工具 2026/8/28 14:32:28
BMS传感与均衡IC设计:电芯一致性管理关键技术 2026/8/28 14:32:28
高精度地图核心技术:从众包更新到动态信息融合的自动驾驶数字底座 2026/8/28 14:32:28

最新资讯

HYBNetworking缓存管理实战:查询缓存大小、手动清除与自动清理策略
5分钟看懂MarkItDown文档转换架构是怎么组织的
不招初级工程师?先看看团队的工程化水平够不够
自托管AI工作区:从连接超时到沙盒化Agent执行环境
推理时回灌深层激活:不重训模型也能降低大模型困惑度
多模态空间感知引擎 × 气体浓度空间化 × 有毒气体扩散预判:让看不见的气体,在三维空间中“显形“

今日推荐

2026学术工具专业测评|Paperxie全维度性能实测报告[特殊字符]
凭什么稳居论文工具顶流[特殊字符]Paperxie综合实力深度全解析
2026论文工具深度测评|为什么Paperxie是目前最稳的学术工具✅

本周热门

Nextcloud 桌面客户端:把同步交给它,你只管改文件
如何将 HTML 转成 Word 文档且格式不丢失?html-to-docx 使用教程
Anki 批量操作卡片完整指南:一次搞定上千张,不再逐张修改

本月精选

如何用DamaiHelper实现演唱会门票的智能自动化抢购:完整技术解决方案指南
第4篇:59 倍性能差距的索引瓶颈定位——一次教科书级的全表扫描调优
终极歌词批量下载神器:5分钟解决离线音乐库歌词同步难题

强化学习之父 Sutton 批判大模型:被人类知识限制,Oak Lab 欲开辟新路线!

发布时间:2026/8/28 14:32:28
强化学习之父 Sutton 批判大模型:被人类知识限制,Oak Lab 欲开辟新路线! 【Sutton 批判大模型路线】说起强化学习之父 Rich SuttonAI 圈几乎没人陌生。他写下的《苦涩的教训》至今仍被很多人视为理解 AI 发展的重要框架即从长期看能够随着计算规模扩展的通用方法往往会战胜依赖大量人工知识设计的方案。然而最近接受红杉资本访谈时Sutton 却把矛头对准了今天最主流的大模型路线。在他看来LLM 虽是一次伟大的科学突破却也可能成为《苦涩的教训》的反面案例。【大模型的局限】原因在于今天的大模型虽摆脱了大量人工规则却重新被“人类已经知道的东西”限制住了。互联网数据有限合成数据背后依然需要人来决定什么值得生成。更关键的是模型不具备人类那样的持续学习能力。一个司机开 10 年车会形成大量直觉但今天的大模型大部分学习集中在预训练和后训练阶段上线后核心权重基本被冻结。在 Sutton 看来今天的大模型行业可能已陷入“局部最优”继续堆 GPU、做 Scaling 性能还能上涨所以头部实验室难转向新路线。【Oak Lab 的出发点】这也是 Sutton 和学生 Khurram Javed 创办 Oak Lab 的出发点。Oak 想重新做一种能从自身经验中持续学习的 AI Agent模型上线后还能更新对世界的理解提炼新规律并调整自己。如果持续学习路线走通被重写的可能是“训练—冻结—上线”的整套基础模型范式不能持续学习是大模型最大的问题。【Sutton 对大模型的矛盾态度】Sutton 对大模型的态度很有意思。他不否认 LLM 的成功认为大型语言模型是“惊人的科学突破”。过去语言被认为是符号主义 AI 最后的堡垒之一神经网络靠规模化训练学会了复杂语言能力这符合《苦涩的教训》的观点即少往机器里手工塞人类规则多寻找随计算规模扩展的学习方法。过去几十年 AI 历史证明人类精心设计的规则短期好用长期却输给更通用、能吃下更多计算的方法AlphaGo、深度学习、大语言模型都是如此。LLM 把互联网“喝”进去增加计算量能力快速上升所以是《苦涩的教训》最成功的案例之一。但大模型同时可能成为反面案例因为它虽摆脱大量人工规则却被互联网这种“人类知识”限制。互联网只是人类已记录的知识现实世界远比其复杂真实世界信息量远超互联网存储的一切。这意味着只靠训练前准备数据会撞墙。而且大模型学习和工作被人为切成两个阶段训练时疯狂学习上线后权重基本冻结它通过 Context 临时获新信息、通过 Memory 记偏好但这和真正的学习还差得远真正的学习是系统经历事情后本身发生变化而现在的大模型更像刚毕业被冻结的大脑工作靠翻毕业笔记。这也是 Sutton 对当前 LLM 最核心的质疑为什么模型形成新概念、修改内部结构的能力只能在训练阶段上线后为什么不能继续改变权重【合成数据的问题】互联网高质量数据有限热门答案是合成数据。理论上算力足够数据可无限生成但 Sutton 评价这是“大错误”甚至可能成下一条“苦涩的教训”。因为合成数据虽摆脱真实数据限制背后仍藏人类瓶颈谁决定生成什么数据、判断问题重要性、定义奖励最后还是人。只要合成数据需人类决定生成内容其扩展速度就受人类知识限制。Sutton 背后的理论是 Big World Hypothesis即大世界假说现实世界太大智能体不可能提前掌握一切如无人机飞行会遇到模拟器里没有的细节这些不可能全写进训练集。所以他认为智能体面对的世界永远比自身复杂唯一可行方法是边走边学这颠覆了 AI 行业过去把模型训练得接近“全知”的假设他想做的 AI 更注重出生后进化。【持续学习的难题】既然持续学习符合直觉为什么 OpenAI、Anthropic 等公司不让模型每天更新权重因为这样模型可能被学废这也是 Continual Learning 研究多年未解决的灾难性遗忘Catastrophic Forgetting问题。比如告诉模型公司内部项目改名它更新权重可能影响其他能力。所以很多模型把新信息塞进 Context、RAG 或 Memory不轻易改底层权重。Cursor 产品做了持续更新但方式是先收集大量用户数据攒成 Batch 再统一训练这对公共模型有用对个人智能体就不合适若只想教自己的 AI 助手新习惯没必要等大量用户数据一起训练且自己希望它学的东西可能和别人无关。所以 Oak 想解决底层算法问题让模型用单条经验更新自己且不破坏旧知识Sutton 给出的方向是 Step - size Optimization即不同知识“可塑性”不同权重有不同学习速度像人的大脑不会因看到特殊情况就推翻旧认知若规律变化大脑能慢慢调整。还有 Continual Backprop 方法传统神经网络训练久了内部结构会固化Sutton 想让训练多年的神经网络有可塑性Oak 认为未来训练基础模型应把这种能力训练进去模型从第一天开始同时学知识和学习知识的方法即 Meta - learning真正的持续学习模型可能需从底层重新训练。【Oak Lab 的终极目标】如果 Oak 只是解决“模型记忆”没那么值得关注。其真正野心大的地方是 Sutton 想把持续学习和自主形成抽象能力连起来。今天 AI 会做数学、下棋但这些任务的“世界规则”人类已提前告诉它现实世界不是围棋智能体在开放环境要知道什么值得预测等。顶尖运动员和科学家会建立概念体系和提出新抽象Sutton 认为当前 AI 最缺失“先学世界模型再规划”的能力。Oak Lab 的终极目标是打造一个从微小感知到宏大计划都能统一组织知识的 AI 系统它要持续训练不失控、修正自己不混乱、吸收新经验且保持长期知识连贯即想要的不是更会回答问题的模型而是能长期自洽并变好的心智。这条路不轻松要跨过一系列未解决问题研究团队要容忍性能不如现有产品。对大公司来说“先退一步、再换范式”的选择不容易但这也许正是 Sutton 想提醒行业的。大语言模型已证明规模化学习的力量会继续是重要技术基础但把语言能力等同于完整智能、训练结束等同于学习完成可能让行业错过关键东西。在 Sutton 的设想里未来不是单一全知全能模型统治所有任务而是有许多因经历不同而成长的“心智”它们在不同环境学习不同知识彼此无法穷尽地替代这更接近真实世界世界大系统学不完智能是遇到新问题能继续长出新理解。而 Oak Lab 要下注的正是这件事。

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号