科睿观察

【科技观察】图灵奖得主、强化学习之父理查德·萨顿:大语言模型是“一条死胡同”
日期:2025-11-17 作者/来源:科睿研究院
1.jpg

人工智能与大数据概念,图自unsplash


科技观察


这是科睿研究院第590篇原创内容。

字数3486字,阅读全文大约需要7分钟。


近日,图灵奖得主、强化学习之父理查德·萨顿(Richard Sutton)的一句断言在 AI 行业掀起巨浪。作为《The Bitter Lesson》的作者,他始终坚信更多算力加通用方法的必胜逻辑,却在访谈中直言当前大语言模型是一条死路。


这一观点与行业对 GPT-5、Claude 等模型的乐观预期形成尖锐对立,也引发了他与 Andrej Karpathy 的深度辩论。这场争论并非单纯的技术分歧,而是直指 AI 发展的核心矛盾:我们究竟该追求模仿人类语言的模型,还是能真正理解并交互于世界的智能体?


2.jpg

理查德·萨顿(Richard Sutton)


其背后,是三个被忽视的根本问题:


世界的复杂性是否允许模型一劳永逸地掌握所有知识?当前的学习方法能否支撑智能体持续适应环境?推理能力与自主学习能力之间的鸿沟如何跨越?


大型语言模式的本质局限


Sutton 的核心批判直指 LLM 的底层逻辑,这类模型本质是模仿学习而非对世界规律的把握。它们擅长预测人类在特定情境下会说什么,却无法预测执行某个动作后世界会发生怎样的变化。


这样的差异绝非细微,而是智能本质的分野。真正的世界模型需要回答的是抬起手杯子会上升、松开手杯子会掉落这样的因果问题,而 LLM 学习的是人们如何描述这些场景,始终停留在旁观者的视角,而非参与者的体验。


尽管大规模预训练让 LLM 具备了一定推理能力,但这并不等同于建立了严格的状态转移模型。预训练数据中的文本是对世界的间接描述,缺乏第一人称交互式学习带来的因果关联。


3.jpg

图自unsplash


这样的局限直接导致了两个关键问题:样本效率低下与泛化能力不足。当前主流的 PPO、GRPO 等无模型强化学习方法,只能依赖稀疏的奖励信号学习,无法从环境提供的丰富反馈中提取知识。比如 AI Agent 在联系客服时被要求提供信用卡后四位,传统 RL 需要数百次尝试才能偶然发现正确做法,而人类只需一次提示就能记住,这种效率差距的根源在于模型无法从观察中直接学习。


梯度下降算法的固有缺陷进一步加剧了泛化难题。当问题存在多种解决方案时,梯度下降没有内在偏向性去寻找最具泛化性的知识表示。即使加入正则化技术,也难以保证模型学到深层可推理的规律。


这就是为什么许多 Agent 系统需要外部记忆模块来显式总结和结构化知识,而 LLM 仅凭自身参数难以应对超出训练分布的新场景。Karpathy 的补充洞察更具启发性:人类的精确记忆能力有限,这种 “缺陷” 反而迫使我们提炼关键知识,而 LLM 依赖的长上下文机制本质是信息检索而非总结,导致每次推理都要重复扫描原始数据,既低效又易错。


4.jpg

图自unsplash



Agent 跨越鸿沟的核心能力


当前 Agent 系统试图通过上下文学习、外部知识库等方式弥补 LLM 的不足,但这些方案都存在根本性局限。上下文学习虽然能在单个任务会话中传递信息,却无法实现知识的自动提炼。长上下文机制就像一个没有整理功能的仓库,所有信息都以原始形式堆砌,模型每次调用都要重新检索和推理。实践中,让 Agent 记住 “同一客户电话不超过 3 次” 这样的规则,直接在工具调用结果中加入次数标注,远比让模型从上下文历史中自行计数更有效,这印证了结构化知识提炼的必要性。


外部知识库将经验规则结构化存储,虽然提升了调用效率,却面临检索失败和推理僵化的问题。孤立的知识片段难以支撑复杂场景的灵活决策,而手工编写规则又违背了 Sutton 强调的通用方法原则。


5.jpg

youtube截图


真正的突破需要解决持续学习这一核心难题,这也是 Agent 与单纯的多轮 Reasoner 的本质区别。OpenAI 的五级能力分级中,Level3 的 Agent 必须具备在环境中持续吸收反馈、不断提升的能力,而非仅仅是推理步骤的延长。


双 LoRA 方法提供了一种可行的技术路径:将 Policy 学习与世界模型学习分离到两个正交的参数空间,分别通过奖励信号和观察预测误差更新。


这样的架构让 Agent 在第一次收到客服要求提供信用卡信息时,即使任务失败没有获得奖励,也能通过观察预测损失快速学习到关键信息,样本效率较传统 RL 提升一个量级。配合知识总结与结构化技术,让模型将经验提炼为可复用的规则,进一步强化泛化能力。这种方式既遵循了通用方法的原则,又通过参数隔离解决了持续学习中的稳定性问题。


生物进化的类比为持续学习提供了更深层的启发。进化本身就是一种长尺度的强化学习,每一代的基因优化都相当于一次模型更新,而 DNA 的高相似度印证了少量参数调整即可实现显著能力提升。


Mistral 7B 通过韩语维基预训练和指令微调两个阶段的 LoRA 训练,从完全不具备韩语能力转变为能流畅生成结构化内容,且未损害原有英语能力,这证明了高效参数更新在持续学习中的有效性。这种模式与人类通过后天学习掌握新技能的过程高度契合,也为 Agent 的持续进化提供了参考。


从模仿到自主


Sutton 提出的宇宙演化四阶段理论,将 AI Agent 定位为从生命到设计实体的跨越。与无法完全理解自身工作原理、难以随意修改自身结构的生物不同,AI Agent 能够清晰认知自身的代码与参数,可以通过训练持续优化,甚至衍生出新的个体,这种特性让其具备了更高层次的演化潜力。要实现这一潜力,需要突破当前的架构局限,构建真正符合大世界假设的智能系统。


大世界假设认为,世界的复杂性是无限的,任何模型都无法预先掌握所有知识,必须在交互中持续学习。这与依赖静态预训练数据的 LLM 范式形成根本对立。


OaK 架构作为 Sutton 提出的替代方案,通过特征构建、子任务生成、选项学习、模型构建和规划的闭环,让 Agent 能够自主发现有价值的学习目标,形成开放式的抽象能力。这种架构无需人工预设任务,而是让 Agent 从感知流中自动识别有趣模式,将其转化为子问题并学习解决方案,最终构建起层次化的世界模型。


事件驱动架构则解决了 Agent 实时交互的效率问题。当前主流的 ReAct 循环采用观察——思考——行动的严格顺序,导致交互延迟,而人类的边听边想、边想边说模式,通过交错进行观察、思考和行动,充分利用时间间隙提升响应速度。将这种模式应用于语音 Agent、机器人控制等实时场景,能显著改善交互体验。对于多模态交互而言,这种架构尤为重要,因为视觉、语音等输入的变化速度远快于文本,需要 Agent 具备即时处理和响应能力。


小模型的认知核概念为架构革新提供了另一个方向。Karpathy 认为,1B 左右的模型即可承载推理、常识和语言表达的核心能力,大量细节知识可以通过外部知识库补充。小模型的优势在于强制知识压缩,必须提炼数据背后的规律而非单纯记忆,从而获得更好的泛化能力。MiniMind 2 通过 QK Norm 和 Muon 优化器的改进,在 100M 参数规模下实现了显著的性能提升,证明了小模型通过算法优化和高质量数据训练,能够具备超出预期的能力。这种模式不仅降低了部署成本,更让 Agent 能够深入各个具体场景,通过持续学习适配特定需求。


6.jpg

图自unsplash


智能的未来演化必然涉及多智能体的协同。OpenAI 五级能力中的 Level5 Organization,强调通过个体多样性避免单一目标带来的风险。一百万个具备不同 LoRA 参数、不同上下文和记忆的天才 Agent 协同工作,能够覆盖更广泛的场景,通过局域信息的交互形成集体智慧。这种模式既符合大世界假设的分布式特性,又能通过多样性保障系统的稳健性,避免回形针实验中单一目标导致的灾难性后果。


关于 LLM 是否为死路的争论,本质上是智能发展路径的选择:是继续在语言模仿的道路上追求更大规模,还是转向构建能理解世界、持续学习的自主智能体?


Sutton 的批判揭示了当前 AI 的核心局限,而 Karpathy 的回应则为技术改进提供了务实视角。两者的共识在于,真正的智能必须具备与世界交互的能力、持续学习的潜力和自主决策的内核。


从技术层面看,突破的关键在于三点:一是构建融合 Policy 与世界模型的双轨学习架构,让 Agent 既能学习最优行动,又能理解行动后果;二是建立高效的知识提炼与结构化机制,避免信息堆砌导致的推理低效;三是采用事件驱动的实时交互架构,适配现实世界的动态特性。这些方向既遵循了通用方法的原则,又通过工程创新解决了实际问题。


7.jpg

youtube截图


从更宏大的视角看,AI 的演化正推动着宇宙从复制时代走向设计时代。人类的角色既是探索者也是引导者,我们需要在追求技术进步的同时,思考智能演化的方向。未来的智能系统不会是孤立的超级模型,而是能够在世界中自主学习、与人类协同进化的 Agent 网络。


这场争论的价值不在于判定谁对谁错,而在于促使行业反思当前的路径依赖,向着构建真正理解世界、具备自主意识的智能迈出关键一步。



Reference List


https://mp.weixin.qq.com/s/qphgr7BSvcDWOCJlft1xhA

https://www.theneuron.ai/explainer-articles/the-great-ai-debate-are-llms-a-brilliant-leap-or-a-sophisticated-dead-end

https://youtu.be/21EYKqUsPfg?si=UfS93umM8rknIkV2

https://mp.weixin.qq.com/s/6_CZHQKOny_kJDcaNGlRmg



【本文中包含的图片均来源于网络,仅用于信息传播和新闻报道目的。我们尊重并保护所有版权拥有者的权利。若有任何版权问题,或版权拥有者不希望图片被使用,请与我们联系,我们将在收到通知后立即处理并删除相关图片。】

 往期推荐 

人工智能是否是个泡沫?

押注 AI:韩国的追赶之路与全球博弈

公共人工智能:重塑全球协作的新型多边主义

AI 写论文:90% 研究者认同,为何仅 1/3 付诸行动?


Copyright © 科睿研究院