专栏文章

2024 图灵奖:强化学习如何重塑 AI 未来
日期:2025-03-06 作者/来源:

2024年3月,美国计算机学会(ACM)宣布,安德鲁·巴托(Andrew Barto)和理查德·萨顿(Richard Sutton)因在强化学习(Reinforcement Learning, RL)领域的开创性贡献,共同获得被誉为“计算机界诺贝尔奖”的图灵奖。两人将分享100万美元的奖金,这一荣誉不仅是对他们学术生涯的至高认可,也标志着强化学习技术已成为驱动人工智能(AI)革命的核心引擎。


巴托和萨顿自20世纪80年代起便奠定了强化学习的理论基础,开发了时序差分学习(Temporal Difference Learning)等关键算法,推动了智能体在未知环境中的自主学习能力。他们的研究成果不仅为AlphaGo、ChatGPT等突破性技术提供了理论支持,还在机器人运动技能学习、网络拥塞控制、芯片设计等多个领域取得了广泛应用。


此次图灵奖的颁发,不仅是对两位科学家数十年如一日的学术探索的肯定,也凸显了强化学习在人工智能发展中的核心地位。


1.jpg


安德鲁・巴托:探索 “神经元享乐主义”


安德鲁·巴托(Andrew Barto)是马萨诸塞大学阿默斯特分校信息与计算机科学系的荣誉退休教授。早在20世纪70年代,他就踏上了探索“神经元享乐主义”理论的征程,提出大脑通过奖励机制学习,并成功将其数学化。


巴托教授的学术背景十分扎实,他在密歇根大学获得数学学士学位,并在该校完成了计算机与通信科学的硕士和博士学位。1977年,他加入马萨诸塞大学阿默斯特分校,先后担任副教授、教授,并曾担任信息与计算机科学系主任。


他的学术成就得到了广泛认可,荣获了多项荣誉,包括马萨诸塞大学神经科学终身成就奖、IJCAI卓越研究奖和IEEE神经网络学会先驱奖。此外,他还是电气和电子工程师协会(IEEE)会士和美国科学促进会(AAAS)会士。


理查德・萨顿:传承与创新


理查德·萨顿(Richard Sutton)是阿尔伯塔大学的教授,也是强化学习领域的奠基人之一。1978年,他作为安德鲁·巴托的博士生加入研究团队,与导师共同奠定了强化学习的理论基石。萨顿教授拥有斯坦福大学心理学学士学位和马萨诸塞大学计算机科学博士学位。目前,他不仅在阿尔伯塔大学担任教授,还领导着人工智能初创公司Keen Technologies。此外,他也是加拿大人工智能协会终身成就奖获得者、英国皇家学会会员以及DeepMind的前研究科学家。


回顾20世纪80年代,强化学习因缺乏算力和应用场景而备受质疑。然而,巴托和萨顿始终坚守初心,数十年如一日地致力于该领域的研究。巴托曾坦言:“当时申请经费都很困难,但我们不愿意随波逐流。” 他们合作编写的教科书《强化学习:导论》(1998年出版)至今已被引用超过7.5万次,成为该领域的经典之作,被誉为“强化学习的圣经”。


什么是强化学习?


强化学习的核心在于让智能体(Agent)通过与环境的交互,从“奖励”与“惩罚”信号中学习最优行为策略。这一概念的灵感来源于心理学和神经科学,尤其是动物通过试错学习的行为模式。早在20世纪50年代,艾伦·图灵就提出机器可以通过类似的机制学习,但由于当时计算能力的限制,相关研究长期停滞不前。直到20世纪80年代,巴托和萨顿奠定了强化学习的数学基础,这一领域才真正进入实践阶段,图灵的预言也得以实现。


简而言之,强化学习的核心逻辑是让AI像生物一样,通过“试错+奖励”自主学习。以动物驯化为例,驯兽师通过奖励来训练动物,而AI则通过“数字版快乐(奖励)”和“痛苦(惩罚)”来优化行为。其数学基础建立在马尔可夫决策过程(MDP)之上,AI通过最大化长期累积奖励来适应未知环境。巴托和萨顿开发的时间差分学习和策略梯度方法,已成为强化学习的核心工具。


2.jpg

图片由ai生成


自2010年后,随着深度学习技术的成熟——这一进程由2018年图灵奖得主杰弗里·辛顿(Geoffrey Hinton)等人大力推动——强化学习与神经网络的结合催生了深度强化学习(Deep RL)。深度强化学习的出现,为人工智能领域带来了突破性的进展。2016年,基于深度强化学习开发的AlphaGo击败了围棋世界冠军李世石,并通过自我对弈实现了超越人类水平的决策能力。而AlphaGo的核心开发者大卫·席尔瓦(David Silver),正是强化学习奠基人理查德·萨顿的学生。


深度强化学习的应用不仅局限于游戏领域。OpenAI利用人类反馈强化学习(RLHF)技术,让ChatGPT通过人工评价学习“如何更像人类”,从而显著提升了其语言生成能力。在机器人控制领域,通过模拟训练,机器人学会了操作魔方、行走等复杂技能,展现了强化学习在物理世界中的巨大潜力。谷歌则利用强化学习优化芯片布局,其效率远超人类工程师,为半导体行业带来了新的突破。此外,强化学习还在医疗领域助力药物研发,在物流领域优化全球供应链,其影响力正逐步渗透到各行各业。


未来展望:AI 会是人类的威胁吗?


面对公众对人工智能(AI)的担忧,两位科学家安德鲁·巴托和理查德·萨顿持谨慎乐观的态度。萨顿指出:“通用人工智能(AGI)为我们提供了一个引入全新‘思维’的机会,无需依赖漫长的生物进化。”巴托则表示:“只要足够谨慎,AI将极大地改善社会和生活。”目前,强化学习(RL)的潜力才刚刚被释放,而其与深度学习的结合——深度强化学习——正在推动AI向更高维度进化。萨顿参与的初创公司Keen Technologies,目标直指“通用人工智能”(AGI)。


巴托和萨顿用半生的坚守,将曾经冷门的强化学习理论变成了人工智能的基石。他们的故事证明:真正的创新往往始于无人问津之处。正如谷歌的杰夫·迪恩所言:“强化学习回应了图灵的挑战,是过去几十年AI进步的核心。”未来,强化学习或许能让机器像人类一样,在现实世界中“跌跌撞撞却不断成长”——而这,正是智能的本质。


正如萨顿所言:“这是星球的关键时刻。我们正在创造一种全新的智慧。”



 往期推荐 

塑料瓶与铝罐的博弈:可口可乐的环保困局与商业抉择

2024年诺贝尔奖的最大赢家:人工智能

2024年诺贝尔经济学奖出炉,三位学者解释了「为什么有些国家富裕,而有些国家贫穷」

诺贝尔奖发了一百多年,钱怎么还没发完?




Copyright © 科睿研究院