安德鲁・巴托:探索 “神经元享乐主义”
安德鲁·巴托(Andrew Barto)是马萨诸塞大学阿默斯特分校信息与计算机科学系的荣誉退休教授。早在20世纪70年代,他就踏上了探索“神经元享乐主义”理论的征程,提出大脑通过奖励机制学习,并成功将其数学化。
巴托教授的学术背景十分扎实,他在密歇根大学获得数学学士学位,并在该校完成了计算机与通信科学的硕士和博士学位。1977年,他加入马萨诸塞大学阿默斯特分校,先后担任副教授、教授,并曾担任信息与计算机科学系主任。
他的学术成就得到了广泛认可,荣获了多项荣誉,包括马萨诸塞大学神经科学终身成就奖、IJCAI卓越研究奖和IEEE神经网络学会先驱奖。此外,他还是电气和电子工程师协会(IEEE)会士和美国科学促进会(AAAS)会士。
理查德・萨顿:传承与创新
理查德·萨顿(Richard Sutton)是阿尔伯塔大学的教授,也是强化学习领域的奠基人之一。1978年,他作为安德鲁·巴托的博士生加入研究团队,与导师共同奠定了强化学习的理论基石。萨顿教授拥有斯坦福大学心理学学士学位和马萨诸塞大学计算机科学博士学位。目前,他不仅在阿尔伯塔大学担任教授,还领导着人工智能初创公司Keen Technologies。此外,他也是加拿大人工智能协会终身成就奖获得者、英国皇家学会会员以及DeepMind的前研究科学家。
回顾20世纪80年代,强化学习因缺乏算力和应用场景而备受质疑。然而,巴托和萨顿始终坚守初心,数十年如一日地致力于该领域的研究。巴托曾坦言:“当时申请经费都很困难,但我们不愿意随波逐流。” 他们合作编写的教科书《强化学习:导论》(1998年出版)至今已被引用超过7.5万次,成为该领域的经典之作,被誉为“强化学习的圣经”。
什么是强化学习?
强化学习的核心在于让智能体(Agent)通过与环境的交互,从“奖励”与“惩罚”信号中学习最优行为策略。这一概念的灵感来源于心理学和神经科学,尤其是动物通过试错学习的行为模式。早在20世纪50年代,艾伦·图灵就提出机器可以通过类似的机制学习,但由于当时计算能力的限制,相关研究长期停滞不前。直到20世纪80年代,巴托和萨顿奠定了强化学习的数学基础,这一领域才真正进入实践阶段,图灵的预言也得以实现。
简而言之,强化学习的核心逻辑是让AI像生物一样,通过“试错+奖励”自主学习。以动物驯化为例,驯兽师通过奖励来训练动物,而AI则通过“数字版快乐(奖励)”和“痛苦(惩罚)”来优化行为。其数学基础建立在马尔可夫决策过程(MDP)之上,AI通过最大化长期累积奖励来适应未知环境。巴托和萨顿开发的时间差分学习和策略梯度方法,已成为强化学习的核心工具。