DC娱乐网

强化学习之父萨顿:现在AI弱小且不可靠

撰文| 涂彦平编辑|张 南设计|荆 芥现在的AI到底是什么水平?这个问题抛给不同的人,可能会得到截然不同的答案。萨顿

撰文| 涂彦平

编辑| 张   南

设计| 荆   芥

现在的AI到底是什么水平?这个问题抛给不同的人,可能会得到截然不同的答案。

萨顿的答案来了。

7月17日,在2026世界人工智能大会暨人工智能全球治理高级别会议主论坛上,2024年图灵奖得主、强化学习之父、阿尔伯塔大学计算机科学教授、Openmind研究院首席科学家理查德·萨顿(Richard Sutton)发表《迈入经验时代》的主题演讲。

他认为:当前AI的快速进步被夸大,其本质仍是模式识别与计算能力,而非真正的智能。他区分了“智能”与“计算”,指出现有大语言模型依赖人类数据,缺乏自主发现知识、区分真假和目标导向的能力,因此“弱小且不可靠”。

萨顿回顾了智能的多种定义,并提出自己的定义:通过行为的适应来实现目标的能力。他强调应建立一门涵盖人类、动物和机器的综合性心智科学,而强化学习是其开端。

他断言,当前“人类数据时代”已近极限——高质量数据源被耗尽,静态数据集无法产生新知识。未来将迈入“经验时代”,AI需从智能体自身与世界的实时交互中获取第一视角数据,以此定义目标并持续学习。他援引婴幼儿玩耍、运动员决策、动物捕猎等例子,说明经验驱动的学习方式才是智能的本质。

最后,萨顿总结道:AI正转向经验学习,这将使其更强大,但真正的自主智能尚未到来;当前AI虽催生诸多产业,但人类仍主导变革。他乐观地“欢迎大家来到经验时代”。

以下是他的演讲实录,《轩辕科技评论》编辑整理。

非常感谢!欢迎女士们、先生们!我非常高兴今天能来发言,同时分享一下我对人工智能未来的想法。讲到未来——现在我们应该怎么样,今后应该怎么走,应该走向什么样的方向?首先我想先说两句。在前面关于治理的开幕式之后,我觉得我非常支持合作的观点、共赢的观点和建立合作伙伴关系的观点。

今天我主要和大家谈一下我们怎么思考人工智能。特别是每个人都觉得人工智能现在在发生快速的变化,并且有很快的进步,每个人都觉得是一样的。但是,如果真的是这样,你也要思考一下是不是夸大或者夸张。可以看到,人工智能背后的推动力可能也是夸大了它的进步或者重要性。有的人会害怕AI,他们也有原因和理由夸大重要性,特别是它的进步到底有多快——它到底真的在快速进步吗?有一些方面、一些事情确实如此。比如说,可以看到现在有很多的突破,我觉得应该是科学上的突破。这些科学上的突破体现在我们有机器可以非常熟练地使用语言,同时可以生成视频、图片。这些东西也催生了很多新行业和产业,给我们带来了很多经济上的应用,带来真正的经济价值,这些非常重要。但是感觉好像这些还是比较大规模的运用,还是模式识别。我们可以把智能和计算区分开来,不能混淆。这里大多数是计算的能力,所以我们要特别关注这一点,必须要把这两者的定义区分开。

01

智能的多种定义

讲到AI的科学,就是智能的科学,它真的在快速进步吗?我觉得并不是如此。

我们现在对真正体系系统的理解是很少的。所有AI模型,其实主要是在使用人类知识的力量,并且把它再交付给我们。它们并没有能力发现自己的知识。从很多方面它们是比较弱的,在整个思考过程中还是存在一些问题,并不是如此强大。

这给我们带来一个问题:什么是智能?我并不指望在这里告诉大家什么是智能,但是会给大家一些观点,引发大家的思考,同时思考一下你同意哪一种观点和定义。

刚刚开始讲智能的时候,要问智能是什么意思。就要提到威廉·詹姆斯(William James),他是心理学的奠基之父。他对于智能的定义可能并不一定说的是智能,而是所谓的心智。他说,所谓心智最大的标准是要达成一定的目标,但是使用多种不同的手段。就我听来,这是一个目标——要有相同的结果,但是用不同的手段实现。我们要通过心智,通过智能,实现一个目标。

或者可以使用其他的含义或者定义,就是要像人一样行为,通常是通过图灵测试进行表达。但是图灵从来没有用过“图灵测试”的提法,他讲的是“模仿游戏”。所以可能大家普遍有一种误解,认为图灵认为像人一样的形式是人工智能的测试,其实他并不这么觉得。

不过,我们可以看到现在已经普遍接受了。现在有大语言模型在进行训练的时候,要让它们像人一样进行行为,这也是其中的一个含义。我们有时候也会使用,但是这个和威廉的定义不太一样了。

如果我们查字典,一般的字典可以看到它的定义是获得和使用或者运用知识与技能的能力。它是指获得或者是运用知识与技能的能力。

我们如果再回到人工智能之父,他说智能是通过计算来达成目标的能力。这里又提到了目标,又提到了计算。但我们讲的是人工智能,所以甚至就算是自然的智能也是需要计算的。

这些是各种各样不同的智能定义。

我自己也有对智能的定义:通过行为的适应来实现目标的能力,不断进行适应和调整。除此之外,我个人的观点是,我们应该要设立关于心智的科学,不仅仅是自然的心智或者技术的应用,而是所有综合性的心智科学。

它可以用于人类、动物、机器,所有的这些心智都有共同的特征,都有共同的特点,同时也都是为了要实现目标,随着时间的推移采取行动。但未来可能更多的心智是机器的心智。

现在没有哪一门现有的科学把这些全部包含进去,无论是心理学、人工智能、认知科学,都没有办法做到这一点,所以我们没有办法把所有的机器都包含进去。我个人比较感兴趣的强化学习,正是综合性心智科学的开始。

02

经验时代的到来

我今天讲的主题是:我们现在还处于人类数据的时代,所有的这些AI,它们都是训练来预测人们的语言的下一个词、人们的标签,并且也是由人类专家进行微调的。大部分的机器学习是要进行知识的转移,从人转到机器身上。这种方法现在已经达到极限了,很多高质量的数据源被用完了,生成新的知识是这个范式没有办法实现、没有办法做到的。

我们现在在迈入所谓的经验时代,AI需要新的数据来源,它能不断增长、不断改善。随着智能体越来越强,它不是静态的数据集,因为静态的数据集是不够的。我们要得到这个数据源,它来自智能体自己的经验,以及它和世界的互动。我说的是,它的经验是第一视角的。

我觉得这些数据的信号不断来来回回进行传递,非常快速,是在智能体和它创造的环境——也就是世界——当中来传达的。这些信号——奖励、行为、观察——来定义它的目标到底是什么。所以,这是人和动物学习的方式。

心理学研究已经告诉我们了,像AlphaGo是通过这样的方式来下棋。最近的AlphaProof系统也在国际奥数比赛当中得到了比较好的成绩。

接下来给大家看一个视频,也看一下这是一个怎样的过程。这是婴幼儿在玩自己的玩具。大家可以注意一下他的数据,他收集到来自世界上的这些数据,其实是完全取决于他的行为。他做些什么,他会从一个玩具到另一个玩具,从每个玩具身上进行学习,玩完一个之后不玩了,玩下一个。他的行为决定了输入,他没有静态的数据集,不是事先构架好的。这些数据在打造的过程中最为适合他的需求,也适合他的认知能力范围和水平,这是最关键的信息。

然后我们可以看一下,无论是动物或者人,在进行各种行为的时候——就像我们现在都坐着,但是我们的身体在采取行动,而且是快速采取行动,对周遭发生的事情做出反应。我们是高带宽的信息处理。信息来了,足球运动员马上就要决定——所有这些数据来了之后,他接下来应该怎么做,什么是比较明智的踢法。还有打棒球的人击球,当球来的时候,我们可以看到就这么短的时间内,他马上要决定怎么挥杆。

还有鸟,还有狮子。就算是人在这里交谈,也是很多的信息处理,也是为了完成一个目标,同时也是基于我们的经验。

03

经验是智能的焦点

讲到经验型的AI,智能体交互这些信号——它的行为、它的感知,这些是它的经验。这可以说是我们的焦点。这是智能的全部,智能就是要打造这样的互动。因此,我们可以看到这是一个焦点或者重点,是所有心智的终点——要采取行动、要采取行为,并且有所感知。

可以认为,一个智能体如果是智能的,它能够预测和控制它的经验、它的感知。如果说它没有经验,那么我觉得根本没有什么智能可言。特别是,我们没有办法去说这种行为方式比另外一种行为方式好。

我们必须要有经验,要有奖励信号告诉我们这个行为得到奖励,但是另外一种行为没有让我得到奖励。

现在的大语言模型没有这种奖励,它没有办法知道这个行为是好的还是不好的。所以,这最终是为什么它们有很大的限制,因为它们没有目标。

观察也是很类似的,这就是所谓的事实准确性。大语言模型基本上没有办法把真的和假的区分开。如果没有经验,你的知识是预测去发生了什么。你没有经验的话,你可以看到之前发生的,但是你没有数据、没有经验作为输入来源,你就没有办法知道你做出的预测到底是对还是不对。但是有了经验的AI,就有奖励、目标,有真实的情况——就是你认为会发生的事情,真实发生了。

04

我们要习惯

这是我们的想法,可能对大家来说是显而易见的。如果我们在研究AI的话,大家可能觉得这是非常自然的。

这句话来自艾伦·图灵(Alan Turing),他是计算机科学奠基之父。这是1947年的时候他说的,那时候甚至没有AI,他看的是自然的智能。他说,我们需要的是一台机器,它可以从经验当中自主学习。

这是非常基本但是又是非常深刻的想法,它没有成为关键的现代AI组成部分。但是我觉得这个想法现在慢慢变得越来越重要,特别是在机器人当中,在一些工业的应用当中。

所以,我也很喜欢这样的说法,是维克多·雨果说的,他说:“恰逢其时的思想,势不可挡。”

我觉得,我们要从经验当中进行学习,这个想法是所谓的恰逢其时。可能这个时代还没有真正到来,但我们在迈入这样的时代。

做一下总结。我觉得AI现在终于转向从经验来进行学习,而不是从人类的数据进行学习。这样它会变得更加强大,因为它可以持续学习新的东西。

虽然现在有很多的炒作,甚至是对AI的恐惧,现在的AI智能还不够强大,我个人认为它是比较弱小而且是不可靠的,因为会产生很多的错觉,它可能告诉我们的东西是错的。但是同时它是非常有用的,它也给我们催生了很多的产业,而且所有人可以使用,每个人都可以使用,所以大家都感到非常激动。

大家都发现,AI现在还不是真正的智能,或者真正的自主智能,还没有达到这一步。但是我们在迈向这样的时代,我们要习惯。所以,现在是第一次和它们接触,还没有来到真正的超级智能时代,或者智能增强人类的时代。但是它会给我们带来巨大的变革,这个变革由人类推动又反作用于人类。

可以看到,如果作为一个从经验当中学习的人(我自己本人就是从经验当中学习的,一生都是如此),我觉得我可以预测到经验时代的到来。

所以,我们要说的是:欢迎大家来到经验时代!非常感谢大家的聆听,谢谢。