理性智能体是做正确事情的事物。显然,做正确的事情比做错误的事情要好,但是做正确的事情意味着什么呢?
道德哲学发展了几种不同“正确事情”的概念,但人工智能通常坚持一种称为结果主义的概念:我们通过结果来评估智能体的行为。当智能体进入环境时,它会根据接受的感知产生一个动作序列。这一动作序列会导致环境经历一系列的状态。如果序列是理想的,则智能体表现良好。这种可取性的概念由性能度量描述,该度量评估任何给定环境状态的序列。
人类有自己的欲望和偏好,因此,人类有适用于自身的理性概念。这一概念与成功地选择产生环境状态序列的行动有关,这些环境状态序列从人类的角度来看是可取的。但是,机器没有自己的欲望和偏好,至少在最初,性能度量是在机器设计者的头脑中或者在机器受众的头脑中。我们将看到,一些智能体设计具有性能度量的显示表示,而在其他设计中,性能度量完全是隐式的,智能体可能会做正确的事情,但它不知道为什么。
回顾诺伯特·维纳的警告,以确保“施以机器的目的是我们真正想要的目的”,注意,正确地指定性能度量可能非常困难。例如,考虑2.1节中的真空吸尘器智能体,我们可能会建议用8小时班次中清理的灰尘量来度量性能。当然,有了理性智能体,你所要求的就是你所得到的。然而一个理性的智能体可以通过清理灰尘,然后将其全部倾倒在地板上,然后再次清理,如此反复,从而最大化这一性能度量。更合适的性能度量是奖励拥有干净地板的智能体。例如,在每个时间步中,每个干净的方格都可以获得1分(可能会对耗电和产生的噪音进行惩罚)。作为一般规则,更好的做法是根据一个人在环境中真正想要实现的目标,而不是根据一个人认为智能体应该如何表现来设计性能度量。
在任何时候,理性取决于以下4方面:
- 定义成功标准的性能度量;
- 智能体对环境的先验知识;
- 智能体可以执行的动作;
- 智能体到目前为止的感知序列;
这引出了理性智能体的定义:
对每个可能的感知序列,给定感知序列提供的证据和智能体所拥有的任何先验知识,理性智能体应该选择一个期望最大化其性能度量的动作。
我们需要仔细区分理性和全知。全知的智能体能预知其行动的实际结果,并能据此采取行动,但在现实中,全知是不可能的。
理性并不等同于完美,理性使期望性能最大化,而完美使实际性能最大化。不要求完美不仅仅是对智能体公平的问题。关键是,如果我们期望一个智能体做事后证明是最好的行动,就不可能设计一个符合规范的智能体,除非我们改进占卜水晶球或时间机器的性能。
因此,我们对理性的定义并不需要全知,因为理性决策只取决于迄今为止的感知序列。我们还必须确保我们没有无意中允许智能体进行低智的行动。例如,如果一个智能体在穿过繁忙的道路之前没有向两边看,那么它的感知序列将不会告诉它有一辆大卡车正在以高速接近。我们对理性的定义是不是说现在就可以过马路了?绝非如此!
首先,考虑到这种缺乏信息的感知序列,过马路是不理性的: 不观察路况就过马路发生事故的风险太大。其次,理性智能体在上街之前应该选择“观察”动作,因为观察有助于最大化期望性能。采取行动来改变未来的感知,有时被称为信息收集,这是理性的一个重要组成部分。信息收集的另一个例子是真空吸尘器在最初未知的环境中必须进行的探索.
我们的定义要求理性智能体不仅要收集信息,还要尽可能多地从它所感知到的东西中学习。智能体的初始配置可以反映对环境的一些先验知识,但随着智能体获得经验,这可能会被修改和增强。在一些极端情况下,环境完全是先验已知的和完全可预测的。在这种情况下,智能体不需要感知或学习,只需正确的运行。
如果在某种程度上,智能体依赖于其设计者的先验知识,而不是其自身的感知和学习过程,我们就说该智能体缺乏自主性。一个理性的智能体应该是自主的,它应该学习如何弥补部分或不正确的先验知识。实际上,我们很少从一开始就要求智能体完全自主:除非设计者提供一些帮助,否则当智能体几乎没有经验或完全没经验时,它将不得不随机行动。
[1]
-
从明天起做一个快乐的agent工程师! ↩