狂欢背后:AI曲折发展史
这篇书评可能有关键情节透露
早期探索阶段
本质问题:
数学问题是否都能简化为寻找对应算法解决的问题?这个问题是图灵在1935年给自己立下的艰巨挑战。
图灵机:
- "图灵机"这种虚拟的计算机器实际上是一种理想中的计算模型,它的基本思想是用机械操作来模拟人们用纸笔进行数学运算的过程。通俗地讲,图灵把"计算"这一件日常的行为抽象概括出来,看作是下列两种简单动作的不断重复:
- 在纸上写上或擦除某个符号。
- 把注意力从纸的一个位置移动到另一个位置。
- 图灵机思想的价值所在是因为它虽然结构简单,但却可以描述任何人类能够完成的逻辑推理和计算过程。换句话说,图灵机的计算能力是人类能够完成的所有计算的全集。只要一个问题是可判定的,它的计算过程可以被符号和算法所表达出来,它就可以使用图灵机来完成计算。
- "计算"能力是被视为与"思考"相类似的人类抽象能力。大家一时间很难接受"计算"可以被如此简单的模型所概括。
- 图灵机的价值被人们发现后,迅速成为计算机解决"如何计算"问题的基础,在计算理论上也成为了可计算性的对标物。当一个新的计算模型出现时,人们会判定它是否能解决所有在算法上可计算的问题。如果是,它就被称为是图灵等价或者图灵完备的。今天,我们称某种程序设计语言是图灵完备的,意思也是所有可计算的算法都能够用这种语言来实现(如今天常见的C、C++、Java、JavaScript等都是图灵完备的,而HTML/CSS这些语言则不是图灵完备的)。
- 图灵构想了这样一台机器,可以用来判定任意图灵机的运行结果。他考虑了以下问题:给定一台图灵机和相关输入集,它是否会停止?如果存在判定这个问题的机器,会引起悖论。所以图灵得出结论:存在某些判定问题不能简单地按照确定的步骤来解决。
- 尽管称其为“机器”,但在那时它只是一个抽象的数学概念。是方法的具体描述,比如检查质数的步骤。作用是严格执行既定步骤的运算。
- 他解决了希尔伯特的难题:数学并不能被简化为遵循方法解决问题。
图灵测试:
灵感来源于维多利亚时代的“模仿游戏”,是科学界中标准技术的优秀例子。
测试通常是这样描述的:
- 人类询问者通过键盘与屏幕彼端的“生物”进行交互聊天。
- 询问者事先并不知道对方是人还是计算机程序。
- 交互纯粹以文本的形式进行:询问者键入一个问题,然后对方给予一个回应。
- 询问者的任务是确定对方是人还是计算机程序。
- 现在,假设被询问的确实是计算机程序,但是经过一段合理的时间,询问者无法准确判断他是在与人还是计算机交互。
- 图灵认为,如果询问者无法分辨出程序和真人,就得承认这样的计算机程序拥有类似人类的智能。
- 超越图灵测试:图灵测试所提出的目标,其实已经超过了人类自身的需要。好比人类要不断制造更好的飞机的目的肯定是为了更快、更舒适地旅行,而不是为了让它飞得更像鸽子以至于能欺骗其他鸟类。
机器能思考吗?
- 来自数学的观点,机器拥有智能的反对意见主要来自于哥德尔不完备定理,该定理证明了一个反科学直觉的结论:“如果一个形式系统是不含矛盾的,那就不可能在该系统内部证明系统的不矛盾性。”
- 哥德尔不完备定理对机械智能的限制是:它决定了无论人类造出多么精致、复杂的机器,只要它还是机器,就将对应一个形式系统,就能找到一个在该系统内不可证的公式而使之受到哥德尔不完备定理的打击,机器不能把这个公式作为定理推导出来,但是人心却能看出公式是真的。
- 因此这台机器不可能是承载思维的一个恰当模型。也就是说,如果可以通过图灵测试的智能是基于某种能够承载该形式系统的运算器(譬如基于图灵机)来实现的话,那在进行图灵测试时,就一定能找到一个问题,是这个机器必定回答不了的,这就成悖论了。
- 图灵对这个问题的看法是:尽管哥德尔不完备定理可以证明任何一台特定机器的能力都是有极限的,但是并没有证据说明人类智能就没有这种局限性。这句话的隐含意思是,没有证据证明人类智能不是被某个特定形式系统(如图灵机或者其他系统模型)所抽象概括的,就这样,图灵把“不能解决所有问题”的锅从机器甩回给了人类。
- 人类的智能是否能够被某种模型所抽象?如果是,那必将存在着人类智能绝对无法解决的问题,如果不是,那人类就很难制造出能够拥有人类思维的机械智能。
- 诺姆·乔姆斯基(Avram Chomsky, 1928—)和物理学家克劳斯有过一场对话,乔姆斯基再次被问到了“机器能思考吗?”这个问题,他反问道:“潜艇能够游泳吗?如果机器实现了意识的外现的结果,但是意识的内涵(原文使用的是潜意识“Preconsciousness”这个词)和人类的不一样,那机器可以被认为是有意识的吗?
计算机的实现与困难:
就是按步骤执行一系列指令,例如:
- 将A与B相加。
- 如果结果大于C,则执行D,否则执行E。
- 重复执行指令F,直到遇见情况G。
- 如果要制造智能机器,它的智能最终必须缩减到遵从这些简单的、明确的指令上。
- 这从本质上对人工智能提出了挑战:把这些简单的指令排列组合起来,真的可以产生智能行为吗?
- 其次,要理解人工智能的产生为何如此艰难,为什么如此难以定义何为人工智能真正的“进步”,我们需要了解一下哪些问题是容易用编程来解决的,而哪些问题则很难用编程解决,以及为什么。
通用人工智能:
制造具有普遍人类智能水准的机器,现在,通常称其为通用人工智能(Artificial General Intelligence, AGI), AGI大致等同于一台拥有一个普通人所拥有的全部智慧能力的计算机,包括使用自然语言交流(参见图灵测试)、解决问题、推理、感知环境等能力,与一个普通人处于同等或者更高等级的智能水准。
一个能够实现的AGI系统将能完成以下所有任务,并且可能还要更多:
- 接受外界信息的能力,如机器视觉、语音识别、语义理解等。
- 存储和使用知识的能力,如知识表示、知识工程、自动推理等。
- 改进自身的能力,如基于统计、概率、符号、连接的各类机器学习模型等。
- 反馈外界的能力,如自然语言处理、语音合成技术、运动平衡技术等。
关于AGI的文献通常不涉及自我意识或者自主意识之类,因此AGI被认为是弱人工智能的弱版本。
拥有智能展开的,要解决这些问题,首先要解决的就是定义什么是"智能"。香农提出考虑机器智能问题时,应当把艺术、情感、音乐等方面的能力一并考虑进去,这很接近今天多元智能理论中对智能的理解。而图灵则不认可,他认为智能既然是由物质(指人类大脑)所承载的,就应该可以由物理公式去推导,可以用数学的方式去描述,不应该把这些文化方面的内容包含进去。
心智或者大脑?
- 我们怎样才能够让计算机产生人类水准的智能行为呢?历史上,人工智能研究人员对这个问题有两种实现方式。粗略地说,第一种是试图建立思维模型:有意识的推理、认知、解决问题的过程,我们在生活中都会用到的过程。这种方法被称为符号人工智能,因为它使用各种符号来代表各种事物,并对此进行推理、认知等行为。
- 20世纪50年代中期到80年代末,30多年的时间里,符号人工智能一直是构建人工智能体系最流行的方式。
- 它有许多优势,或许最重要的一点是,它的过程是透明的:当机器人认为它应该执行某个程序的操作时,我们可以理解为它知道即将做什么。不过,我认为符号人工智能之所以这么流行,是因为它反映了我们有意识的思维过程。
- 我们本身“思考”的方式就是用符号或者文字流程化了,在决定做什么之前,我们可能会跟自己来一场心灵对话,讨论各种方案的利弊,最终决定执行某一种。
- 另一种模拟智慧的方式是模拟大脑,这是一种极端的可能性,即试图在计算机中模拟一个完整的人类大脑(也许还得包含完整的神经系统)。
- 毕竟,人类的大脑是我们唯一确定能产生智慧的事物。这种方法的问题在于,大脑是一个复杂得难以想象的器官:人脑包括大概1000亿个相连的神经元,我们对它们的成分、结构和如何运作的了解还达不到复制大脑结构的程度。
- 不过我们可以从大脑结构中获取一些灵感,并以此结构为基础构造智能系统中的组件。这个研究领域被称为神经网络——这个名字来自我们大脑微观结构中细胞信息处理单元神经元,它们是呈网状连接的。
- 行为学派:机器拟人身
- 智能应该是由具体行为表现出来的智能,智能、认知都与具体的身体、环境密切相关,它们之间存在内在的和本质的关联,智能和认知两者必须以一个在特定环境中具体的身体结构和身体活动为基础。
- 智能是基于身体和涉及身体的,智能始终是具体身体的智能,而不能仅仅存在于脑海之中。
- 如果说心智派在研究模拟智能的软件,结构派在研究模拟智能的硬件,那行动派就是在模拟智能生物的身体了。
人工智能早期成果
- 完全信息”(Perfect Information)是指双方完全掌握所有推导策略所需的信息,这是一个博弈论中的概念,博弈论的策梅洛定理(Zermelo's Theorem)证明了在不存在随机因素的对抗中,一方可以通过递归推导获得必不败的策略,那就是掌握完全信息的。
- Minimax算法”,这是一种零和算法,主要思路是一方要在可选的分支中选择将其优势最大化的路径,另一方则选择令对手优势最小化的路径,两者的对弈就过程构成一颗博弈树。
- α-β剪枝”搜索就是对Minimax算法树深度控制的一种有效的优化手段,多数情况下在走到叶子节点前就可判断是否有必要把该分支搜索完,多年来的改进主要集中在硬件上的进步和小范围的技巧优化,直至基于深度学习和概率评估函数等新方法得到应用实践的证明,计算机下棋在理论层面才算有了较大的进步。
- “模式识别”(Pattern Recognition):线条图像(数据样本)根据你上学时老师教的汉语知识和汉字形状(特征)映射到了一个个具体的汉字(分类)上,你大脑中自动完成的这个过程就叫作模式识别。
- 1957年发表的名著《句法结构》(Syntactic Structure)里提出了一个革命性的观点,他认为语言能力是人类心智的一种基本功能,人类大脑中天生就有处理语言的“模块”存在。由于人脑结构的一致性,人类最根本的语言处理机制是一致的,这种机制就是人类一切语言所共有的特点,并将这种机制视为一种“通用语法”(Universal Grammar),各种语言的具体语法可以由通用语法来转换生成。乔姆斯基所提出的这种语法被命名为“转换生成语法”(Transformational-Generative Grammar)。
- 乔姆斯基层级”(Chomsky Hierarchy)。该层级包含四个层次的语法:0型语法描述的是递归可枚举语言,对应的自动机是图灵机;1型语法是上下文有关语法;2型语法是上下文无关语法;3型语法描述的是正则语言,对应的是有限状态自动机
知识推理阶段
分治策略
- 正如我们所知,通用人工智能是一个庞大而模糊的目标,很难直接达成。因而,黄金年代采用的策略是分而治之。也就是说,与其一口气尝试构建完整的通用智能系统,不如识别出通用人工智能系统所需的各项不同能力,分别构建具备这些能力的体系。这一概念隐含的假设是,如果我们能够成功构建通用人工智能所必需的每一种智能系统,那么,以后将它们组合成一个整体,比起直接构建完整的通用智能系统简单得多。
- 感知。一台机器要在特定的环境中智能地工作,就必须能够获取周围环境的信息。我们人类通过各种机制感知世界,包括五种感觉:视觉、听觉、嗅觉、触觉和味觉。因此,就得研究制作能够感知外界的传感器。
- 感知领域的第二个挑战是如何解析这些原始的数字,理解它所“看到”的图像。这项挑战远比制作传感器难得多。
- 通用智能系统的另一个关键能力是通过学习积累经验,这引出了一个名叫机器学习的人工智能研究分支。
- 问题解决和制订计划是两个相关联的能力,它们也与智能行为有关。它们都要求用给定的动作组合来达成目标,而实现的关键在于找到正确的动作序列。
- 推理也许是诸多与智能相关的行为中最令人崇拜的一种:它基于现有的事实,用强大的逻辑方式获取新的知识。
- 自然语言理解,这涉及让计算机理解人类的语言,比如中文或者英文。目前,计算机程序员为计算机编程时,必须使用人造的机器语言:某种有着精确定义、明确规则、专门为计算机构造的语言。
- 连接主义学派使用的是生物仿生学的方法,通过模拟生物体的脑部组织结构去寻找智能,它关心的是承载智能的生理结构;
- 符号主义学派使用的是逻辑推理和演算的方法,通过解析物理符号系统假说和启发式搜索原理去寻找智能,它关心的是承载智能的心理结构和逻辑结构;
- 行为主义学派使用“感知—动作”的研究方法,通过环境反馈和智能行为之间的因果联系去寻找智能,既不关心智能的载体和其内部的生理结构,也不关心智能的逻辑和心理结构,只关心智能的外部可观察到的行为表现。
- 说连接主义学派在研究“大脑”(Brain),符号主义学派在研究“心智”(Mind),行为主义学派则在研究“行为”(Action)
1)符号主义
对于符号主义学派长达数十年的探索研究过程,根据研究的主要问题不同,可以将其划分为三个阶段:
- 最初这派的学者并未过多考虑知识的来源问题,而是假设知识是先验地存储于黑盒之中的,重点解决的问题是利用现有的知识去做复杂的推理、规划、逻辑运算和判断,这个时期称为符号主义的“推理期”;
- 后来大家发现智能的体现并不能仅依靠推理来解决,先验的知识是更重要的一环,研究重点就转变为如何获取知识、表示知识和利用知识,这个时期称为符号主义的“知识期”;
- 最后,由于知识仅依靠人类专家总结、提炼然后输入计算机的方式无法应对世界上几乎无穷无尽的知识,研究的重点又转为如何让机器自己学习知识、发现知识这个方向,这个时期就称为符号主义的“学习期”
3.2 引言:五分钟逻辑学
- 亚里士多德在他的《工具论》(Organon)中提出了传统逻辑学中最基本的“三段论”(Syllogism)推理形式,三句话的每一句都被称为是一个“命题”(Proposition)
- 其中最后一句是“结论”(Conclusion),前两句分别是这个结论成立“大、小前提”(Premise),三段论就是从前提到结论的演绎推理。
- 如果将命题作为逻辑分析的最小单位,研究形式是“如果前提p成立,那么结论q成立”与“如果前提p并且q成立,那么结论s不成立”这类关注点在命题间关系的逻辑,就称为“命题逻辑”(Propositional Logic)。
- 如果把逻辑分析的对象进一步细化,对单个命题再做分解,按语言学关系拆分出其中的主项、谓项、联项和量项,去研究形式如“所有S都是P”“有些S不是P”“a(S中的某一个)是P”(特别地,如这两个例子所举的“判断事物是否具有某种属性”的命题称为“直言命题”)这类关注点在命题词项之间关系的逻辑,就称为“词项逻辑”(Lexical Logic)
- 既然已经使用逻辑符号把原本的“语言文字”写成“数学算式”了,那我们所处的这个世界,广泛采用语言文字来描绘的知识,是否都可以通过这种方式以符号来描述?还有更关键的另一个问题,符号化之后,人类大脑中思考各种问题的推理过程是否也能使用数学运算和定理来完成?
3.3 描述已知,推理未知
- 今天越来越多的形式科学的立论方法都大同小异:首先摆出最小化的几条公理、公设和定义,然后先证明最简单的第一个命题,然后又以此为基础,再来证明第二个命题,如此重复,这种从简单到复杂地证明一系列命题来建立整套理论的研究问题的方式称之为“公理化方法”。
- 逻辑理论家的基本思路是利用计算机的运算速度优势,遍历出形式化之后的定理前提所有可能的变换形式
- 也就是常见的树搜索,再配以适当的剪支算法。逻辑理论家以已知前提为树的根节点,把根据规则可以进行的每一种变换都作为该节点的下一条分支,如果某条分支中出现了与结论一致的变换形式,那这条分支路径经过的每一个节点按顺序连接起来就是定理证明的步骤了。
- 人通常会把要解决的问题分析成一系列子问题,并寻找解决这些子问题的手段,通过解决这些子问题,就能逐渐达成问题的最终解决,GPS解决问题的方法就是模拟这个问题分解的过程,逐步分解问题空间,通过拆分子问题构建搜索树,直到到达已知条件结束搜索。
- 人工智能建立的最初20多年里,符号主义学派的学者们首先考虑的是寻找人工智能的入手点。
- 他们假设现有已知的知识可以通过形式语言精确描述,并可以灌输给计算机。
- 然后通过计算机的运算能力进行演绎推理,得出新的未知的知识,或者做出正确的决策,从而使机器展现出智能行为。
常识编程
- 麦卡锡希望为AdviceTaker提供先验的知识,这些先验的知识是我们人类所了解的各种知识和常识中最基础、最本质的那一小部分。
- AdviceTaker先使用这些先验的前提进行推理,得出简单的结论,然后逐步形成越来越多的新知识。AdviceTaker可以根据这些知识持续改进自己的行为机制,逐步获得人类所有甚至超过人类现有的知识。
- 麦卡锡的《常识编程》论文中定义和推理过程对机器来说并没有困难。机器可以用逻辑推理模拟人类思考,似乎是可行的。
- 但是,AdviceTaker并没有解决“常识来源自哪里?”这个真正的难题。
- 诸如go、walkable、drivable、canachult、want等谓词的定义都是人类灌输进去的。计算机并没有从某种“公理”或者“公设”性质的常识中推导得出这些定义。
- 要使用一小撮最小化最本质的公理定义和规则的集合就可以推理出人类的所有常识,在具体的现实世界里做到这点很困难。
- 麦卡锡在论文中也承认了现在无法解决这个问题。因此,AdviceTaker只是理论上可行的一种方法,暂时无法作为实际实施的指导方法。
LISP编程语言
- 数组和链表是两种最常用的线性数据结构。
- 它们各有特点,但如果仅讨论存储逻辑推理涉及的符号的话,链表显然比数组更合适。因为数组要求每个元素具备相同的数据结构,而多种多样的符号无法高效地使用统一的数据结构来存储。
- LISP可以很好地实现麦卡锡设想的“符号推理能够从已知的知识推理出新的知识,乃至自我改进推理系统自身的行为”。在LISP中,程序(行为)和数据(符号)是高度相似并且可互相转化的。麦卡锡将它们分别描述为“M-表达式”和“S-表达式”(现代LISP编程中只使用S-表达式)。
- LISP的重要特点“元编程”(Meta Programmed)源于数据可以变为程序、符号可以修改自身的行为。使用这个特性,程序可以方便地实现新知识改进自身的目标。
物理符号系统
- 物理符号系统是纽厄尔和司马贺提出的一套尝试解释智能来源机制的理论。它试图模拟人类如何获取、储存、传播和处理信息,并提供了一种将这个过程中各种现象模型化并迁移到计算机中实现的方法。
- 物理符号系统的理论主要由两个假说构成,分别是物理符号系统假说和启发式搜索假说。
- 研究某个系统的时候,科学家通常会建立一个简化的模型来定性地描述这个系统的性质。这个模型会去除与研究内容无关的特性。科学中把这种研究方法称为“结构性定律”。
- 比如,要研究人类身体结构的功能,需要知道心脏用于供血,大脑用于思考,骨骼用于支撑。在这样的模型上,研究不同人种的身体结构和功能就变得简单。
- 物理符号只是把自然语言换成了我们所能接触的各种物理实体而已。
- 可以把任何信息加工系统都视为一个具体的物理系统,比如人脑的神经系统和由计算机硬件构造的系统等。所谓符号就是匹配物体用的“模式”(Pattern)。任何一种模式,只要系统能够将其与其他模式区分开来,它就可以形成一个符号。
- 根据纽厄尔和司马贺的设想,一个物理符号系统包括“符号”(Symbols)、“表达式”(Expressions)和“操作过程”(Processes)。
- 多个符号组合起来就成了表达式,组合方式可以是多种多样的。
- 系统在任意时刻都在对这些表达式执行着操作。这个过程可以归纳为对表达式进行“创建”(Creation)、“修改”(Modification)、“复制”(Reproduction)和“销毁”(Destruction)这四个操作的不同顺序组合。
- 物理符号系统假说的核心观点是认为物理符号系统是智能行为的充分且必要条件。
- “必要”意味着任何实现了智能的系统都可以被视为一个物理符号系统,这点是现在的认知科学要去研究和证明的问题;
- 而“充分”则指任何具有足够尺度的物理符号系统都可以通过适当组织展现出智能,这就是人工智能这门学科要去研究和证明的问题。
- 关于物理符号系统对信息的处理过程,纽厄尔和司马贺进一步提出了启发式搜索假说来进行解释。
- 如果物理符号系统是智能行为的抽象模型,那启发式搜索就是解决问题或做出决策的抽象模型。纽厄尔和司马贺认为,一个系统能表现出智能行为总是通过解决问题来体现的。
- 计算机一贯的解决问题的方式是靠“蛮力”搜索问题空间。假如有无限的时间、存储空间和能量供应,那么确实所有可解决的问题都可以通过穷举的方式,遍历问题空间中的所有路径来找到最优解。
- 但是人类智能思考问题的方式显然不是这样,人脑总是在有限的时间中搜索得出结论,即使这个结论不是精确的、不是最优的。从人类拥有智能但计算机暂时还没有智能这一点就可以看出,搜索越多并不意味着智能越高。相反,智能高的人可以在不经过大量搜索的情况下解决问题。
- 启发式搜索得到的结果可能不是最优的或最精确的,但是成本是可以承受的,而且一般情况下是有效的。
- 结合物理符号系统,启发式搜索的具体执行过程可以总结为:
- 首先将物理符号随机地组合成表达式。这个表达式的每一种变换形式构成了搜索树的各条分支。
- 然后给定一个评价函数,用于评价表达式的不同变换形式与目标形式之间的差距。
- 选择一个差距最小的变换形式,重复搜索过程,直到差距无法缩小为止。
- 在这个过程中,评估函数的设计对搜索结果产生决定性影响。
知识期
- 20世纪50年代到60年代间,人工智能的研究度过了符号主义的第一个阶段:“推理期”。
- 这个时期里主流的基于逻辑推理来寻找智能的研究方法,在人机对弈、问题求解、机器定理证明这类信息完全而且问题空间是封闭的领域中取得了一定的成功。
- 但是,由于没有解决如何从少量公理性知识推导出整个世界的常识问题,所有的先验的已知知识都只能靠事前的输入,机器这样依赖“死记硬背”来获取知识的方法,在应对开放性的问题时就显得捉襟见肘了,甚至在很多问题上都是完全无能为力的。
- 人工智能的主要研究方向便从“逻辑推理”转到了“知识的表述”上。
- 符号主义学派从“推理期”转入“知识期”的标志是三类“知识”研究开始被科学界关注而且取得了一定进展,它们分别是:“知识表示”出现了被广泛认可的方法、“知识工程”被提出和作为独立的学科进行研究以及以专家系统为代表的“知识处理系统”开始展现出实际应用的价值。
使用规则获取人类专家知识
- 启发式方法可以理解为包含能够解决问题的知识,但是启发式方法并没有直接去获取知识。而基于知识的人工智能体系拥有一个全新的思想:人工智能系统应该明确地获取和展示人类解决某类问题的专业知识。
- 最常见的方案是基于规则的,被称为知识表述。人工智能环境下,一条规则以“如果……那么……”的形式获取离散的知识块。如果我们当前所掌握的信息与条件项相匹配,那么规则就会被触发,我们就能根据这条规则得出结论。
- 例如,如有两个条件:我们试图分类的那个动物能飞,而且能产卵。如果我们确实掌握了这两条信息,那么规则成立,我们就能得出结论,该动物是鸟类。
- 这个结论为我们提供了更多的信息,这些信息又可以用在后续的规则中,用以获取更多的信息,如此层层推进。
- 通常,专家系统以咨询的形式与用户交互,用户负责向系统提供信息,并且回答系统提出的问题。
知识表示
“知识表示”(Knowledge Representation)就是对知识以及知识和知识之间关联关系的一种描述约定
语义网络
- 语义网络是罗斯·奎利恩(Ross Quillian)在1966年提出的一种心理学模型,最初是用来描述概念之间联系的,形式和今天常用的思维导图差不多,后来司马贺把这个心理学的模型推广应用到计算机领域中。
- 语义网络是一种使用有向图来表示知识的方法,图由节点和连接弧组成,节点用于表示实体、概念和事实,连接弧用于表示节点之间的关系。
- 语义网络的主要优势在于使用类似于人类记忆和联想的方式,清晰地把实体间联系(结构、层次、因果等)表达出来。
- 但它不适用于定量、动态的知识,也不便于表达过程性、控制性的知识。
- 语义网络理论与学习、智能、感知之间的关系:
谓词逻辑
- 通过使用谓词(也称为谓词符号)来表示关系或属性,以及变量来表示对象,来构建复杂的逻辑表达式。
- 谓词逻辑包括两个主要组成部分:谓词和量词。谓词是描述性的符号,用于表示对象之间的关系或属性。例如,"是父亲"和"大于"都可以作为谓词。量词用于指定关于对象的范围,例如"对于所有"和"存在"。
- 谓词逻辑的语句可以使用逻辑运算符(如与、或、非)进行组合,以构建更复杂的表达式。这些表达式可以用于推理和推断,从已知的事实中得出新的结论。
- 谓词逻辑举例:
- 假设有一个家庭,由父亲、母亲、一个儿子和一个女儿组成。我们可以使用谓词来表示这些关系。例如,我们可以使用"P(x)"表示一个人x,使用"F(x)"表示一个人x是父亲,使用"M(x)"表示一个人x是母亲。
- 我们可以使用谓词逻辑来描述这个家庭的成员关系。例如,我们可以表示父亲和母亲的关系为:
- F(John, Tom):表示John是Tom的父亲。 M(Lisa, Tom):表示Lisa是Tom的母亲。
- 使用这些谓词逻辑表达式,我们可以进行推理和推断。例如,如果我们知道Tom是John和Lisa的儿子,我们可以使用谓词逻辑推理得出Tom是John的儿子和Lisa的儿子。
- 这个简单的家庭场景说明了谓词逻辑在生活中的应用。它可以帮助我们描述和推理关于事物之间的关系,从而更好地理解和处理现实世界中的复杂情况。
把谓词逻辑和语义网络对比来看
- 假如我们再进一步增加待描述实体的数量,每个实体之间都可能存在关联关系,那实体之间可能存在的关系总数会随实体数量呈现出指数级的增长趋势。
- 谓词逻辑把不同的实体与规则当作独立的事实来处理,语义网络则将多个实体与规则视为一个整体来进行处理。
- 在处理局部推理细节时,或者实体间有定量的动态关系时,谓词逻辑是很有效的工具,但需要在全局层面考虑整体关系的时候,通过谓词来描述实体和关系就不是一个特别合适的选择。
- 谓词逻辑系统有特定的演绎结构,而语义网络不具有特定的演绎结构;
- 谓词逻辑的推理是自底向上,从细节到整体的推理,而语义网络推理是知识的高层次推理,是知识的整体表示。
“知识工程”(Knowledge Engineering)
- 让计算机对那些原本需要专家知识才能解决的应用问题提供求解的手段。
- 由于结构和原理上天然的差异,计算机擅长处理许多人类无法处理的问题,但是同时计算机也在很多人类毫不费力就能处理好的问题上停滞不前。
- 人工智能的主流研究方向从一开始死磕追求拟人化的通用智力,变为追求解决特定专业领域的知识问题。
- 知识工程研究如何获取知识、如何验证知识正确与否、如何表示知识、根据知识推导结论以及解析推理结果的含义这一整个过程中面临的学术和工程问题,以及解决这些问题所涉及的支撑技术。
- 知识管理的内容中也涉及获取知识、组织知识与检索知识的问题,还涉及数据挖掘、文本聚类、数据库与文档管理等计算机技术。
- 知识管理的核心是无序知识有序化,使之成为人类可以利用的资源,而知识工程的核心是揭示知识本身的表示和关联关系,以及解决计算机如何利用知识的问题。
- 一言以蔽之,知识管理的目标是建立供人使用的知识库,而知识工程的目标是建立供计算机使用的知识库。
- 知识库包含系统所拥有的知识——那些规则。工作存储器则包含了系统拥有的,有关当前正在解决的问题信息(例如“该动物有毛发”)。
- 推理机则是专家系统的一个重要组成部分,它负责在解决问题的时候应用系统内存储的知识。只要给定知识库,比如上文举例的动物分类知识,推理机就能够以两种方式运行:
- 用户向系统提供他们所知道的有关问题的信息(以动物分类为例,用户向系统描述该动物是否有条纹、是否食肉等),推理机会根据用户提供的信息,应用规则去获取尽可能多的新信息,这个过程叫作规则触发。
- 然后,推理机将触发规则以后获得的新信息添加到工作存储器中,继续查看是否有新的规则被触发,然后不断重复这个过程,直到彻底无法通过已知信息应用更多规则得出更多新信息为止。这种方法被称为正向推理:从数据推理到结论。
“知识系统”(Knowledge Based Systems)
- 符号主义从推理期进入知识期,如果说理论上的成就是出现了知识工程这个新学科,那实践上的成就,就是终于出了一些被成功应用于商业的、基于知识的系统(Knowledge Based Systems)。
- 基于知识的系统一般软件架构上都可以划分为知识库和推理引擎两个部分,知识库用于在计算机系统里面反映出真实世界中的知识,而推理引擎则负责使用知识库中的内容推理求解,得到用户提出的问题的答案。
- 典型的基于知识的系统包括决策支持系统、推荐系统、专家系统等,这些系统目前仍然应用非常广泛,其中又以专家系统的历史影响最为突出。
- 专家系统(Expert System)是一种依靠计算机模拟人类特定领域的专家,对特定问题做出解答或者决策的人工智能程序,与人机对弈、模式识别、自动定理证明这些早期的人工智能应用有一点不一样,前者更偏向学术研究,而专家系统的直接商业价值是显而易见。
从演绎到归纳
- 学习能力、记忆能力、思考能力是人类智能的内在基础,也是人类智能行为的外在表现。在计算机领域,这三项能力对应于计算机
- 学习能力:通过学习获取知识改进系统自身
- 记忆能力:通过形式化手段描述并存储知识”
- 思考能力:通过逻辑推理基于已有知识产生出新的知识
- 在70年代后期,机器学习重新成为符号主义学派主流研究方向。这个时期的机器学习不再是简单的“死记硬背”,而是从大量样本数据中自动总结提炼出隐藏在数据背后的知识,并对这些知识进行形式化描述。因此,这个阶段的机器学习被称为“基于符号的机器学习”或者“基于规则的机器学习”。
- 与基于神经网络的机器学习相比,基于符号的机器学习(以决策树学习为代表)具有一个很好的性质:生成的模型是一个白盒模型。模型的结构可以很容易地解释输出结果的含义。而神经网络生成的是一个黑盒模型,很难解释模型的结果。可解释性是基于规则学习算法相对于基于神经网络学习算法的巨大优势,这也是符号主义思想的先天特征。
决策树
- 决策树是一种树结构,其中每个非叶节点表示一个特征属性的测试活动,每个分支代表该特征属性在某个值域上的输出,每个叶子节点存放着一个分类类别。使用决策树进行决策的过程是从根节点开始,测试待分类项中相应的特征属性,并按照其值选择输出分支,直到到达叶子节点,将叶子节点所代表的分类类别作为决策结果。
- 一种是以某种方式集中搜索。其中一种典型的方式是并非逐级建立完整的搜索树,而是沿着其中一个分支构建搜索树。这种方式被称为深度优先搜索。通过深度优先搜索,我们沿着一个分支往下扩展,直到得到解决方案或者确信无法得到解决方案。如果遇到困难,那么我们就停止在该分支上的扩展,返回到上一级,选择另外的分支。
- 深度搜索的主要优点在于不用存储整个搜索树,只需要存储当前正在处理的分支即可。但它有一个很大的缺陷:如果选择了错误的分支进行探索,可能会在错误的路上越走越远,永远找不到解决方案。所以,要想使用深度优先搜索,首先我们得确认哪个分支最值得搜索。
- 决策树学习算法的核心是从训练集中自动归纳出一组分类规则,使得这组规则不仅能适应已知的训练样本,对于与样本同分布的未知新数据也有一致的泛化性能。因此,决策树学习的目的是让计算机通过训练数据自动构建出一棵最合理的决策树。
- 在构建决策树时,选定的分裂准则是让按选定的属性分裂树后,划分到每个分支数据的信息熵最低,即纯度最高。这个分裂过程被称为“信息增益”。香农在《信息论》中证明了只有不确定的数据才能携带信息,因此这种分裂准则是合理的。
- 对于数据集规模小、样本属性少的情况,构建决策树很容易。然而,当面对大量样本和属性时,构建一棵最优决策树变得非常困难。这是因为每个节点选择的分类属性都对所有分支中的样本集有全局性的影响。因此,通过样本训练出最优的决策树是一个“NP完全问题”。实际应用中,决策树学习通常采用启发式搜索算法,以达到局部最优解而不求全局最优解。
符号主义面临的主要困难有两点:
- 一是“智能”实在太过复杂、抽象,人类的大脑能够解决的问题可以说无所不包。虽然其中的某些问题可以被形式化,特定问题可以找到支撑的科学原理,但是更多问题往往无法被形式化,也不清楚背后的运作机制。以至于在其他科学里一直行之有效的“根据具体现象,总结一般规律”,“根据客观规律,推理未知现象”的研究方法在研究智能时,竟都显得有点无从下手。正是因为对智能的研究无法做到透过现象见本质,所以才有了后面基于统计和概率的、基于连接的、基于群体智能的等新型研究方法的兴起。科学家选择其他这些方法,多少有些符号没有办法直达智能的本质,不得不退而求其次的无奈。
- 二是符号主义中的主要理论实现起来始终受到“NP完全问题”的困扰。
- “NP”代表“不确定多项式时间。要么所有NP完全问题存在通用的解,要么它们都无解。如果你能找到高效又准确解决某个NP完全问题的方法,就意味着你能够解决所有NP完全问题。
- 不管哪个领域——解决问题、玩游戏、计划、学习、推理任何方面——似乎关键性的问题都是NP完全问题(甚至更糟)。这种现象普遍得成了一个笑话——所谓的“AI完全问题”意味着“一个和AI本身一样难的问题”,如果你能解决一个AI完全问题,你就能解决所有AI问题了。
- 即使很多理论上可行,至少值得去试一试的研究方法,都因为最后被证明是“NP完全问题”,无法逃脱指数级别时间的增长,无法不打折扣地应用于智能的探索实践。“NP完全问题”虽然说到底也算是算力大小的问题,但它是无法靠摩尔定律去突破的。
- 若要以运算能力发展去应对的话,势必要等计算机体系结构发生重大变革,抛弃掉图灵机和冯·诺依曼架构,譬如生物计算机、量子计算机成熟之后才可能看到希望。
2)连接学派
大脑模型
- 20世纪初的神经科学已经初步了解了大脑神经元细胞的存在,科学家还知道了只有当神经元细胞的“树突”(Dendrites)受到的外部刺激达到一个阈值之后,才会沿着“轴突”(Axon)方向向其他神经元放电,发射出脉冲信号,刺激“突触”(Synapse)和与其相连接的其他神经元细胞树突交换神经递质来完成信息传递。
- 换而言之,神经元细胞发送电脉冲的前提,是必须要有足量的邻近神经细胞通过神经突触向其传递信号。
- 神经元细胞这种要么发射信号,要么不发射信号的构造是离散的、二元性的,麦卡洛克认为神经元的工作方式和最基础的“与”“或”“非”这些逻辑门非常相似。
- 假如把一个神经元信号看作是一个命题,那人类大脑的神经元网络,似乎就同一个个连接这些命题的逻辑门一般运行,每个神经元所代表的逻辑门可以接收多种信号的输入,并产生一个单独的输出信号。通过变更神经元的放电阈值,神经元就可以实现“与”“或”“非”操作。
- 麦卡洛克与皮茨共同构造出了一种能够完全通过神经元连接的网络来进行逻辑运算的模型,这个模型展示了人类大脑能够实现任何可能的逻辑运算,得出结论:
- 人脑是图灵完备的,即能完成任何图灵机可以完成的计算。
- 基于这种由神经元所构成的网络,他们提出了一种大脑将信息抽象化,并基于逻辑来处理信息的设想。这种设想尝试解释了人类大脑是如何创造出回荡在脑海里的丰富而精巧的具有层级化的信息的,这个创造过程就被他们称作“思考”
- 神经网络以神经元为最小的信息处理单元,把神经元的工作过程简化为一个非常直接、基础的运算模型,这个模型极为简单,但是对未来人工智能研究影响深远,后来科学界取了麦卡洛克和皮茨名字的第一个字母,将这个模型称为“M-P神经元模型”。
感知机
- 如果两个神经元同时激发,则它们之间的连接权重就会增加;如果只有某个神经元单独激发,则它们之间的连接权重就应减少。
- 赫布学习规则是最古老的也是最简单的神经网络学习规则。如果仅局限于神经网络方法范围内而言,机器学习的本质就是调节神经元之间的连接权重,即赫布法则中的神经元关联程度。
- 从这个例子里可以再提炼出一个更为普适的神经网络机器学习解释,神经网络学习方法的基本原理就是从训练集中提取出分类特征,这些特征应能同样适应独立同分布的其他未知数据,所以经已知数据学习训练后的神经网络可以对同类的未知数据有效。
对于感知机的批评
- 在《感知机:计算几何学导论》一书里,明斯基和派普特使用数学方法,证明了感知机在处理线性可分的数据时,其学习过程可以使得权重收敛到一个稳定值,换句话说就是感知机处理线性可分问题是可行的。但是他们同时也指出了感知机的致命弱点:“感知机能解决线性可分的问题,但是它也仅仅能解决线性可分的问题。
- 异或运算(XOR,是一种逻辑析取操作,当两个运算元的值不同时结果为真)也是一个很基本的逻辑运算操作(独立于“与”“或”“非”操作),如果连这样的问题都解决不了,那感知机的处理能力确实是有极大局限的。
- 最简单的单层网络也有14× 14个输入神经元、10个输出神经元,这样的神经网络就包含有1960(196× 10)个神经元连接,如果中间再加入一层与输入项数量相同的隐层,整个网络所需要训练的权重将会激增至是40376(196× 196+196× 10)个。
- 更让人头痛的是,加入隐层之后,罗森布拉特的“Back Propagation”(请注意,此算法与今天深度学习的误差反向传播算法名字相似但内容并不一样)训练方法就不再有效了,原因是不同层之间的权重调节并非独立的,它们的取值会互相影响,不能再面向单个权重来调节,可是要一体化地训练如此庞大的连接权重,在当时即没有合适的硬件能处理这种规模的数据,也没有可行的训练算法来实现。
3)行为学派
概述
- 人类是最具智慧的物种,但智慧到底是潜藏于人类的大脑之中,还是寄居于身体之内,这是一个长期悬而未决的哲学问题。图灵在他1948年写给英国科学院的论文《智能机器》里面,就曾经把研究智能的方向划分成了“具身智能”(Embodied Intelligence)和“非具身智能”(Disembodied Intelligence)两类。
- 关于“非具身智能”的研究,演进成我们今天传统的基于计算(Computationalism)的认知科学,符号主义学派所主张的观点便是追寻这类智能的具体表现。以非具身智能的角度来看,所谓智能就是符号操作,起始于大脑的输入,终止于大脑的输出,智能和认知只关注这个符号操作过程。
- 而“具身智能”的观点则认为智能、认知都是与具体的身体、环境密切相关的,它们之间存在内在的和本质的关联,智能和认知两者必须以一个在环境中的具体的身体结构和身体活动为基础。智能是基于身体和涉及身体的,智能始终是具体身体的智能,而不能仅仅存在于脑海之中。
- 追寻具身智能的研究同样在人工智能中成长发酵,形成了“行为主义学派”(Actionism),“行为主义”在人类心理学领域中已出现过,在人工智能领域里,这个学派是以《控制论》的出版发行为起源标志的,因此又常被称为“控制论学派”(Cyberneticsism),根据其学说特点,有时候也被称作“进化主义学派”(Evolutionism)。
机械因果观和行为主义
- 自从牛顿时代起,科学描述的宇宙是一个其中所有事物都是精确地依据特定规律来运作的宇宙,是一个细致而严密地组织起来的、其中全部未来世界都严格地取决于全部过去世界状态的宇宙。
- 机械因果观描绘的这种钟表式世界图景,从17世纪到19世纪的漫长时期里持续统治了科学界。
- 直到路德维希·玻尔兹曼(Ludwig Boltzmann,1844—1906)在物理中引入概率解释后,这种决定论才受到了挑战,最终量子力学获得全面胜利,这种纯机械的因果观在微观世界中才被推翻。即使像莱布尼茨这样具有辩证思想的学者,也坚信机械因果论,所以莱布尼茨的思维演算系统还是存有很明显的时代局限性的。
- 维纳自己一直坚持把考察对象作为开放系统来看待。从他的开放性观点来看,研究的对象是从它的环境中相对地抽取出来的,与环境仍然有千丝万缕的联系。可以而且必须从系统与环境的互动关系中研究系统。
- 如果把行为广义地定义为系统相对于环境做出的变化,那么,一个系统可以从外部探知的变化都可以称为行为。
- 如果把环境对系统的影响和作用统称为“输入”,把系统对环境的作用及其引起的环境变化称为“输出”,则给系统施加某种输入,观察它的输出,通过分析输出对输入的响应关系以了解系统的属性,而不必顾及系统内部的组织结构,这就是广义的行为主义方法。
- 它既适用于动物,也适用于机器以及其他系统,这一定义和推论奠定了控制论的方法论基础。
- 明确了控制系统所接收的信息具有随机性,控制系统的结构必须适应这种性质。这里隐含了一个重要结论:控制论其实是一种统计理论,它关心的不是系统根据单独一次输入后产生的动作,而是对全部输入整体上能够做出合乎预期动作。
- 在这个系统中,因果联系不再是完全确定的,它同时具有统计上的确定性和个体上的不确定性,因而是一种统计上的因果关系。
- 在控制系统中引入统计属性,从根本上改进了机械式的因果观念,从此观点出发,机械同样可以表现出“具有灵性”的智能行动,这也是维纳对“机械大脑论”的翻天覆地的革新改进,使得机器与生物体,在理论上都可以表现出相同智能行为的理论基础。机器与生物在行为意义上的界限,或者说智能与否在行为意义上的界限,可概括为以下两点。
- 机械或者机电系统中的反馈机制可以推广到人类和其他生物的范畴,可以用同一套理论去阐释动物和机器两大领域的信息、通信、控制和反馈问题。
- 人类和其他生物的智能行为,也同样可以推广到机器,机械也可以实现智能行为。根据“感知(输入)—行动(输出)”方法,只要能够对环境的外部输入给予预期中的输出,这就是智能的体现,而无须去纠结是机器还是生物体。
自复制机和进化主义
- 根据冯·诺依曼定义的自复制机架构,任何能够自我复制的系统,都应该同时具有两个基本功能:
- 首先,它必须能够构建一个组成元素和结构与自己一致的后代系统;
- 然后它需要能够把对自身的描述传递给这个后代系统。
- 冯·诺依曼把这两个部分分别称作“通用构造器”和“描述器”,而描述器中又包含了一个通用图灵机和保存在通用图灵机器能够读取的介质上的描述信息。这样,只要有合适的原料,通用构造器就可以根据描述器的指示,生产出下一台机器,并且把描述的信息也传递给这台新机器。随后,新机器启动,再进入下一个复制循环。
- 冯·诺依曼的这个思路被几年后的一项惊人发现所验证。1953年,詹姆斯·沃森(James Watson,1928—)和弗朗西斯·克里克(Francis Crick,1916—2004)共同发现了DNA的双螺旋结构,这种结构完全具备冯·诺依曼所提出的两个要求。现在,我们仍然还没有设计出能够真正完全复制的机器硬件,但是遵循冯·诺依曼的思路的自我复制软件确早已经存在了,电脑病毒就是其中最广为人知的一种。
- 可是以机械化的角度看待繁衍的话,将会导致一个相反的结论:有机生命的自我复制是进化的,而机械的自我复制则是退化的。
- 一台机器如果可以制造另外一台机器,那它必须要懂得组成机器的每个部件、掌握新机器的设计和组装过程中用到的工具,总而言之,母机的精确度和复杂度必然不能比子机更低。
- 复杂度这点是无须解释的,精确度上也容易理解:譬如以工业中最常用于制造机器部件的机床为例,母机床的精度必须要比通过母机床制造出来的子机床精度高,才有可能制造出符合精度要求的下一代子机床,而使用子机床再复制出下一代子机床,精度还会进一步下降。
- 所以冯·诺依曼的自复制机理论中,必然不能是一比一的直接复制,也必须引入随机变异这一生物进化的重要特征。
黄金年代的终结
- 20世纪70年代初到80年代初这10年被称为人工智能寒冬,更确切地说应该是人工智能的第一个寒冬,因为此后还有类似事件发生。人们得出了一个普遍结论,人工智能研究人员对这一领域充满了盲目乐观和毫无根据的预测,结果什么都没有。
机器学习
什么是机器学习
- “如果某个系统可以从经验中改进自身的能力,那这便是学习的过程。”
- 机器学习的目标是让程序能够从给定的输入中计算出期望的输出,而不需要给出一个明确的方法。
- “假设某项评价指标可作为系统性能的度量(Performance,简称P),而这个指标可以在某类任务(Task,简称T)的执行过程中随着经验(Experience,简称E)增加而不断自我改进的话,那么我们就称该过程‘Process<P, T, E>’是一种学习行为”。这个定义里明确列出了“任务T”“度量P”“经验E”“学习过程Process<P, T, E>”
- 以自动驾驶为例,机器学习采用各种路况下正确的驾驶操作的概率(度量P)来评价系统性能,在不同的路况的行驶过程(任务T)中,无人车是基于机器学习训练出来的模型实现自动驾驶的,而不是依赖程序员的代码编程来判断各种路况,因为程序编码几乎不可能穷举出所有的可能的路况
- 必须根据长期行驶的路况和操作记录的分析结果,根据人类对各种路况应对的操作经验(经验E)来修正这个驾驶模型,然后由这个模型来决定在图像、速度等传感器提供的信息下,机器应该采取什么样的驾驶操作才是正确的。
机器学习=模型+策略+算法
- 模型:指机器学习所要产出的内容,它一般会以一个可被计算的决策函数或者条件概率分布函数的形式存在。把未知的新数据代入到这个模型中计算,就会得到符合真实情况的输出结果。
- 策略:指要按照什么样的准则进行学习,具体一点是按照什么样的准则选择出最优的模型。从宏观角度讲,一般我们都会以“减少模型的输出结果与真实情况差距”作为学习的准则,这里的“差距”同样也是以一个可被计算函数的形式来描述的,被称为“损失函数”。
- 算法:指如何依靠历史数据,把正确的模型中涉及的未知参数都找出来。在确定寻找最优模型的策略后,机器学习的问题便归结为寻找出模型最优参数的优化的问题
机器学习的意义
- 通用可编程的计算机出现大半个世纪以来,人与机器的交互几乎唯一的手段就是程序,一段计算机程序可以看作对一连串数据从输入到输出的处理过程,程序员与机器的交流是通过设计编码来完成某种功能,譬如说一个最简单的应用程序,从界面逻辑、控制逻辑、业务逻辑、数据结构等各个层次,都必须由程序员去设计去思考,然后用程序语言编写出来,再让计算机去执行。
- 运行在计算机中的程序,无论它有多么庞大复杂,只要还是由人类所设计编写的,在理论上,它对人类就是一个完全的“白盒”。人虽然没有办法像计算机那样高速运行程序,但却可以知道计算机程序执行中每一个时刻的每一个细节。
- 在整个程序执行过程中,计算机从头到尾都只是运算工具和信息存储容器,只参与了“执行”,完全没有参与到问题解决的“思考”过程中
- 机器学习在一定程度上把“黑盒”的思想带进计算机中,用机器学习处理问题
- 并不追求一开始就找到问题解决的办法或处理过程的精确细节,而是让计算机用某些被先验证实是行之有效的基本模式去模拟问题中的数据发展变化,试图用足够大量的反映现实现象的数据,来直接驱动机器去模拟并拟合这些已知的现象,然后去预测那些具备相同规律但还未知的现象
- 机器学习的目标确实曾经尝试过让机器得以自动学习、发现事物的运行规律,但是今天大家所指的机器学习,只是根据已知数据形成的对未知数据的模拟,而并非人类意义上的主要以学到了知识和规律为目的学习,也许将后者称为“思考”,与“学习”区分开来会更为恰当。
机器学习解决的问题
- 机器学习最初是从基于规则的机器学习开始的,现在正在朝着基于数据的机器学习在持续迈进。
- 基于规则和基于数据两种思维,分别对应了人类对现象规律和对现象表现的研究,也反映了符号主义学派和连接主义学派各自对机器学习的看法
人类知识的划分
- 第一类问题(We know what we know):对这种可推理可统计的问题,无论用何种方法,原则上我们都可以寻找到答案。
- 第二类问题(We know what we don't know):对于能够通过已知规律推理得到未知现象的问题,
- 例如我们身边的各种数学定理、宏观的物理定律都是依靠严格的逻辑推理得出的
- 我们知道了今天地球的位置、角度、速度、质量等,完全可以准确无误地预测出1000年之后地球的精确位置,这个预测依赖的就是根据人们已掌握的天体运行规律来推理得到的。
- 对于这个象限的问题,目前计算机作为计算工具,可以很好地代替人类完成定律公式的运算过程,但是对于自主地发现和证明规律的进展还处于非常初级的阶段,主要解决问题的方法是人类去思考和发现规律,编程让计算机应用这些规律去解决问题
- 第三类(We don't know what we know):即不知道规律,但可以根据已知现象的统计结果去推测未知现象的。气象系统是典型的受混沌理论约束的系统,几乎不可能靠严格的推理来获得满意的结果,但是却可以根据长期记录的天气变化前的各种特征来做出很有效的预测。
- 第四类(We don't know what we don't know):这类问题我们既不知道它蕴含的规律,也没有办法统计出任何有规律的特征。这些行为对中奖结果的预测应该都不会产生什么帮助。要解决这一个现象的问题,就必需要靠人类的“顿悟”的灵感了,现在机器还暂时难以涉足这个领域。
神经网络
- 神经网络,顾名思义,灵感来自大脑内组成神经系统的神经细胞——神经元的微观结构。
- 神经元是一种能够以简单的方式相互交流的细胞,自神经元发起的纤维突起,被称为轴突,与其他神经元进行连接,连接的“交叉点”被称为突触。在动物的神经系统中,神经元组成的网络是相互联系的:人脑大约有1000亿个神经元,人脑中的神经元通常有数千个连接。
- 神经元通过突触连接来接收电化学信号,并且根据接收的信号,产生输出信号,然后由其他神经元通过突触连接接收。关键的是,神经元接收到的输入有着不同的权重:有些输入比其他的更重要,有些输入甚至可能抑制神经元,阻止它产生输出。
- 神经元的每一个输入都呈激活和未激活两种状态,如果一个输入被激活,它就会通过相应的权重“刺激”神经元。
- 每一个神经元都有一个触发阈值,由另一个数字表示。感知器的运作模式是神经元受到的刺激超过了触发阈值T,那么它就会“启动”,这就意味着它的输出被触发。换句话说,我们把激活的输入的权重加在一起,如果总权重超过阈值T,则神经元产生一个输出。
每个连接所对应的权重值对于神经网络的运行至关重要,事实上,这就是神经网络分解下来的全部内容:
- 一堆数字列表。对于任何一个大小合理的神经网络来说,这个数字列表的长度都相当可观。
- 因此,训练一个神经网络需要用某种方式找到适当的权重值。通常的寻找方式是在每次训练以后调整权重值,试图让网络产生正确的输入到输出的映射。
深度学习的三个方面
- 网络具备“深度”,即多层结构。
- 神经元数量剧增。
- 在深层次网络中,神经元的连接数量也十分可观。
深度学习的成功因素
- 大型、维护良好的数据集。
- 计算能力。
- 杰夫辛顿,与纽约大学教授、Facebook人工智能研究院创建人燕乐存(Yann LeCun,1960—)以及蒙特利尔大学、微软研究院的人工智能战略顾问的书亚·本希奥(Yoshua Bengio,1964—)并称机器学习的“三巨头”,
复兴之路
- 神经网络最后的输出值是由所有流经它的连接路径汇集,然后把连接上权值的加权和放到激活函数中运算而来的,每一条路径上的神经元权值都会对结果产生难以估算大小的影响,各个神经元权值不能孤立分离开来训练。
- 但是如果每一组训练数据都牵扯到全部可能的路径组合的话,这里面涉及的计算量就太大。
- 多层感知机一般以“全连接前馈神经网络”(Fully Connect Feedforward NeuralNetwork),这种形式出现。
- 全连接前馈神经网络的结构如下图所示,其名字中的“前馈”(Feedforward)是指把若干个单层神经网络联在一起,前一层的输出作为后一层的输入,就构成了最基础的一种多层神经网络。
- 神经网络加上“前馈”这个定语,目的在于特别强调这样的网络是单向的、无反馈的,就是说位置靠后的神经元不会把输出反向连接到前面层次上的神经元作为输入。
- 而“全连接”(Fully Connect),是指网络中任意一个神经元与其上、下层的每一个神经元都有连接相连,“全连接”带来的主要好处是对网络的输入顺序并没有要求,打乱顺序输入也不会对输出结果产生影响
反向传播算法
- 它的工作原理是收取神经网络出错的反馈,这里的错误是在网络的输出层的输出(比如网络输入了一张猫的图片,而输出层将其归类为一条狗)。
- 反向传播算法将错误从输出端向输入端逐层逆向修正(算法也是因此而得名的)。它首先计算误差值(即输出的数据和期望得到数据之间的差值),在给定输入和输出的情况下,误差是一个和权重有关的函数,需要通过修正权重值使得误差值达到极小(即尽量减少误差)。
- 根据误差值能够得到等值线图,在等值线图上体现为最陡的下降路线,即为从当前的误差到我们期望的最小误差的方法。这个通过调整权重值来减少误差值,最终接近极小误差(即输出结果尽量接近期望输出)的过程被称为梯度下降。然后,调整完最后一层权重以后,逐级往前调整,以此类推。
深度学习时代
- 信息从“视觉细胞”到“中枢神经”再到“大脑”的流动过程,或许是一个分层迭代、逐级抽象的过程。
- 这里的关键词有两个,一个是“抽象”,一个是“迭代”,从原始信号输入开始,先做低级的抽象,逐渐向高级抽象迭代。
- 人类自己可以感知的逻辑思维层面,总是使用高度抽象的概念,可是人类的感知器官,接触的都是低级的具体的事物,通俗一点来说,我们的视网膜感知到的是像素的颜色、亮度等信息,但我们大脑中思考的是具体的物体和对象
- 深度学习的本质,就是一种逐层自动进行特征提取的机器学习方法
- “无监督”的意思即不需要人工参与特征的选取过程,这点才是深度学习的最大特点
- 神经网络最“神奇”的地方便是只需知道输入和输出便可训练网络参数,不需要弄懂中间有什么理论和规律,使用这种“端到端”(End-to-End)的学习方法,就能得到一个能够预测其他未知数据的“黑箱
- 输入数据:指那些包含了且仅仅包含了影响结果所有关键特征的数据
- 如果遗漏了关键特征,会导致预测结果误差不能收敛,如果掺入了无用的特征,又很容易会引起维度灾难,空耗运算资源
- 另一方面,由于“黑箱”的特点,决定了神经网络只能是对真实世界规律的一种拟合模型,目前在理论分析上并没有特别强的解释性。
- 这些天生的特点决定了以前的神经网络要完成建模,首先要做的特征选择、提取主要信息需依赖人的先验知识去完成。实际情况的确有一部分应用场景是能够通过人工来选择的
深度学习的优势
- 工业界把论文《通过神经网络进行数据降维处理》定性为深度学习的开山之作,不仅是因为它以多层神经网络为工具载体,引出了深度学习的概念框架,更是因为它清晰地描绘出了深度学习相对于传统浅层学习的两个很有价值也很具体的优势:
- 第一个优势是表示能力。
- 此前,包括单隐层神经网络在内的多种以分类、回归为代表的浅层学习算法,在有限样本和计算单元情况下,对复杂函数的表示能力仍显不足。
- 这里的表示能力不足,是指工程意义上的实践结论,虽然在纯理论上,“泛逼近性原理”(Universal Approximation Theorem)保证了仅需要单隐层的神经网络,就已经具有在封闭的实数域拟合任意函数的能力,证明了浅度的神经网络在“理论上”可以学习好任何函数,不过这个结论是以无穷无尽的神经元为支撑的
- 而辛顿所提出的具备更多隐层的神经网络,其表示能力将会更强,具体表现为更多的隐层的网络可以用更少的神经元节点来表示更复杂的目标
- 增加网络的深度,比增加单层的神经元数量对减少错误率帮助明显得多。
- 下图是生成式对抗网络的发明者伊恩·古德费洛(Ian Goodfellow, 1985—)所著的《深度学习》中的一张图片,古德费洛希望表明对某个特定问题,神经网络的深度越深,可以达到的拟合精确度就越高。人们已经在大量深度学习的任务中观察到了同样现象。
- 第二个优势,是在无监督学习方面
- 以单隐层神经网络为代表的浅层学习算法局限性在于特征选择过于依赖人类先验知识
- 深度学习能够自动找出关键特征的特性,是对应用神经网络解决机器学习问题的极大解放
- 卷积神经网络,在网络里设计若干个卷积层,每个卷积层识别一种特征,逐级完成从像素到线条、从线条到器官、从器官到物体对象的抽象升级,再通过大量的标注数据,训练使得每一个卷积层都能抽象出层次越来越高的特质属性,让神经网络能够逐步知道“这些像素能构成哪些线条?”
- 为了缓解深度神经网络难以训练的问题,辛顿设计了一种被他称之为“逐层预训练”(Layer-Wise Pretraining)的方法
- 利用无监督的训练方式去一层一层地训练每个层的权重初始值,实践证明,这比一开始完全靠随机初始化的方法的效果要好得多。
- 有了无监控学习逐层预训练方法的帮助,我们只需要在网络训练的后半阶段对机器进行干预,为更理想的结果添加标签,给成功的结果提供激励。逐层预训练虽然被实践证明运作得相当不错
现有神经网络的卡点
- 神经网络是否“越深度越强大”,这个问题的答案还不明确,但是,神经网络层次深度越高,训练难度越大
- 训练神经网络主要依靠迭代算法来优化,我们学习过的梯度下降优化算法,其基本思路是每次迭代都以梯度向量为指导,按照梯度方向和梯度的大小调整权值,逐步逼近,最后得到全局最优值,误差反向传播算法也属于梯度下降优化算法的一种特定形式。
- “梯度消失”问题是指从输出层开始,每经过一个隐层,指导更新权值的梯度向量就变小一些。这样,接近于输出层的权值更新相对正常,但在误差传播的远端,越靠近输入层的梯度会越小,网络权值更新就会变得越慢。当隐层层次深度特别深时,经过若干次传递以后,梯度已变为一个很接近于零的小数,导致这些隐层的权值几乎不会再发生改变,一直都等于网络初始化时赋予的权值。此时的深层神经网络模型,其实等价于只有后几层的浅层神经网络模型了。
- “梯度爆炸”问题则相反。如果每经过一个隐层,梯度向量都增大一些的话,这样在最接近输入层的那些靠前的隐层,每次权值更新都会发生很大的变化。这样轻则会使得训练无法稳定收敛,重则甚至会导致数据越界溢出。
- 根据误差反向传播算法,每个隐层的梯度值都是依赖它后面一层计算得出的,如此重复迭代。对于第一个隐层,它的梯度就依赖于其后所有层来计算。
- 辛顿确实曾经表示误差反向传播并不是自然界生物大脑中存在的训练机制,也不相信人类大脑是通过生物方式完成求导,通过梯度来调节神经元权重和激活阈值的。
- 大脑皮层中普遍存在一种称为“微皮层柱”(Cortical Minicolumn)的柱状结构。它像一颗胶囊一般把数百个神经元封装在一起,每个微皮层柱里的神经元都记录、处理相同特征的同一种信号。
- 由此看来,人类大脑并不是像经典神经网络一样由神经元直接连接的简单分层结构,而是具有更高的内部复杂性:先由神经元组成“微皮层柱”,再由“微皮层”柱组成“皮层柱”(Cortical Column),由小到大逐步复杂化。
深度神经网络
卷积神经网络
- 卷积”(Convolution)原本是数学的泛函分析中的概念,它是一种数学计算,信号变换中经常要使用到它。而在我们现在讨论的语境里,它是一种特征提取操作
- 卷积最初被引入神经网络,就是为了处理模式识别中图像特征提取的,它就像是一个漏斗,不断在图片中平移,从下层图像中筛选数据,这个“漏斗”(专业上称作“卷积核", Convolution Kernel)可以是各种形状的。
- 经过漏斗过滤后,筛掉了一些数据,但可以获得更高维度的特征。譬如漏斗从像素中找出边缘,从边缘中找出形状,从形状中找出物体,漏斗对数据运算处理,就像是人脑对物体分层抽象的过程。
- 这个过程在图片识别里很关键,无论是对缩减数据规模(譬如1000万像素的图片,以10×10的方形作卷积的话,下层节点规模可以缩小到10万)还是对提取特征都是极为有用的。
- 而“池化”(Pooling)的本质其实就是采样共享,譬如以颜色采样为例,采样区域中存在若干个像素,可能每个像素的颜色值都有少许差异,原本需要对应的若干个数字去存储它们的颜色,池化过程就是用同一个采样值(最大值或者平均值之类)来代替所有像素的颜色值,这样有多个像素共用一个颜色值,便能够降低数据量。
- 卷积神经网络可以处理大部分格状结构化数据。举个例子,图片的像素是二维的格状数据,声音序列在等时间上抽取相当于一维的格状数据,而视频数据可以理解为对应视频帧宽度、高度、时间的三维数据,现在这些领域的应用都离不开卷积神经网络,
循环神经网络(Recurrent Neural Network, RNN)
- 大多数的神经网络假设所有的输入和输出之间是相互独立的,不是一次输入到网络的数据也是互相孤立的,譬如前面介绍的卷积神经网络处理图片识别的过程中,每一个相同颜色的像素、相同大小形状的线条或者色块、相同部件或者对象所代表的含义是相同的,与时间和顺序无关。
- 但是有另外一些场景,譬如最典型的使用神经网络做自然语言处理方面的应用,不同语种之间的机器翻译、语言理解等,相同词语出现在不同的时间、上下文里,它所代表的含义是不一样的
- 循环神经网络之所以会被称作“循环”(Recurrent),是因为它对输入的序列中的每个样本都执行相同的操作。循环神经网络的输出结果,是基于以前的输出进行计算的,同时也会参与到下一轮循环作为计算输入。
- 可以把循环神经网络理解成给神经网络中间的隐层增加了一个“反馈环”,这便相当于增加了一个拥有存储功能的辅助学习器,它对到目前为止所计算过的序列拥有一定的记忆能力。这个“反馈环”是循环神经网络的核心内容,被称作“循环连接”(Recurrent Links)
- 循环连接把隐层神经元的输入和输出连接起来,使得隐层输出端也作为输入的一部分,重新进入到神经网络中。如果展开(Unfold)循环神经网络,可以将之视为一批所有层共享同样权值的深度前馈神经网络。
- 由于循环连接的存在,经过循环处理的部分,和直接去增加网络隐层深度,在形式上是差不多的,所以梯度不稳定问题曾经是循环神经网络面临过的最苦恼的挑战,使得循环神经网络不得不设计成在有限轮次后就必须打断循环,以避免梯度不稳定,这便是短期记忆效应的来由。
- 人们研究出了各种循环神经网络的变体,其中最重要的是“长短期记忆网络”(Long Short-Term Memory, LSTM),用于解决长期及远距离的记忆依赖关系。
- 长短期记忆网络通过引入“门结构”(Gate)和一个明确定义的“记忆单元”(Memory Cell)来尝试克服梯度消失或者梯度爆炸的问题。
- 它允许向单元状态中移除或添加信息,通过门限结构对信息进行管理,把短期记忆的内容也保留下来。后来,进一步还发展出了“门控循环单元”(Gated Recurrent Units, GRU)等其他长短期记忆网络的变体形式。
- 今天,循环神经网络已经广泛应用于语音分析、文字分析、时间序列分析。
- 如果主要解决的问题就是数据之间存在前后依赖关系、有序列关系,现在一般首选长短期记忆网络。
生成式对抗网络
- 需要训练两个网络:一边是生成网络,用于生成图片,这个网络最开始是完全随机的,产出的结果自然也是毫无规律,生成网络一般是用“反卷积神经网络”(Deconvolutional Networks, DN)来实现。
- 另外一边是判别网络,用于判断生成网络中产生的图片是真的符合要求的数据还是伪装的数据,一般就是用卷积神经网络来实现,使用卷积和反卷积来作为判别、生成网络的生成式对抗网络也被更进一步地称为“深度卷积生成式对抗网络”。
当前24种常见的神经网络类型和它们的用途简介
挑战与反思
- 深度学习就是一种数据驱动的算法,大量的数据是建立精确模型的前提和保证。就像人类需要从经历中总结经验学习和提取信息一样,人工神经网络也需要大量的数据来分析、提取和训练。
- 越复杂越强大的模型就需要越多的参数,同时也意味着需要更多的数据来支撑。如果我们要训练一个语音识别程序,势必就需要不同方言、不同长度的语音数据以及人口数据,并将这数以亿万计的数据送到深度神经网络中,经过漫长的训练和调优后才能得到实用化有商业价值的语音识别程序。
- 处理大量数据的同时,也决定了机器必须拥有处理庞大数据的能力。为了缩短训练的时间提高效率,现在训练深度神经网络通常会使用多卡高性能GPU来配合工作,甚至是超算中心来完成。
- 计算机向人脑学习智能,要有跨越式的突破,关键点大概也不会在于模仿得多么接近人脑结构,而是最终能够发现其中的理论基础,目前神经网络效率不高,就是没有理论基础去指导优化的一种外在表象。
- 图灵提出“学习机器”的概念的论文里表达的观点十分明确,可以简单归纳为一句话:“计算机可以思考却不需要和人类一样地思考,计算机能够学习却不需要和人类一样地学习。”
- 图灵认为计算机应该凭借它的快速、精确、可复制等优势特点,扬长避短地找到通向智能的道路,而不必受到生物结构的牵绊。
- 随后兴起并长期占据人工智能研究主流思潮的符号主义学派的观点是直接继承自图灵,最初,整个科学界都是很认可这种观点的,这造就了符号主义学派的快速崛起,但是,历史事实证明了哪怕是当时最保守的学者都仍然是严重低估了机器通过逻辑演绎去实现人工智能的难度,经过一系列尝试与挫败之后,人们终于不得不承认基于符号和规则的机器学习所能处理的实体和规则数量。
- 基于仿生和连接主义来获得学习能力,其中最主要的不足是现在人类自己都没搞清楚自己的大脑是如何思考和学习的,所以让计算机去模拟人类大脑思考这件事情的基础本身就不太牢靠。
- 如果说连接主义在算法实现这种微观方面还有一些严谨的推理过程的话,那它在宏观上是没有太严密的理论支撑的。譬如现在许多应用案例中,用神经网络来做自动驾驶或者人机对弈,那这些应用各需要多少层的网络,初始连接权重值如何配置,模型如何训练、模型或者网络拓扑结构应该怎样设计等都没有一个最优准则,现在还处于主要是凭经验和试错来实现效果的原始摸索阶段。
- 对于神经网络,我们知道了模型的参数,也知道了输入的数据以及如何将这些连接成网络的方式,但是我们却还无法知道它是如何实现这一过程的。
- 神经网络就像一个神秘的“黑箱”,它有十分神奇的功能但是我们对它如何工作如何推演的过程却无从知晓,这就是常说的神经网络的“不可解释性”。神经网络的不可解释性阻碍了这一技术的抽象和总结,限制了高水平认知智能的研究和发展。
- 同时神经网络的操作对于人类来说太过抽象,我们无法很好地验证它的工作过程是否合理,但是有一点是可以肯定的,现在的神经网络并不符合人类一贯的科学直觉。
通往有意识的机器之路
争辩一个计算机系统是否“真正”理解,这是没有意义的。 只要事实上它所做的事情与理解中文的人类所做的事情毫无区别,即可。
意识与心理
- 意识的头脑只不过是我们身体产生各种行为的一种毫无意义的副产品,这一理论被称为副现象论。
- 如果有意识的心灵是一种副产物,那么你的意识就不再是如柏拉图所说的,掌控缰绳的马车夫。它只是一个坐在车上的乘客,幻想自己是马车夫而已。
- 也有稍微中立一些的观点,认为意识并不像柏拉图说的那样在我们的行为中起主导作用,而是我们大脑进行其他活动过程中以某种方式产生的——大概是一些在低等动物大脑中不存在的过程。
- 心理状态——诸如信念、欲望等归因为实体,然后使用与心理状态有关的常识去预测实体将如何行动,假设它根据自己的信念和欲望做出选择。
- 心智理论能力是一种实际的、常识性的能力,成熟的成年人拥有这种能力,能够对自己和他人的精神状态(信念、欲望等)进行推理。
- 人类并不是天生就拥有心智理论能力的,但临床上正常的人类天生就有发育它的能力。
- 4岁的时候,儿童基本上能够进行包括他人的态度和观点在内的推理。
- 到了青少年时期,心智理论能力就得到了充分发育。
大脑与社会
- 和灵长类生物大脑体积关系最密切的因素是平均社会群体规模,即灵长类生物社会群体中动物的平均数量。
- 这就表明,灵长类生物需要更发达的大脑来成功维持庞大的社交群体,更准确地说,是寻找、维持和利用群体中的社会关系。
- 社会生物的属性与我们使用意向立场密切相关,理由是它似乎能够让我们理解和预测社会中其他智能体的行为。
- 当我们身处复杂的社会关系中,会陷入更高层次的意向思维中,于是个体的计划(不管是我们自己还是我们观察到的人)会受到其他智能体行为的影响,这里的行为可以定义为可预期的有意识的行为。
- 因而很明显,意识思维在人类社会中普遍存在,我们也依靠它进行社交。
邓巴研究了人类和其他动物的大脑体积与高阶意向推理能力之间的关系。
- 结果表明,高阶意向推理能力大致上是大脑额叶相对大小的线性函数。
- 由于大脑的体积与社会群体的大小密切相关,因此,对于大脑自然进化的解释是为了满足在复杂社会体系中对社交推理(高阶意向推理)的需要。
- 无论是集体狩猎、与敌对部落战斗、追求配偶(或许包括击败对手),或是获得对盟友的影响力和领导权,理解和预测别人想法的价值不言而喻。
当我们不了解一个实体的内部构造时,意向立场是最适用于解释它的。
- 意向立场提供了一种独立于内部结构和操作(例如,它是人、是狗还是一台机器)来解释和预测行为的方法。
- 如果你是一个理性的智能体,有保持干爽的愿望,并且相信正在下雨,那么我可以解释和预测你的行为,而不需要了解你的任何其他信息。
以高阶意向性形式表现的社交推理似乎与意识相关。
- 社交推理的进化足以支持复杂的社会网络和大型社会群体。
- 但为什么社交推理需要意向性呢?
- 我的同事彼得·米利肯(Peter Millican)提出,答案可能恰恰在于意向立场的计算效率。
- 如果我有意识地利用自己的功能性动机——以欲望、信仰等形式,并且能够把自己想象成别人,那么这就使得我能够比其他人更有效地预测他们的行为(在实际情况和想象的情况下)。
有意识的AI:
- 它被放在一个需要有意义的、复杂的高阶意向推理的场景中进行学习;
- 或者是一个需要智能体说出复杂谎言的场景,这也意味着需要高阶意向推理能力。
- 又或者是在一个场景中,智能体学会了交流,并且能够有意向地表达出自己和其他实体的意识状态。
- 我认为,如果一个人工智能的智能体系统能够学会有意义地去做这些事情,那就是通往有意识的机器之路。
机器人与其合理性
- 哲学家托马斯·库恩(Thomas Kuhn)在其1962年出版的著作《科学革命的结构》一书中指出,随着科学认知的发展,有时候旧有科学体系会面临全盘崩溃的危机,新的科学体系诞生,取代传统的、既定的科学体系,这就意味着科学的范式将发生变化。到了20世纪80年代末期,专家系统兴盛的时光日渐式微,一场新的人工智能革命悄然临近。
- 这一次,被动摇的不仅仅是专家系统的根基——“知识就是力量”学说,更是自20世纪50年代以来支撑人工智能,尤其是符号人工智能发展的基础设定。说来有趣,在80年代末期,对人工智能领域批评得最激烈的人士,恰好是来自该领域本身。
布鲁克斯革命
- 布鲁克斯提出了三个关键原则,确定了他的理论体系:
- 首先,他确信,人工智能要取得有意义的进步,只能通过与现实世界中的系统互动来实现——它们必须直接处于某个现实环境,感知并与之互动。
- 其次,他认为,不管是以知识还是以逻辑为基础的人工智能,清晰而全面的知识储备及推理并不是它们智慧行为产生的必要条件,尤其是以逻辑为基础的人工智能。
- 最后,他认为,智慧是一种涌现性质,来源于实体与它所处环境发生的各种交互行为。
- 人工智能研究者一直致力于制造能够在理论上做出最佳抉择的机器,而不是实践中的最佳决策。因此,当时出现了另一个关键性的研究主题,即人工智能系统所处的环境和它所表现的行为之间,应该存在一种紧密的耦合关系。
- 我们真正想要智能体做的是最正确的选择,至少尽可能做出最好的选择。因此,人工智能开发的目标从构建做出跟人类一样选择的智能体转向做出最优选择的智能体。
基于行为的人工智能
- 人工智能的新范式被称为基于行为的人工智能,正如我们接下来要讨论的,它强调了特定的个体行为的重要性,这些行为有助于智能系统的整体运行。
- 包容式体系结构的方式组织。包容式层次的结构决定了行为的优先级,层次结构中的组件行为越靠近底层,就拥有越高的优先级。
- 然而,一旦基础行为数量太多,就很难设计出行为系统,因为理解各个行为之间可能存在的相互作用会变得非常困难。使用基于行为的方法构建系统是一门类似于黑魔法的艺术——真想知道这个系统是否实用,唯一的方式是构建出来并使用它,这种实践方式不仅昂贵、耗时,而且不可预测。
- 另外,使用基于行为的方法构建的解决方案,虽然能够针对某个非常具体的问题提出精准有效的方法,但从中所积累的经验,很难应用到新问题上。
基于智能体的人工智能
- 人工智能研究的焦点再一次转移,从专家系统、逻辑推理机等脱离实体的系统转向构建智能体(Agent)。
- 智能体指的是一个完整的人工智能系统,它是一个独立的、自主的实体,嵌入某个环境之中,代表用户执行特定的任务。一个智能体应该能提供一套完整的、集成的能力,而不仅仅是类似逻辑推理那样孤立的、脱离实体的能力。
- 所谓的智能体应该具备以下三种特性:
- 首先,它们必须反应灵敏,必须迅速适应自己的环境,并且能够在环境变化中适时地调整自己的行为;
- 第二,它们必须积极主动,能够系统地完成用户赋予它们的任务;
- 最后,智能体需要有协作性,即在需要的时候能够和其他智能体合作。人工智能的黄金年代强调的是积极主动,即计划和解决问题;而基于行为的人工智能则强调反应灵敏的重要性,体现在适应所处环境并与之协调。
- 当今几乎所有的人工智能系统中,都有一个数字收益模型,代表用户的偏好,并且系统将根据这个模型努力使预期效用最大化——代表用户理性决策。
贝叶斯定理:
- 贝叶斯推断的重要性在于为我们提供了处理不完美数据的正确方法:我们既不丢弃数据,也不全盘相信它是正确的。我们利用它来更新机器人的信念库,通过概率来确定信念库的正确性
- 为了捕捉数据间的相互关联,人工智能研究人员开发了贝叶斯网络,简称贝氏网络,即用图像化的方式来表达数据之间存在的相互关联。
- 到了20世纪90年代末,智能体范式已经成为人工智能中的主流正统理论:我们构建智能体,并赋予它们用户的偏好,智能体用理性的方式代表用户去做执行工作,使用如冯·诺依曼和摩根斯坦的预期效用理论之类的理性方式作为决策基础。智能体使用贝叶斯推断理性地管理它们对世界的信念库,通过贝叶斯网络或者其他方式捕捉对世界的理解。如果存在多个智能体,我们会借助博弈论来提供决策框架。
人工智能与社会变革
- 晶体管是计算机处理器的基础组成单元。芯片上的晶体管越多,芯片能够处理的工作量就越大。摩尔定律指出,半导体固定面积上的晶体管数量大约每隔18个月就会翻一番。按照摩尔定律,计算机处理器的功率每隔18个月就会提升一倍。计算机处理器的能耗会以同样的速度降低,处理器本身的体积也会逐渐缩小
- 机器人三定律:
- 机器人不得伤害人类,也不得因为不作为而让人类受到伤害。
- 机器人必须服从人给予它的命令,除非该命令与第一定律冲突。
- 机器人在不违反第一、第二定律的情况下要尽可能保证自己的生存。
“尽可能保持其他条件不变”的想法:
- 如果我们让人工智能系统做一些事情,是希望它完成任务的同时,保持其他一切尽可能不发生变化。因此,当我们发出“避免我的房子被盗贼入侵”指示时,我们的意思是“避免我的房子被盗贼入侵,同时尽可能使房子的其他一切保持现状”,而不是一把火把房子烧掉避免入侵。
- 解决这些问题的核心都是让计算机理解我们真正想要的是什么。逆向强化学习就是针对这一问题展开的,我们在第五章了解了常规的强化学习:智能体在某种环境中行动,并获得奖励。强化学习的目的是找到一个行动过程,最大限度地获取奖励。
- 在逆向强化学习中,我们首先确定了“理想”的行为(即人类会怎么做),然后再制定人工智能软件能获得的相关奖励。简言之,我们是将人类的行为视为理想行为的典范。
劳动价值:
- 人类的劳动被系统地简化为那些不能被机器或软件自动化的任务,工人被细致地监控和监督着,没有创造力、没有创新性、没有个性,甚至没有思考的空间。
决策
- 系统侵蚀了人类判断的地位。对一个人做出重大影响的决策者是人类,比起别的东西,更让人感觉自在。毕竟,我们享有基本的人权,例如接受同侪审判的权利,而这项权利来之不易,理应受到高度重视。
- 应该全面周到地考虑过这款软件可能面临的各类问题。并不是所有开发者都有如此丰富的经验,或者会如此深入思考。因此,令人担忧的是,代替人类做决策的系统,是否在开发环节考虑得足够谨慎和全面。
偏见
- 计算机不过是执行指令的机器而已,它怎么会存在偏见呢? 因为机器最重要也是单一的获取信息途径是数据,偏见就是通过数据引入的。机器学习程序使用数据进行训练,如果数据本身就存在偏差,那么程序也将学习数据中隐含的偏见,而训练数据本身就可能存在不同程度的偏差。
- 偏见本来就是人工智能中存在的问题,对女性而言,这个问题更具有特殊性。因为新的人工智能系统建立在有着强烈男性偏见的数据基础上,而建造新人工智能系统的团队压根没注意到这一点,因为他们自己也有男性偏见。
乐观
- 新技术主要改变的是我们的工作性质。大多数人不会被人工智能系统取代,反而使用人工智能工具可以让我们在工作中变得更高效、更优秀。
- 这就巧妙地为我们引入了全民基本收入的概念:即社会上的每个人都应该获得一定的保障性收入,不管他们是否工作,也不需要任何考核或者测试。全民基本收入并不是一个新出现的概念,但最近的技术发展,特别是人工智能的发展,使它重新成为人们关注的焦点。有一种设想,人工智能/机器人/自动化技术将创造足够的财富,使得全民基本收入成为可能(因为机器可以完成工作),以及必要(因为,在这种设想下,人们可能没有工作了:机器把人类的工作机会夺走了)。