言语是人类表达交流和思想的重要工具。通过言语,人们可以沟通、表达、创作。日常生活中使用的言语称为自然言语,涵盖词汇、语音、语义和语法等多个方面。而计算机程序中使用的言语则称为计算机言语,主要由数字、字符及语法规则组成。
人类的自然言语有多种语种,分属不同的语系,而计算机言语根据编写规则的不同也分为多种类型。人类通过言语展现的语言智能被认为是人类智能的一部分。计算机具备识别计算机言语、运行程序、执行操作的能力,可以被视为一种后天赋予的智能形式。如果计算机能够理解自然言语、实现翻译、理解和执行命令,甚至进行对话,是否可以认为计算机具有与人类相似的语言智能?本文将探讨这一问题。
自然言语指的是人们日常生活中使用的语言,用于表达想法、交流信息和描述事物。自然言语作为载体,承载着词汇的内涵。不同语言之间可以对应和翻译。每种语言都是一个包括词汇、语法和语音的系统,遵循语法规则进行表达。乔姆斯基曾指出,掌握某种语言的人都掌握了该语言的规则系统,这套系统以确定的方式为无数可能的句子分配声音和意义。然而,使用者往往并不意识到自己掌握了这些规则或正在应用这些规则。
自然言语的学习基于生活和社会互动。儿童通过大量对话接触词汇和句子,逐步掌握语句模式,进而掌握语法。自然言语的学习是从语义到语法的过程。乔姆斯基等人认为人脑中存在一种天生的普遍语法,这使自然言语的学习具有天赋论的基础。乔姆斯基试图解释语言研究与人类本质的关系,认为语言反映了人类心智的过程,并影响思想的各个方面。
自然言语系统具有波动性和变动性。在一种语言存在的前提下,其词汇和基本语法是稳定的,但在使用过程中,受到时代和环境的影响,语言会不断发展变化。
计算机言语则是按照规定语法规则使用数字和字符编写程序,使得计算机能够执行各种任务。计算机言语包括机器语言、汇编语言和高级语言等。在不同的程序设计模型中,字符和语法规则构成的语句按照指令执行操作。计算机语言的设计初衷是为了让人更好地控制和操作计算机。计算机的所有动作和步骤都是通过计算机语言编写的程序来执行的。
计算机语言是人机对话的媒介。计算机语言可以在结构中识别并翻译自然语言,执行操作并输出结果。在执行操作时,计算机首先要理解人的输入命令,将自然语言转化为计算机语言,再通过编译操作将程序源代码翻译成目标代码。可以说,计算机语言在人机合作和对话中起着关键作用。
自然言语的使用中,歧义和模糊不可避免,各种语言之间的翻译也存在误解和偏差。为了消除这些歧义和模糊,学者们创造了形式化的语言。形式化语言旨在建立一套通用的符号系统,以消除歧义。通过这种语言,可以将所有推理过程转变为精确的演算。逻辑学家试图用形式化系统和符号准确描述自然语言所描绘的世界,以更精确地进行推理、分析和判断。
自然语言可以视为一套符号系统,其中词汇是表达观念的符号。自然语言的逻辑不仅体现在语法结构上,还体现在语义之中。有些词汇的歧义和模糊在语法中难以判断,但可以通过上下文和语境来解决。维特根斯坦认为,自然语言是用来表达对象的,命题或语句的意义来源于它所表达的对象。我们学习语言的过程就是掌握词汇与对象之间的联系。我们不能从一个孤立的词获得意义,而是通过关联和活动来理解。因此,自然语言在特定环境和规则下才具有意义。
自然语言的逻辑比形式化语言多一个维度。自然语言是人类心智的一部分,其中蕴含的心智逻辑是人类独有的能力。自然语言的学习不仅依赖于语言的逻辑结构,还需要心智的参与。机器使用的计算机语言也是一种形式化语言,它是由人类预先赋予机器的。计算机在理解和执行命令时,需要将自然语言转化为计算机语言,再进行程序操作。将自然语言的形式化描述对于计算机程序的机械模拟至关重要,但理解模拟不同于机械模拟。机械模拟涉及的是形式特性,而理解模拟涉及的是准语义特性。
计算机在消除歧义过程中需要大量的知识,包括语言学知识(词法、句法、语义、上下文等)和关于世界的一般认知。这也构成了当前自然语言处理的两大难题。从自然语言的角度评估计算机语言,高度形式化使其对语境的描述能力有限,无法像自然语言那样传递多层次信息。尽管形式化语言在准确性上有优势,但在语境塑造能力和表达力方面显然不如自然语言。自然语言的理解中,词汇如何与句法结构相结合形成句子的意义,这是形式化语言很难完全描述的,这也是计算机识别自然语言时产生错误的重要原因。随着语料库建设和语料库语言学的发展,自然语言处理技术引入了统计数学方法,逐渐减少了错误。
自然语言不仅是表达工具和思想媒介,它与心智密切相关。心智是智能的一部分,包括感知、记忆、学习、理解、创新等能力。心智能力包括对自然语言的理解。在日常生活中,使用自然语言时,可以同时获得关于描述对象的声音、形象和内涵。我们在日常生活中听到别人描述一件物品或看到别人指称某个对象时,会记住该物品的名称,并在今后再次指称该物品时说出相同的词汇。我们还能从别人的语音、动作、表情和眼神中体会到语句中的情感和感受。也就是说,自然语言中的词汇意义不仅限于单词本身,还包括指称对象的形象、声音以及讲述者的意图和当时的情境。自然语言的意义在社会交往和对话中完全体现出来,对这些意义的全面把握需要心智能力。
自然语言的学习也是心智能力的一个体现。以乔姆斯基为代表的心智主义者认为,语言和语法结构是人类心智的本质和特征。无论个人经历和能力如何不同,人们都会按照极为相似的方法完成语言系统的构建任务。我们的心智中先天就拥有认知结构和语言能力,在后天的运用中逐渐强化对语法规则的掌握。“在某种程度上,我们不是在学习语言,实际上是语言在我们的心智中成长。”
与乔姆斯基不同,哲学家蒯因的语言理论基于经验主义和行为主义的立场。他认为语言之所以能够表达意义,是因为行为习得的结果,人们在语言行为中表现的心智能力也是逐渐后天习得的。掌握和运用语言的心智能力是后天的,并且可以通过训练得到强化。在蒯因看来,我们掌握语言的能力来源于公共知识,是一种人类共同经验知识背景的传承,而非先天存在。
如果按照乔姆斯基的观点,赋予一台智能计算机的初始内在可以视为它的后天“心智”,尽管这种心智是人为赋予的并且是不完整的。如果按照蒯因的观点,计算机在被构造的前提下已经获得了知识背景,并且能在学习中不断强化语言能力,似乎意味着它有可能在强化学习中获得真正的智能,包括与人相当的自然语言能力。
在人工智能领域,图灵测试是一个著名的测试,如果一个人与一台机器进行足够长时间的对话,而无法区分回答是来自机器还是人,那么就可以判定这台机器具有智能。图灵设想中的智能计算机的主要能力是对语言的理解和运用能力。测试将机器是否具有智能定义为几个方面:能否回答输入的问题,能否解释词语的意义,能否理解由词语组成的句子,能否将一种语言翻译成另一种语言。语言能力是判断计算机是否具有智能的重要标准,甚至可以说,从图灵测试的机制来看,语言能力可以等同于智能。
如果智能必然需要掌握语言能力,那么人类使用的自然语言虽然存在模糊和歧义,但表达能力却强于形式化语言。计算机若要具备真正的智能,必须具备在不同语境中理解自然语言的能力。然而这一能力在现有技术中几乎是无法实现的。德雷福斯在其著作《计算机不能做什么》中提到,机器要获得智能,其中一个难点就是要处理语言中的歧义问题。尽管现在已有强化匹配搜索和大数据的支持,自然语言的歧义问题表面上得到了部分解决。然而,如果我们按照人类使用自然语言的方式,真正理解并运用一门语言,除了需要掌握必要的推理规则(包括专家知识推理和常识推理),还需要具备对上下文环境的理解和领悟能力。有了这样的能力,才算是具备心智,拥有智能。
在讨论机器智能与心智时,许多研究者都希望从人类智能的产生和结构中获得启示。从简单发育到复杂思考,人的智能看似有规律可循,但即使是最简单、最低级的智能,也涉及千万脑细胞和肌肉细胞的大规模协同工作。这些简单的行为内嵌了太多智能,都是日常讲话和行为中不易察觉的深层次心智能力。语言智能是其中之一,当我们考虑语言机制的起源及其在人类智力突飞猛进过程中的角色时,至少会出现两个基本问题:一是最小的承载意义的元素的核心语义内容,包括最简单的基本元素;二是允许符号有限制组合的原则。如果我们希望通过分层渐进地分析人类心智产生的生理结构和逻辑结构,尝试在模拟这种结构中赋予机器以心智,那么必然会面临两个困境:一是人的大脑是一个无法完全掌握的黑箱;二是心智作为一个没有实体但确实存在的东西,对技术来说是不可捉摸的存在。
从心智主义的立场来看,计算机不可能拥有与人类相同的心智能力,尽管它可以通过技术进步获得更加精细准确的自然语言处理技术,在操作执行中表现得可以听懂自然语言的所有指令。从行为主义的角度来看,如果一台机器表面具备与人类相同的语言能力,可以理解并表达自然语言,似乎可以认为它是具有心智的机器。然而,自然语言和形式化语言相互转换中不可避免的问题,也预示了由行为主义出发的模拟不可能完全与人相同。
随着技术的发展,计算机能够处理的自然语言文本量不断增加,面对海量信息的文本挖掘、信息提取、跨语言信息处理和人机交互等需求,计算机的自然语言处理研究也在不断推进。然而,自然语言在描绘和表达中具有指向性和逻辑性,传递并承载了文化。这意味着自然语言不仅仅是词汇符号的组合,与形式化语言不同,自然语言虽然也在一定的逻辑语法下使用,具有沟通、交流、表达、创造等功能,但还具有文化属性。一种语言的习得不仅包括语词和语法规则的运用,还包括对该文化的理解和认同。在这个层面上,现有的智能机器无论在自然语言处理上达到何种程度,都无法拥有真正的智能。因此,我们可以将自然语言的正常运用视为证明其他生物具有与我们相同心智的明确经验性证据,但不能将其视为心智与人类能力的来源的判断性证据。
笛卡尔曾说“语言是人类思想的核心标志”,意即语言能力和人的思想能力密不可分,并且语言能力是人类心智的表征。他还提出,人类心智的两个重要能力——理解力和意志——是机器(自动机)无法完成的。因为心智没有实体,自动机无论如何模拟表层结构,都无法创造出心智。笛卡尔的预言虽然缺乏充分论证,但结论依然正确。语言的运用、表达和创造是人类智能的重要内容。如果未来的智能机器将拥有与人类相同甚至更强的智能,那么它必然掌握与人类语言能力相当的理解和运用能力。这在现有的计算机语言层面是不可能实现的。至于未来机器能否通过新的突破性技术学会“外语”,那将是另一个问题。