20世纪90年代初,统计方法引发了人工智能(AI)领域的革命,并在2000年代达到了顶峰。神经网络在当时演变为现代深度学习(DL),并且影响了AI的各个分支。尽管深度学习在自然语言处理(NLP)领域最为人所知,但它仍然推动了经验主义的转变。
在NLP中,数据驱动的经验方法之所以流行,是因为传统的符号和逻辑方法未能创建可扩展的系统。因此,经验方法,包括基于语料库的统计和机器学习方法,逐渐成为主流。
这种经验主义的转变主要是因为,在我们深入了解语言的本质和实际应用之前,经验和数据驱动的方法可以帮助我们开发实用的文本处理工具。正如EMNLP的先驱之一肯尼思·丘奇(Kenneth Church)所指出的,NLP中的数据驱动和统计方法并不是暗示语言就是这样运作的,而是强调“做简单的事情总比什么都不做好”。
丘奇认为,这种转变的动机被误解了,人们认为“可能大致正确的”(PAC)范式会扩展到完全自然的语言理解。实际上,新一代NLP研究者在语言学和NLP的理解上存在差异,导致了对“大语言模型”(LLM)的过度依赖,这需要巨大的计算资源,并试图通过记忆海量数据来实现自然语言理解。这几乎是徒劳的尝试。我们认为,这种做法不仅浪费时间和资源,还引导新一代年轻科学家认为语言只是数据。更糟糕的是,这种方法阻碍了真正的自然语言理解(NLU)的进步。
相反,现在是重新思考NLU方法的时候了。我们确信,“大数据”方法不仅在心理上、认知上和计算上难以操作,而且这种盲目的数据驱动方法在理论上和技术上也存在问题。
虽然自然语言处理(NLP)和自然语言理解(NLU)经常互换使用,但两者之间存在巨大差异。认识到它们之间的技术差异有助于我们理解数据驱动的机器学习方法。尽管机器学习可能适用于某些NLP任务,但它们与NLU关系不大。
常见的NLP任务包括:
上述任务大多符合“可能大致正确”(PAC)范式,评估标准较为主观,缺乏客观标准来判断哪个系统更好。然而,语言理解不允许任何误差,需要全面理解一个话语或问题中传达的唯一想法。
例如,对于“我们有一个退休的BBC记者在冷战期间驻扎在一个东欧国家吗?”这样的问题,某些数据库可能只有一个正确答案。因此,将这些问题转化为结构化的查询语言是一个巨大的挑战,因为任何错误都会导致问题。
这种理解涉及到多个层面的推理,包括对特定术语的准确解释、地理和时间限制的综合考量。这些功能必须绝对正确,而不是“可能”或“大概”正确。
总之,真正的语言理解与简单的文本处理是两个截然不同的问题。在文本处理中,我们可以接受近似正确的结果。这表明NLP与NLU的不同之处,以及为什么NLU对机器来说非常困难。那么,NLU为何如此困难?
NLU困难的核心在于“缺失文本现象”(MTP),这是一种在日常交流中高度压缩语言的现象。演讲者将思想编码为话语,听众则解码这些话语,还原出演讲者意图传达的思想。解码过程必须完全准确,否则会导致理解偏差。
这种通信可以通过两种方式优化:演讲者可以简化信息,减少听众的工作量,或者听众可以做更多的工作来解码信息。然而,这会导致信息丢失,使得NLU变得更加困难。机器不知道我们省略了什么,也不知道我们都知道什么。
最终结果是NLU非常困难,除非能够“整理”出我们话语的所有含义,否则软件程序将无法完全理解我们话语背后的思想。NLU的挑战在于解释或揭示缺失的信息,这需要隐含的背景知识。
上述讨论表明,机器的自然语言理解由于MTP而变得困难,因为日常口语被高度压缩,理解的挑战在于未压缩或发现缺失的文本。
机器学习(ML)和可压缩性之间存在数学上的等价性,这意味着只有在数据高度可压缩时,机器才能从数据中学习。然而,MTP现象告诉我们,NLU需要解压缩,而非压缩。因此,ML方法与NLU不兼容,因为它们试图发现将大量数据概括为单一函数,而不是发现所有缺失和隐含的文本。
ML本质上是基于在数据中找到模式的一种范式。然而,简单的统计分析无法捕捉语义。例如,反义词如“小”和“大”在统计上等效,但在语义上却完全不同。因此,统计分析无法建模语义,甚至不能近似。
在机器学习/数据驱动的方法中,没有类型层次结构,因此无法对“包”、“手提箱”、“公文包”等进行概括性陈述。每个模式都必须在数据中单独“看到”,这在计算上是不可行的。因此,统计方法无法捕捉语义。
逻辑学家们长期以来一直在研究语义概念,试图用语义三角形解释“内涵”。每个“事物”(或认知对象)都有三个部分:一个符号、符号所指的概念以及概念的具体实例。然而,概念与实际实例不同,因此在认知中,内涵和外延不能混淆。
语言中充满了内涵现象,因为语言具有不可忽视的内涵。然而,机器学习/数据驱动方法只关注外延,而忽略了象征性和结构特性,因此无法模拟各种内涵。神经网络纯粹是外延的,无法表示内涵,这也是它们容易受到对抗性攻击的原因之一。
本文讨论了三个原因,证明机器学习和数据驱动方法甚至与NLU无关。人类在传达自己的想法时,实际上是在传递高度压缩的语言表达,需要用大脑来解释和揭示所有缺失但隐含假设的背景信息。
语言是承载思想的工具,因此在构建越来越大的语言模型时,机器学习和数据驱动方法试图在尝试找到数据中甚至不存在的东西时,徒劳地追逐无穷大。我们必须认识到,普通的口语不仅仅是语言数据。