在 DeepMind 主办的 Deep Learning Indaba 2018 峰会上,多位自然语言处理(NLP)领域的专家接受了采访,分享了他们对 NLP 当前状况、面临的主要挑战以及未来发展趋势的看法。
此次会议的核心议题集中在几个关键问题上,其中包括自然语言理解、低资源语言的 NLP、大型文本或多文档的推理以及数据集、问题和评估方法。其中,自然语言理解被认为是 NLP 领域最大的挑战之一。
自然语言理解
专家们普遍认为,自然语言理解(NLU)是实现真正意义上智能系统的最大障碍。现有的技术大多停留在模式匹配阶段,而未能达到真正的理解水平。Kevin Gimpel 提到,构建能够像人类一样理解和处理文本的系统是当务之急,而不是单纯提高模式匹配的能力。
固有偏置与从头学习
专家们对于如何在模型中加入适当的偏置项和结构展开了讨论。有人主张模型应具备学习常识的能力,而另一些人则认为应通过嵌入理解模块来实现这一目标。David Silver 提出,未来模型可能会自主学习一切,包括算法和特征,但现阶段仍需依赖人工设计的模块。
程序合成
Omoju Miller 建议可以从程序合成的角度出发,基于高级规范自动生成程序,从而解决 NLU 的问题。她还提到,结合传统方法和统计方法,或许有助于推断常识属性,如判断汽车是否是交通工具。
具身学习
Stephan Gouws 认为,人类通过与环境的互动学习语言,因此在构建模型时,应考虑利用结构化的数据源和知识库。虽然完全实现具身智能体面临巨大挑战,但可以通过模拟环境和多模态数据逐步接近这一目标。
情感
Omoju 认为将人类情感融入模型非常困难。Stephan 提出,图灵测试表明,即使不具备真实情感,智能体也能通过模仿行为欺骗人类。因此,可以探索无需具备情感的解决方案,但仍能理解人类情感。
认知与神经科学
认知科学理论,如皮亚杰的认知发展理论,为构建模型提供了灵感。跨学科研究的重要性得到了专家们的广泛认同,这有助于推动 NLP 技术的进步。
低资源语言的 NLP
专家们探讨了在低资源语言背景下进行 NLP 的可能性。尽管面临数据稀缺的挑战,但已有不少方法被提出,如通用语言模型和跨语言表征。Bernardt 认为,通过跨语言模型,可以在低资源语言中实现更好的推理能力。
数据可及性
Jade 强调,数据集的可获得性是低资源语言 NLP 研究的关键问题。创造易于访问的数据集,如将数据上传到 openAFRICA,可以显著促进研究进展。
大型文本和多个文本的推理
对于处理大型文本和多个文本的推理问题,专家们指出,现有模型在长文本表征方面存在局限。Isabelle Augenstein 提到,图启发的 RNN 工作流程显示出潜力,但仍需进一步改进。
数据集、问题和评估
最后,专家们强调了定义问题和构建合适数据集的重要性。Mikel Artetxe 指出,构建合适的基准和评估方法是推动 NLP 进步的关键。
通过这些讨论,可以看出 NLP 领域在追求更高水平的理解和应用方面仍有许多工作要做。