现有模型还「不懂」自然语言:20多位研究者谈NLP四大开放性问题
作者头像
  • plane中国
  • 2022-06-19 16:26:47 15

在 DeepMind 主办的 Deep Learning Indaba 2018 峰会上,多位自然语言处理(NLP)领域的专家接受了采访,分享了他们对 NLP 当前状况、面临的主要挑战以及未来发展趋势的看法。

此次会议的核心议题集中在几个关键问题上,其中包括自然语言理解、低资源语言的 NLP、大型文本或多文档的推理以及数据集、问题和评估方法。其中,自然语言理解被认为是 NLP 领域最大的挑战之一。

自然语言理解

专家们普遍认为,自然语言理解(NLU)是实现真正意义上智能系统的最大障碍。现有的技术大多停留在模式匹配阶段,而未能达到真正的理解水平。Kevin Gimpel 提到,构建能够像人类一样理解和处理文本的系统是当务之急,而不是单纯提高模式匹配的能力。

固有偏置与从头学习

专家们对于如何在模型中加入适当的偏置项和结构展开了讨论。有人主张模型应具备学习常识的能力,而另一些人则认为应通过嵌入理解模块来实现这一目标。David Silver 提出,未来模型可能会自主学习一切,包括算法和特征,但现阶段仍需依赖人工设计的模块。

程序合成

Omoju Miller 建议可以从程序合成的角度出发,基于高级规范自动生成程序,从而解决 NLU 的问题。她还提到,结合传统方法和统计方法,或许有助于推断常识属性,如判断汽车是否是交通工具。

具身学习

Stephan Gouws 认为,人类通过与环境的互动学习语言,因此在构建模型时,应考虑利用结构化的数据源和知识库。虽然完全实现具身智能体面临巨大挑战,但可以通过模拟环境和多模态数据逐步接近这一目标。

情感

Omoju 认为将人类情感融入模型非常困难。Stephan 提出,图灵测试表明,即使不具备真实情感,智能体也能通过模仿行为欺骗人类。因此,可以探索无需具备情感的解决方案,但仍能理解人类情感。

认知与神经科学

认知科学理论,如皮亚杰的认知发展理论,为构建模型提供了灵感。跨学科研究的重要性得到了专家们的广泛认同,这有助于推动 NLP 技术的进步。

低资源语言的 NLP

专家们探讨了在低资源语言背景下进行 NLP 的可能性。尽管面临数据稀缺的挑战,但已有不少方法被提出,如通用语言模型和跨语言表征。Bernardt 认为,通过跨语言模型,可以在低资源语言中实现更好的推理能力。

数据可及性

Jade 强调,数据集的可获得性是低资源语言 NLP 研究的关键问题。创造易于访问的数据集,如将数据上传到 openAFRICA,可以显著促进研究进展。

大型文本和多个文本的推理

对于处理大型文本和多个文本的推理问题,专家们指出,现有模型在长文本表征方面存在局限。Isabelle Augenstein 提到,图启发的 RNN 工作流程显示出潜力,但仍需进一步改进。

数据集、问题和评估

最后,专家们强调了定义问题和构建合适数据集的重要性。Mikel Artetxe 指出,构建合适的基准和评估方法是推动 NLP 进步的关键。

通过这些讨论,可以看出 NLP 领域在追求更高水平的理解和应用方面仍有许多工作要做。

    本文来源:图灵汇
责任编辑: : plane中国
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
自然语言开放性研究者模型现有四大问题NLP
    下一篇