11月14日至15日,由amp;lt;中国人工智能学会>和<嘉兴市人民政府>主办,<嘉兴市南湖区人民政府>、<嘉兴科技城管理委员会>和<浙江未来技术研究院(嘉兴)>共同承办的2020第十届中国智能产业高峰论坛(CIIS 2020)在嘉兴南湖成功举办。在11月15日的自然语言理解专题论坛上,西湖大学特聘研究员张岳分享了题为《自然语言处理的瓶颈思考与探索》的精彩演讲。
张岳研究员详细介绍了他们近期的研究成果。他将演讲内容分为两部分:首先回顾了自然语言处理的进步;其次探讨了在实际应用中存在的瓶颈问题。
在回顾自然语言处理的进步时,张岳指出,无论是学术界还是工业界,对话系统都能帮助人们进行情感交流和完成简单任务;机器翻译技术已经能够将整本书翻译成多种语言;机器自动文摘的效果也在不断提升。这些进步主要得益于大规模预训练语言模型的应用。这类模型通过预测互联网上的文本进行预训练,从而在大量未标注的文本中获取语言知识。这些模型不仅能够提升下游任务的表现,还能提供有用的特征。
然而,在实际应用中,自然语言处理仍然面临一些挑战。例如,客服系统可能会误解用户的意图,导致错误操作;机器翻译和文本生成常常出现细节上的错误。这些小问题严重影响了用户体验。
为了深入研究这些问题,张岳团队从三个方面进行了探索:首先考察了机器是否具备基本的常识;其次,在对话任务中评估机器的社会常识和推理能力;最后,检验了机器的逻辑推理能力。这些探索揭示了预训练模型在理解和推理方面仍存在不足之处。
通过对一系列问题的测试,张岳团队发现预训练模型在某些任务上表现出色,但在需要理解常识、社会常识和逻辑推理的任务上却表现不佳。特别是,模型在处理复杂的逻辑推理和数学计算时显得力不从心。这些结果表明,单纯依靠预训练模型无法完全解决自然语言处理的所有问题。
总之,张岳研究员强调,尽管预训练语言模型在自然语言处理领域取得了显著进展,但要实现更加精准和全面的应用,还需要进一步结合知识图谱和其他方法,以弥补现有模型在理解和推理方面的不足。