自然语言不等于英语,为什么NLPer应当认识到这个问题,以及该怎么做?
作者头像
  • 金宇秋红
  • 2022-01-19 07:33:45 16

作者 | Emily M. Bender

单位 | 华盛顿大学

自然语言处理(NLP)的研究进展在很大程度上依赖于语言资源的存在。这些资源通常需要高质量标注的数据来反映NLP系统预期的输出。尽管无监督、弱监督、半监督或远程监督等机器学习技术减少了对标注数据的依赖,但依然需要足够的标注数据来评估系统性能。这种需求导致了高资源语言和低资源语言之间的显著差距。

高资源语言与低资源语言

高资源语言主要包括英语、汉语、阿拉伯语、法语等,这些语言拥有丰富的文本和语音资源,以及一些注释资源如树形图库和评估集。相比之下,世界上其他约7000种语言却几乎没有或几乎没有资源。此外,NLP领域的大部分研究工作集中在高资源语言上,尤其是英语。

语言研究的重要性

NLP研究不应仅限于高资源语言。英语并非自然语言的代名词或代表。英语作为一种口头语言,没有使用符号语言,且具有独特的拼写系统。此外,英语的拼写标准化简化了NLP任务,但这并不适用于所有语言。英语的语序相对固定,且有大量的训练数据,这使得许多NLP技术难以推广到其他语言。

Bender Rule

为了解决这些问题,Emily M. Bender提出了Bender Rule。她强调在研究中明确指出所使用语言的类型,即使这种语言是英语。这一规则旨在防止研究者误以为他们的系统是语言无关的。Bender Rule的提出是为了确保NLP研究更加全面和公正,避免过分依赖英语。

命名语言的意义

命名语言不仅是简单的标识,而是为了确保研究的透明性和公正性。此外,考虑到语言的多样性,研究者还需要提供关于训练数据的详细信息,包括语言种类、数据选择原则以及数据来源的社会背景等。这些信息有助于识别和纠正训练数据中的偏见,从而提升NLP系统的可靠性和公正性。

通过这些措施,NLP领域可以更好地理解和应对语言多样性带来的挑战,推动跨语言研究的发展。

    本文来源:图灵汇
责任编辑: : 金宇秋红
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
自然语言英语应当等于以及认识这个为什么怎么问题
    下一篇