自然语言处理(NLP)的发展依赖于丰富的语言资源。这些资源通常需要带标注的数据来反映NLP系统对当前任务的预期输出。虽然无监督、弱监督、半监督或远程监督等技术可以减少对标注数据的依赖,但仍然需要大量的数据来评估系统性能。这种需求导致了高资源语言和低资源语言之间的显著差距。
目前,高资源语言主要包括英语、汉语、阿拉伯语、法语等,此外还有德语、葡萄牙语、西班牙语、芬兰语等。这些语言拥有大量可访问的文本和语音资源,以及一些注释资源,如树图资料库和评估集。相比之下,世界上约7000种其他语言则仅有很少甚至没有资源。
尽管英语和汉语在全球范围内广泛使用,但NLP研究不应仅限于这两种语言。不幸的是,NLP领域存在一种恶性循环:除英语以外的其他语言研究通常被认为是“特殊语言”,因此在同等条件下被认为不如英语研究重要。NLP会议的审稿人常常错误地认为某一任务的最先进水平等同于该任务在英语上取得的最先进水平,如果论文不能与之进行比较,则无法判断其价值。
英语并不等同于自然语言。以下是英语不能代表所有语言的一些原因:
口语而非符号语言:如果只研究英语,就会忽略其他重要的语言类型。
完善的拼写系统:英语的拼写系统基于发音,而其他语言的拼写系统则有所不同。例如,西班牙语的拼写系统更为透明,而传统希伯来语和阿拉伯语仅代表辅音,马拉雅拉姆语、韩语和日语假名则使用音节符号,中文则使用逻辑系统。
分词问题:汉语、日语、泰语等语言的NLP任务必须从分词开始。
字符编码:英语写作通常只使用ASCII字符,而其他语言可能需要更多字符编码。
屈折形态:英语的屈折形态较少,而在高度变化的语言中,同一单词可能有多种形式,这使得数据稀疏问题更加严重。
固定语序:英语在词序上较为固定,而其他语言可能更为灵活。
表单匹配:英语表单可能与数据库字段名等匹配,但这种匹配可能不适用于其他语言。
训练数据:英语拥有大量训练数据,而其他语言则相对较少。
2009年,Tim Baldwin和Valia Kordoni在EACL上组织了一个研讨会,讨论NLP中的机器学习方法。当时,机器学习(尤其是深度学习)对NLP至关重要。有人指出,不编码特定语言知识的NLP系统是语言无关的。然而,我不赞同这种观点。我认为,如果我们只使用英语或其他少数语言,就无法判断所构建的系统是否适用于所有语言。因此,我们需要明确指出正在学习的语言类型,即使它是英语。相反,如果不去声明所使用的数据的语言类型,就会产生一种语言独立的假象。
2019年,Nathan Schneider、Yuval Pinter、Robert Munro、Andrew Caines等人分别提出了“Bender Rule”或“Bender Clauses”。最终,Bender Rule的声明合并为一句话:始终注明你正在使用的语言。
NLP领域已经开始关注“为语言命名”的问题,但大部分工作仍主要使用英语。随着NLP技术带来的伦理影响日益受到关注,我们应该更清晰地认识到,关于训练和测试模型所使用的数据,我们应该提供更多信息。
首先,所有语言都在不断变化,不同变体之间存在很大差异。针对某一特定人群的语音/文本/标志进行训练的模型不一定适用于其他人群。
其次,模型会汲取训练文本中的偏见,这些偏见来源于生产文本的人如何认识和谈论这个世界。为了应对这些问题,我们提出了“数据声明”的概念,这是一种清晰记录NLP系统中使用数据集的做法。所有NLP系统都应该附带关于训练数据的详细信息,包括所涉及的特定语言种类、选择数据的原理、有关说话者和注释者的人口统计信息等。
总之,NLP领域必须超越英语和其他少数精心研究的语言,以实现真正的跨语言应用。