超越准确性:运用检查表测试NLP模型
尽管评估模型的准确性通常是衡量泛化能力的重要方法,但它往往高估了NLP模型的能力。替代评估方法则更侧重于特定任务或行为。受到软件工程中行为测试的启发,我们提出了一种名为CheckList的新方法。CheckList包含通用语言功能和测试类型矩阵,以及能够快速生成大量测试案例的软件工具。我们通过测试三个任务展示了CheckList的应用,识别出了商业模型和最新模型的关键缺陷。在用户研究中,负责商业情感分析模型的团队通过广泛测试发现了新的可操作错误。另一项用户研究显示,使用CheckList的NLP从业者创建的测试案例是不使用CheckList用户的两倍,发现的错误也是他们的三倍。
迈向自然语言理解:意义、方法和理解
大型神经语言模型在许多NLP任务上的成功令人振奋。然而,这些模型有时会被过度吹嘘,被描述为能够理解语言或捕捉意义。在这篇立场文件中,我们认为,仅依靠数据驱动训练的系统无法真正学习语言的意义。为了与ACL 2020的主题“盘点我们已经做了什么和将要做些什么”保持一致,我们认为清晰理解形式和意义的区别将有助于推动该领域向着更好的自然语言理解方向发展。
本文认为,与当前的一些炒作相反,意义无法单纯通过形式学习获得。这意味着即使是像BERT这样的大型语言模型也只是学会了将意义反映为语言形式的方法,这对实际应用非常有用。对于基于这些模型的研究,我们提出了一些保持健康但不过度悲观的建议。本文可以被视为呼吁在谈论当前形式的成功和谦逊处理自然语言时,使用准确的语言。希望这能鼓励我们领域自上而下的视角,从而选择正确的路径向类人自然语言理解迈进。
GAIA:细粒度多媒体知识提取系统
我们展示了一个全面的、开源的多媒体知识提取系统,该系统能够处理多种来源和语言的非结构化、异构的多媒体数据流,并根据丰富的、细粒度的本体创建一个连接的、结构化的知识库,涵盖实体、关系和事件。GAIA系统能够无缝搜索复杂的图形查询,并检索包括文本、图像和视频在内的多媒体证据。在最近的NIST TAC SM-KBP2019评测中,GAIA获得了最佳性能。该系统在GitHub和DockerHub上公开可用,并提供完整的文档。
不要停止预训练:使语言模型适应不同领域和任务
预训练语言模型已经成为现代NLP的基础。鉴于这些模型的成功,我们研究了是否可以通过领域特定预训练来改进它们。我们展示了在四个领域(生物医学和计算机科学出版物、新闻和回复)的八个分类任务中,领域预训练(第二阶段)和任务预训练(第三阶段)均能提高模型性能。此外,即使在领域预训练之后,适应任务的未标记数据也能提升性能。我们还证明了通过简单数据选择策略扩大任务语料库的有效性,尤其是在领域预训练资源不可用的情况下。总的来说,我们的研究表明多阶段预训练可以在任务表现上带来显著提升。
超越BLEU:重新评估自动机器翻译评估指标
自动评估指标在开发和评估机器翻译系统中扮演着关键角色。然而,确定这些指标是否与人类评价的一致性并不是一件容易的事。我们发现当前的评估方法对翻译样本非常敏感,特别是当存在异常值时,这通常会导致对指标有效性的错误自信。最后,我们转向系统排名,并开发了一种在自动度量下对功能改进进行阈值处理的方法,该方法可以量化I型和II型错误。总的来说,这些发现表明在机器翻译评估和系统性能评估方面取得了改进。
我们的主要建议是,在评估指标时,请在计算相关系数前去除异常值。在评估机器翻译系统时,请避免使用BLEU或TER,而应使用CHRF、YISI-1或ESIM。避免仅依赖度量标准的细微变化得出重要结论,并确保手动评估支持这些结论。
如何加速向类人语言泛化的进程?
本文描述和批评了预训练不确定分布(PAID)评估范式,这是衡量自然语言理解进展的核心工具。该范式包括三个阶段:对任意大小的语料库进行单词预测模型的预训练;对代表性分类任务的训练集进行微调(迁移学习);以及在与训练集相同的分布下评估测试集。这种范式倾向于简单、低偏差架构,可以处理大量数据,并捕获特定数据集的细粒度统计特征。然而,这种方法与人类学习语言的方式不同,人类从少得多的数据中学习,并以不同的方式泛化新任务。我们提倡采用类似于人类学习的范式,以加快向类人语言泛化的进程。
Torch-Struct:深层结构预测库
关于NLP的结构化预测文献中描述了丰富的分布和算法集合,包括序列、片段、比对和树等,但这些算法难以在深度学习框架中实现。我们介绍了Torch-Struct,一个用于结构化预测的库,旨在与深度学习框架集成。TorchStruct包括广泛的概率结构集合,通过一个简单而灵活的API访问,该API可以与任何深度学习模型结合使用。该库利用批处理的向量化操作,并使用自动微分生成可读、高效和可测试的代码。此外,我们还包含了一些通用优化,以提供跨算法的效率。实验表明,相对于快速基线,性能有显著提升,案例研究证明了该库的优势。未来,我们希望支持更多结构化模型的研究和生产应用,并继续优化核心算法,使其与高度优化的神经网络组件竞争。
Prta:分析新闻宣传技术的系统
近年来,诸如美国总统大选、英国脱欧和新冠肺炎疫情等事件突显了虚假信息的危害。尽管已有许多研究集中在事实核查和虚假信息检测上,但鲜有人关注用于传播宣传信息的具体修辞和心理技巧。揭示这些技巧的使用可以帮助提高媒体素养和批判性思维,从而限制假新闻和虚假信息运动的影响。
Prta系统允许用户通过突出显示文章中使用的宣传技巧来定期阅读抓取的文章,并根据所使用的宣传技巧进行比较。系统进一步报告有关这些技巧使用情况的总体和长期统计数据,或根据用户指定的时间间隔、关键词和/或媒体政治倾向的过滤标准。此外,用户还可以通过公共接口或API分析任何文本或URL。