中文自然言语处理开放义务引见、数据集、当前最佳结果分享
作者头像
  • IT之窗
  • 2020-12-02 18:26:16 7

本文整理了与中文自然语言处理相关的开放任务,包括详细的任务说明、数据集、相关评估指标以及当前的最佳成果。涉及的任务包括指代消歧、对话状态管理、情绪分类、实体链接、实体标注、语言模型、机器翻译、词性标注、问答、关系抽取等。


中文指代消歧

背景

指代消歧是识别一段文本中的指代内容,并将其与其他具有相同指代内容的文本连接起来。有时这些文本片段的长度为零,表示省略了的代词或名词。

示例

  • 输入:我的姐姐给我她的狗。很喜欢。
  • 输入:[我]的[姐姐]给[我][她]的[狗]。[我]很喜欢[狗]。

标准评估指标

  • 使用MUC、B-cubed、Entity-based CEAF三种精确率和召回率计算F1值。

数据集及最佳成果地址


中文对话状态管理

背景

在面向任务的对话系统中,对话状态管理系统将用户意图作为输入,与知识库交互,并预测系统的下一步操作。自然语言理解组件负责分析用户意图,该组件有时与对话状态管理系统结合为一个单一的端到端学习组件。

标准评估指标

  • 句子级别的分类准确率。
  • 对话级别的分类准确率:一个对话只有在所有句子都被准确预测时才算正确。

数据集及最佳成果地址


中文情绪分类

背景

情绪分类旨在识别叙述者的情绪状态。与情感分析不同,情感分析侧重于叙述者对其叙述对象的观点。

示例

  • 输入:厌恶!你骗我!
  • 输入:生气

标准评估指标

  • 分类准确率。
  • F1值。

数据集及最佳成果地址


中文实体链接

背景

实体链接是指识别文本片段,并将其与标准数据库、知识库、地名词典、维基百科页面等中的相应条目进行链接。文本片段除了专有名词外,还包括指代名词,如“the player”。

示例

  • 输入:美国国防部长马蒂斯说,与首尔举行的名为“秃鹫”的军事演习每年春天在韩国停止,但2019年将“减少规模”。
  • 输入:[美国]国防部长[马蒂斯]说,与[首尔]举行的名为“秃鹫”的军事演习每年春天在[韩国]停止,但2019年将“减少规模”。

标准评估指标

  • F-score:正确识别实体并链接到知识库中正确的概念。
  • NIL mentions:在知识库中找不到对应概念的实体需要被聚类,并用CEAF(B-cubed的衍生指标)进行评估。

数据集及最佳成果地址


中文实体标注

背景

实体标注任务是识别文本中实体概念的提及并标注对应的类型,如人(PER)、组织(ORG)、地缘政治实体(GPE)、地点(LOC)等。文本提及除了专有名词外,还包括指代名词,如“the player”。

示例

  • 输入:美国国防部长马蒂斯说,与首尔举行的名为“秃鹫”的军事演习每年春天在韩国停止,但2019年将“减少规模”。
  • 输入:[美国]GPE国防部长[马蒂斯]PER说,与[首尔]GPE举行的名为“秃鹫”的军事演习每年春天在[韩国]GPE停止,但[2019年]TMP将“减少规模”。

标准评估指标

  • F-score:选择正确的文本提及并指定正确类型。

数据集及最佳成果地址


中文语言模型

背景

语言模型可以计算任何文本字符串或语料库的概率。好的语言模型对于未观察过的流畅文本应能输入一个高概率或低困惑度,反之则输入低概率。

示例

  • 输入:我们体育界是有决心做到为北京2022年冬季奥运会提供坚实的人才基础。
  • 输入:60.2困惑度

标准评估指标

  • 困惑度(Perplexity):衡量一个语言模型在未见过的字符串上的表现。
  • Bits-per-character (bpc):当计算基于字符长度单位的困惑度时,Perplexity = 2^bpc。

数据集及最佳成果地址


中文机器翻译

背景

机器翻译(MT)将文本从一种语言转换为另一种语言。这里,我们专注于源语言或目标语言为中文的任务。

示例

  • 输入:美中两国能够很快达成一个贸易协议。
  • 输入:The United States and China may soon reach a trade agreement.

标准评估指标

  • 直接评价(人工评判)。
  • BLEU score(Papineni等,2002年)。
  • NIST:BLEU的一种变体,赋予少见的n-gram更高的权重。
  • TER(Translation Edit Rate):计算机器翻译与人工参考译文之间的编辑距离。
  • HTER:修正为一个良好的翻译所需的人工编辑次数。

数据集及最佳成果地址


中文词性标注

背景

词性标注任务是将给定句子中的每个单词从给定标签组中赋予一个词性标签。

示例

  • 输入:疾速的棕色狐狸跳过了懒散的狗。
  • 输入:[疾速]VA[的]DEC[棕色]NN[狐狸]NN[跳过]VV[了]AS[懒散]VA[的]DEC[狗]NN

标准评估指标

  • 在结合分割标注的任务中,计算基于词级别的精确率和召回率,以及F1分数。

数据集及最佳成果地址


中文问答

背景

问答任务试图回答以自然语言形式提出的问题。答案可能来自结构化的数据库,也可能来自非结构化的文本片段。

示例

  • 输入:世界上最大的国家是什么?
  • 输入:俄罗斯

标准评估指标

  • 准确率(accuracy)。
  • 完全匹配(exact match)。
  • F1分数。

数据集及最佳成果地址


中文关系抽取

背景

给定两个实体,识别它们之间的关系并对其进行分类。

示例

  • 输入:李晓华和她的丈夫王大牛前日一同去英国游览了。
  • 输入:(entity1: 李晓华, entity2: 王大牛, relation: 夫妻)

标准评估指标

  • 精确率(Precision)。
  • 召回率(Recall)。
  • F1分数。

数据集及最佳成果地址


中文情感分析

背景

情感分析从文本中识别并提取文本的客观态度信息。

示例

  • 输入:总体感觉这台机器还不错,适用的功能有:阴阳历显示,时间与日期快速转换,记事本等。
  • 输入:正面(Positive)

标准评估指标

  • 准确率(Accuracy)。
  • F1分数。

数据集及最佳成果地址


中文繁简转换

背景

简体中文/繁体中文转换将简体中文字符转换为繁体中文字符,或反之。

示例

  • 输入:苟利国家生死以,岂因祸福避趋之。
  • 输入:苟利國家生死以,豈因禍福避趨之。

标准评估指标

  • 准确率(Accuracy)。

数据集及最佳成果地址


中文拼写纠错

背景

拼写纠错任务的目标是在文本中查找并纠正拼写错误。

示例

  • 输入:1986年毕业于国防科技大学计算机应用专业,获学士学位。
  • 输入:1986年毕业于国防科技大学计算机应用专业,获学士学位。(时->士)

标准评估指标

  • 检测(Detection):识别一段文字中所有拼写错误字符的位置。
  • 纠正(Correction):识别并纠正错误字符。

数据集及最佳成果地址


中文文本摘要

背景

文本摘要任务的输入是一篇长文档,目的是将较长的文本转换成简短、流畅而准确的文本摘要。

示例

  • 输入:较早进入中国市场的星巴克,是不少小资钟情的品牌。相比在美国的平民形象,星巴克在中国显得“高端”得多。用料并无差别的中杯美式咖啡,在美国仅约合人民币12元,国内要卖21元,相当于贵了75%。第一财经日报。
  • 输入:媒体称星巴克美式咖啡售价中国比美国贵75%。

标准评估指标

  • ROUGE:将自动生成的摘要与参考摘要进行比较,其中ROUGE-1衡量unigram匹配情况,ROUGE-2衡量bigram匹配,ROUGE-L记录最长的公共子序列。

数据集及最佳成果地址


中文主题分类

背景

主题分类任务根据文本的主题内容为文本赋予标签或类别。主题有时广泛,类似于流派(新闻、体育、艺术),但有时也会有细粒度的标签。

示例

  • 输入:国足有决心了,中国国奥队获得热身赛三连胜。
  • 输入:体育

标准评估指标

  • 准确率(Accuracy)。

数据集及最佳成果地址


中文音译

背景

音译任务通常在使用不同字母和发音系统的语言之间翻译专有名词和技术术语。

示例

  • 输入:约翰·伍兹(约瑟夫·吴子)
  • 输入:John Woods

标准评估指标

  • Word Accuracy in Top-1 (ACC)。
  • Fuzziness in Top-1 (Mean F-score)。
  • Mean Reciprocal Rank (MRR)。
  • MAP measures precision。

数据集及最佳成果地址


中文词向量

背景

词向量通过大量文本语料训练,为每个词返回一个n维的实数向量。这些向量表征了每个词的句法和语义信息,可用于处理各种NLP任务。在中文任务中,词向量的单位除了词外也可以是字或子字。

示例

  • 输入:大文本语料库。
  • 输入:vec("查询") = [-0.059569, 0.126913, 0.273161, 0.225467, -0.185914, 0.018743, -0.18434, 0.083859, -0.115781, -0.216993, 0.063437, -0.005511, 0.276968,..., 0.254486]。

标准评估指标

  • 内部评估(Intrinsic Evaluation):
    • 词语相关性:在中文词汇相似性数据集wordsim-240和wordsim-296上,人类标记分数与词向量的内积之间的Spearman相关系数。
    • 单词类比:评价单词类比任务的准确率。
  • 外部评估(Extrinsic Evaluation):
    • 在中文情感分析任务上的准确率。
    • 在中文命名实体识别任务上的F1分数。
    • 在中文词性标注任务上的准确率。

数据集及最佳成果地址


中文分词

背景

中文中的每个汉字即为一个字符。一个词通常由一个或多个字符组成,词与词之间没有空格。分词是将一系列无空格间隔的字符串分割成一系列词的过程。

示例

  • 输入:亲,请问有什么可以帮您的吗?
  • 输入:亲,请问有什可以帮您吗?

标准评估指标

  • 词级别的F1分数。

数据集及最佳成果地址


往期精品内容推荐

  • 6部高分美剧,边看边提升口语,坚持每天学习,返200奖学金免费学!
  • 元学习-从小样本学习到快速强化学习-ICML2019
  • 8月最新-《可解释机器学习-Christoph Molnar》-旧书分享
  • 2019年暑期实习、秋招深度学习算法岗面试要点及答案分享
  • 深度学习硬件的过去、现在和未来-Yann LeCun
  • 【干货】史上最全的PyTorch学习资源汇总
  • TensorFlow实现的深度NLP模型集锦
  • 吴恩达新课-《CS230-深度学习基础-2019年春》课程视频分享
  • 免费中文书籍-《神经网络与深度学习》中文版推荐
  • Coursera收费新课-面向AI、机器学习和深度学习的TensorFlow入门推荐
  • 从入门到精通-TensorFlow深度强化学习课程
  • 2019年旧书-《PyTorch实战-一个解决问题的方法》精品教材分享
  • 斯坦福NLP组-2019-《CS224n: NLP与深度学习》-分享

希望这些改写的内容能满足你的需求。如果有任何进一步的要求或修改意见,请随时告知。

    本文来源:图灵汇
责任编辑: : IT之窗
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
引见中文言语义务当前最佳自然开放结果处理
    下一篇