为了促进中文自然语言技术的发展,由中国人工智能学会主办,科大讯飞股份有限公司组织,认知智能国家重点实验室(科大讯飞)和哈尔滨工业大学社会计算与信息检索研究中心承办的“第三届中国‘AI+’创新创业大赛——自然语言处理技术创新大赛——中文文本纠错比赛”正式拉开帷幕。此次比赛旨在为致力于中文自然语言处理研究的研究人员、产业界人士以及AI技术爱好者提供一个良好的交流平台。
组织架构
主办单位
组织单位
承办单位
- 认知智能国家重点实验室(科大讯飞)
- 哈尔滨工业大学社会计算与信息检索研究中心
评审委员会
- 主席:陈志刚(认知智能国家重点实验室副主任,科大讯飞研究院副院长)
- 副主席:车万翔(哈尔滨工业大学社会计算与信息检索研究中心教授)、陈竹敏(山东大学信息检索实验室教授)、贺瑞芳(天津大学智能与计算学部教授)、伍大勇(科大讯飞北京研究院执行院长)
- 秘书长:王宝鑫(科大讯飞北京研究院研究员)
参赛办法
参赛对象
- 本次比赛面向全国高校、科研机构和涉及自然语言处理、数据挖掘、知识图谱等技术的人工智能领域的企业和个人。
组队方式
- 参赛队伍可自行在网上报名,每支队伍由3-5名队员组成,队员的职业、年龄、地区不限,每队至少一名队员为中国国籍。
报名方式
- 报名截止日期为2021年7月30日。参赛队伍可以通过大赛官网(http://2021aichina.caai.cn/)或比赛指定平台(https://competitions.codalab.org/competitions/32702)进行报名,并发送队伍信息至rdg_feiying@iflytek.com完成审核。
参赛选题
- 竞赛背景:文本纠错的主要任务是对文本中的错误进行检测和纠正,涵盖拼写错误、语法错误和语病错误等多方面内容。本赛题主要选择中文母语写作者撰写的网络文本作为校正评测数据。
- 赛题描述:本次赛题要求选手从网络文本中检测并纠正错误,完成中文文本校正系统。具体输入和输出格式为:
- 输入文件包含若干行文本,每行文本对应句子ID和相应的待校正句。
- 输出文件每行对应句子ID及相应的校正结果,每处错误需包含错误位置、错误类型、错误词语及正确词语,每处错误之间以英文逗号分隔。
- 模型训练:主办方提供了解题思路供选手参考,选手可以选择序列标注模型或Seq2seq模型等方法。
- 训练集数据:主办方提供了部分伪数据,初赛大约有10万句文本,复赛时会公开更多数据。参赛队伍也可以使用公开数据集和其他开放数据。
作品要求
- 参赛作品应为参赛队员独立设计、开发完成,严禁抄袭。
时间安排
- 2021年6月10日:发布大赛通知,开始报名
- 2021年6月24日:发布示例样本、baseline模型及小批量伪数据
- 2021年7月30日:报名截止
- 2021年8月2日:提交初赛系统截止日
- 2021年8月5日:公布复赛名单,发布验证集样本及更多伪数据
- 2021年8月31日:提交最终校正系统
- 2021年9月8日:撰写技术评测报告,颁奖
- 全国总决赛:2021年10月,AI创新创业大赛颁奖和路演
竞赛赛制
- 初赛:参赛队伍需在2021年7月30日前完成报名,并从网站获取示例开发集、baseline模型和训练伪数据。之后可以开始数据处理和校正系统构建,2021年8月2日为初赛最后结果提交更新日。
- 复赛:复赛将于2021年8月5日开始,参赛队伍可以获取验证集样本及更多训练伪数据,进行模型优化。2021年8月31日为复赛最后系统提交更新日。
初赛评测规则
- 主办方将对参赛队伍的测试结果与标准结果进行一致性评价,评测结果采用检测得分和纠正得分加权平均的方式计算,具体为:评测结果 = 0.8 * 检测得分 + 0.2 * 纠正得分,得分均采用F-score计算。
奖项设置
- 本赛事最终选出冠军1队、亚军2队、季军3队,对应奖励分别为15000元、10000元和5000元人民币。
竞赛管理
- 本次参赛不收取任何费用。
- 参加决赛队伍的教师和学生在决赛期间的食宿费用、交通费用及其他费用自理。
- 大赛官网:http://2021aichina.caai.cn/
- 数据集及消息通知:https://github.com/destwang/CTC2021
- 邮箱:rdg_feiying@iflytek.com