AI阅卷“翻车”其实是“翻”在了自然言语处理
作者头像
  • 发烧火星鱼
  • 2020-10-15 09:26:33 10

开学季期间,美国一款号称服务两万多所学校的AI阅卷系统引发了争议。学生们利用系统的漏洞,通过输入特定关键词,即使这些关键词彼此无关,也能轻易获得高分。

随着人工智能技术的进步,许多教育应用程序采用了智能评分系统。这些系统阅卷速度快,评分及时,受到了不少师生的欢迎。然而,一些家长对智能评分系统提出了批评。例如,有些英语口语评分系统,即使是有英语专业八级水平的人,测试得分也只有80分左右。

除了应用于英语口语的智能评分系统,人工智能也被用于判卷。不过,这种智能阅卷系统有时也会出现问题。据报道,在开学季,一款声称服务于美国两万多所学校的AI阅卷系统就遭遇了质疑。学生们利用其漏洞,“裸考”也能轻松及格。问题的根源在于该系统主要依靠关键词评分,学生只需输入相应关键词,即使这些关键词毫无关联,也能顺利通过甚至获得高分。

评分标准的设定

天津大学智能与计算学部教授、博士生导师熊德意解释道:“自动评分系统通常需要预先设定评分标准,然后根据这些标准设计合适的评分算法和模型。”例如,在口语评分中,机器需要评估发音是否标准、句子重音是否正确、语句是否流畅连贯以及连读部分是否准确等。

对于AI阅卷系统而言,评分不仅涉及语言文字的准确性,还包括语法、语义等多个方面,这需要广泛运用自然语言处理技术。自然语言处理技术是人工智能的重要分支之一,研究如何使计算机能够智能地处理自然语言。这项技术涵盖了音位(语言的发音形式)、形态(字和字母如何构成单词)、词汇(单词之间的关系)、句法(单词如何组成句子)、语义(语言的意义)、语用(不同语境下的意义解释)以及篇章(句子如何组成段落)等七个层级。

设计自动评分系统的方法有很多种,通常根据不同的评分类型选择合适的方法。例如,如果阅卷系统需要对翻译题目进行评分,教师可以事先编写多个参考译文,然后将学生的答案与参考译文进行对比,计算它们的相似度作为评分依据。常用的评分指标之一是BLEU,它基于参考译文和机器译文之间的N-gram匹配度来计算相似度。一个单词是一元,两个相连的单词是二元,以此类推。如果答案中的单词与参考答案中的单词匹配,则会给出相应的评分,研究人员还会根据不同元设置不同的权重,从而综合计算出一个评分。

不同AI评分系统结果差异显著

此次AI阅卷系统“翻车”的导火索是一位美国历史系教授的儿子在历史考试中只得到了50%的分数,而他手动评分后发现孩子的答案并无明显错误。

同样的答案,人工评分和机器评分为何会有如此大的差异?熊德意认为,这是基于AI算法的自动评分面临的主要挑战之一:如何与人工评分保持一致。解决这一挑战需要克服许多问题,例如如何制定合适的评分标准,客观题的评分必须有明确的评分标准和规范;如何应对语言的复杂性和多样性,这是自然语言处理技术面临的主要挑战之一;如何设计一个综合性的评分指标,尽管目前有各种评分指标,但很少有指标能够全面考虑语言文字的各个方面,例如作文自动评分需要考虑词汇的合理性、句子的流畅性、段落的组织结构、内容是否紧扣主题等。

熊德意指出,BLEU评分标准仅关注单词的严格匹配,而忽略了单词的形态变化、语义相似性以及句子的语法合理性等因素。评分标准和评分起点的不同会导致评分算法的不同,因此最终的评分结果也会有很大的差异。

因此,仅仅依赖一种评分方法显然是不够的。这也解释了为什么当孩子的母亲在答案中加入了一些题目中的关键词,即使这些关键词之间没有任何联系,她也能得到满分。熊德意解释说,这个AI阅卷系统可能只使用了简单的关键词匹配,因此会出现“关键词拼盘”也能蒙混过关的情况。

此外,口语的人工评分与机器评分也存在较大差异。“近年来,语音识别技术虽然在深度学习技术的推动下有了显著提升,但在开放环境和噪音环境下,识别率会大幅下降。”熊德意解释说,如果机器“听”错了一个单词,后续的评分结果就会出现偏差,形成错误传播,从而导致评分结果大相径庭。

结合人工评分让系统更加智能

“传统的自动评分系统通常是基于符号进行计算的,而现在越来越多的AI技术,如深度学习,被应用于评分工具中。”熊德意介绍,通过深度学习,可以将语言符号映射到稠密向量的语义空间,从而计算相似度。即使语言表达与计算机原有的学习内容不同,但只要语义相同,机器就能进行精确的评分。因此,基于深度学习的自动评分可以在一定程度上应对语言多样性的挑战。然而,深度学习也有一个问题,那就是需要大量的数据来训练机器。

近年来,基于自监督学习的预训练语言模型取得了突破性进展。“OpenAI的预训练语言模型GPT-3在5000亿单词的海量语料上训练了一个拥有1750亿个参数的神经网络。通过学习网络上的各种语言文本,GPT-3具备了强大的语言表示能力,可以完成多种任务,例如自动翻译、故事生成、常识推理、问答等,甚至可以进行加减法运算,比如其两位数加减法正确率达到100%,五位数加减法正确率接近10%。”熊德意表示,然而,如此庞大的神经网络需要700GB的存储空间,并且训练成本高达460万美元。因此,尽管GPT-3具有良好的零样本和小样本学习能力,其高昂的成本使其离普及还有很大距离。

然而,AI作为阅卷评分“教师”具有人工无法比拟的优势。例如,AI自动阅卷系统相比人工阅卷速度更快,教师难以一次性记住所有选择题的答案,需要频繁对照标准答案,这是一个耗时的过程。自动阅卷系统可以大大提高效率;此外,自动阅卷系统更加客观,不受外界条件干扰,不会因疲劳等原因导致误判。即使在复杂干扰环境中,仍能得出正确的结果;AI阅卷系统还可以在评分后立即进行学情分析,统计考试数据、错题数据等教学材料,帮助教师减负增效,帮助学生提高学习效率。

“将客观题合理地标准化,可以降低自动阅卷的难度。”熊德意表示,对于那些无法完全标准化的主观题,虽然全面设定评分标准较为困难,但设定某一方面的评分标准还是可行的,例如针对单词语法、句子语法的评分,目前准确率已经相当高,这类技术可以从实验室走向实际应用。

也可以引入人工评分,对AI阅卷系统的评分进行复核与修正。通过反复修正,累积大量评分训练数据,使机器评分更加智能。

“利用自然语言处理等人工智能技术,进一步完善客观智能评分系统,将是未来教育领域的一个重要课题。”熊德意说,当前的AI自动阅卷系统一定会越来越“聪明”,人工智能与教育的结合也将越来越紧密。

    本文来源:图灵汇
责任编辑: : 发烧火星鱼
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
翻车阅卷言语其实自然处理
    下一篇