AI阅卷“翻车”其实是“翻”在了自然言语处理
作者头像
  • L7
  • 2020-10-14 13:25:03 6

开学季,美国一款声称服务两万所学校的AI阅卷系统引发了质疑。学生们发现,通过利用系统的漏洞,即使输入的关键词之间毫无关联,也能轻易获得高分。

随着人工智能技术的进步,许多教育应用程序开始采用智能评分系统。这类系统阅卷速度快,能即时出分,受到不少师生的青睐。然而,也有不少家长抱怨,一些智能评分系统并不十分可靠。例如,有些英语跟读应用的评分系统,即便是具备英语专业八级水平的人,测试得分也只有80分左右。

除了应用于英语口语评分,人工智能也被用于试卷批改。尽管如此,智能阅卷系统偶尔也会出现失误。据报道,在开学季,一款声称服务于美国两万所学校的AI阅卷系统引起了争议。学生们利用系统的漏洞,无需复习就能轻松通过考试。系统之所以容易被学生利用,是因为它仅依据关键词进行评分。只要输入相关的关键词,即便这些词之间没有联系,也能顺利通过甚至获得高分。

阅卷前需设定评判标准

天津大学智能与计算学部的熊德意教授指出,自动评分系统通常需要预先设定评判标准,再根据这些标准设计合适的评分算法。例如,在口语评分中,机器需要判断发音是否标准、重音是否正确、语句是否流畅以及连读是否准确等。

对于AI阅卷系统而言,涉及语言文字的评判需要涵盖多个方面,如语法、语义等,这需要广泛使用自然语言处理技术。自然语言处理技术是人工智能的一个重要分支,专注于让计算机智能化处理自然语言。这一技术的基础层面包括音位(语言的发音形式)、形态(单词的构造和变化)、词汇(单词之间的关系)、句法(单词如何组成句子)、语义(语言的意义)、语用(不同语境下的意义解释)和篇章(句子如何组合成段落)等七个层级。

设计自动评分标准的方法多样,通常根据不同的评判类型选择合适的方法。例如,对于翻译题的自动评分,教师可以事先提供多个参考译文,然后将学生的答案与参考译文对比,计算相似度作为评分标准。机器翻译中常用的BLEU评分标准就是基于参考译文和机器译文之间的N-gram匹配度来计算相似度的。

一个单词被视为一元,两个连续的单词视为二元,以此类推。如果学生的答案中有一个单词与参考答案中的单词一致,系统会给予相应的评分。研究人员还会根据不同元设置不同的权重,最终得出一个综合评分。得分越高,表明两者之间的相似度越高。

不同AI评分系统结果差异显著

这次AI阅卷系统引发质疑的原因是一位美国历史系教授的儿子在历史考试中只得了50%的分数,而他对儿子的答案进行了评估,认为答案完全合格。同样的答案,人工评分和机器评分结果却大相径庭。

人工评分和机器评分为何会有如此大的差异?熊德意教授解释说,这主要是因为AI算法的自动评分面临的主要挑战是如何与人工评分保持一致。解决这一问题需要克服多个难题,如如何制定合适的评分标准、如何应对语言的多样性、如何设计综合性的评分目标等。

例如,目前的各种评分标准大多只考虑了单词形式的严格匹配,而忽略了单词形态变化、语义相似性和译文句法合理性等因素。评分规则和出发点的不同会导致算法模型的差异,最终结果也会大相径庭。

因此,仅依赖一种评分方法显然是不够全面的。这也解释了为什么当孩子的母亲在答案中加入了一些关键词,即便这些关键词之间没有任何联系,她仍然获得了满分。这可能是因为该AI阅卷系统只采用了简单的关键词匹配方法,从而导致了“关键词拼盘”也能蒙混过关的现象。

此外,口语的人工评分与机器评分也存在较大的差异。尽管近年来语音识别技术有了显著提升,但在开放环境和噪音环境下,识别率依然会大幅下降。如果机器识别错误一个单词,后续的评分结果也会出现偏差,最终导致评分大相径庭。

结合人工评分使系统更智能

熊德意教授介绍,传统的自动评分方法通常是基于符号计算的,现在深度学习等AI技术也被广泛应用于评分工具中。通过深度学习,可以将语言符号映射到密集向量的语义空间,利用语义向量计算相似度。即使词语有所不同,只要语义一致,机器仍能做出准确的评价。因此,基于深度学习的自动评分方法可以在一定程度上应对语言多样性带来的挑战。不过,深度学习也需要大量的数据来训练机器。

近年来,基于自监督学习的预训练语言模型取得了突破性的进展。例如,OpenAI的GPT-3模型在5000亿单词的海量语料上训练了一个带有1750亿个参数的神经网络。通过学习网络上的各种语言文本,GPT-3形成了强大的语言表示能力,可以执行多种任务,如自动翻译、故事生成、常识推理、问答等。然而,如此庞大的神经网络需要巨大的存储空间和高昂的训练成本,使得其广泛应用仍有很长的路要走。

AI作为阅卷评分工具,具有人工无法比拟的优势。例如,AI阅卷系统批阅速度更快,教师无法一次性记住所有选择题的答案,需要不断对照标准答案,这很耗时。而自动阅卷系统则大大提高了效率。此外,自动阅卷系统更加客观,不受外界因素干扰,不会因疲劳等原因导致误判。即使在复杂干扰环境中,也能得到准确的结果。AI阅卷系统还能在评分后立即进行学情分析,统计考试数据、错题数据等教学资料,减轻教师负担,提高学生的学习效率。

“将客观题合理地客观化,可以降低自动阅卷的难度。”熊德意表示,对于无法客观化的主观题,虽然设定全面的评分标准较难,但设定某一特定方面的评分标准还是可行的,如单词词法、句子语法等评判,目前准确率较高,这些技术可以逐步从实验室走向实际应用。

引入人工评分复核和修正AI阅卷系统的评分,通过反复修正,积累大量的评分训练数据,可以使机器评分变得更加智能。

“利用自然语言处理等人工智能技术,进一步完善客观智能评分系统,将是未来教育领域的重要课题。”熊德意教授说,当前的AI自动阅卷系统将会越来越“聪明”,人工智能与教育的结合也将越来越紧密。

    本文来源:图灵汇
责任编辑: : L7
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
翻车阅卷言语其实自然处理
    下一篇