AI阅卷系统“翻车” 实际上是因为自然语言处理的局限
开学季,美国一款号称服务两万多所学校的AI阅卷系统遭遇质疑。学生只需输入特定关键词,即使这些关键词毫无关联,也能获得高分。
随着人工智能的进步,许多教育应用程序采用了智能评分系统,这些系统阅卷迅速,能即时反馈成绩,受到不少师生的青睐。然而,也有一些家长抱怨智能评分系统的问题,比如英语跟读应用的评分系统,即便具备英语专业八级水平的人,测试成绩也只能达到80分左右。
智能评分系统不仅应用于英语口语评估,还被用来评阅试卷。然而,这种智能阅卷系统也时常出现失误。据报道,在开学季,一款号称服务于美国两万多所学校的AI阅卷系统遭到质疑,学生利用其漏洞,即使没有充分准备也能轻松通过考试。系统的问题在于它依赖于关键词评分,只要输入相关关键词,无论它们之间是否有关联,都能顺利通过甚至获得高分。
阅卷前需设定明确的评判标准
天津大学智能与计算学部的熊德意教授指出,自动测评系统通常需要预先设定评测标准,再依据这些标准来设计合适的评测算法和模型。例如,在口语测评中,机器需要判断发音是否准确、重音是否正确、语句是否连贯等。
对于AI阅卷系统而言,其涉及的语言文字评估涵盖了多个方面,如语法、语义等,需要广泛运用自然语言处理技术。自然语言处理是人工智能的重要分支,专注于让计算机智能化处理自然语言。这一技术主要包括音位(语言发音模式)、形态(单词构成和变化)、词汇(单词间的关系)、句法(单词如何组成句子)、语义(语言的意义)、语用(不同语境下的意义解释)和篇章(句子如何组合成段落)七个层级。
在自动评测指标的设计上,有多种方法可供选择,通常会根据评判类型选择合适的方法。例如,如果阅卷系统需要评判翻译题,教师可以提前编写多个参考答案,然后将学生的答案与参考答案进行对比,计算它们的相似度作为评分标准。机器翻译常用的评测指标BLEU就是基于参考译文和机器译文之间的N-grams(连续的n个单词)匹配度计算相似度的。
一个单词被视为一元,两个连续的单词是二元,以此类推。如果学生的答案中有一个单词与参考答案中的单词一致,就会得到一元评分,以此类推。研究人员为不同级别的元设置不同的权重,然后综合这些得分得到一个总分。得分越高,说明两者相似度越高。
AI评分系统之间差异巨大
这次AI阅卷系统“翻车”的原因是,一位美国历史系教授的儿子在历史考试中只获得了50%的成绩,而教授自己评测后认为儿子的回答几乎没有问题。同样一份答案,人工评分和机器评分却有巨大差异。
为什么同样的答案会有如此大的评分差距?熊教授解释说,这是由于基于AI算法的自动评测面临的主要挑战之一:如何与人工评分保持一致。实现这一点需要解决许多问题,例如如何制定合适的评测标准、如何应对语言的多样性等。
人工评分和机器评分之间存在巨大差异,部分原因在于评分规则和出发点不同,因此最终结果也会不同。这也解释了为什么当孩子母亲在答案中加入“财富、商队、中国、印度”等关键词时,尽管这些关键词之间没有关联,她仍得到了满分。这可能是因为AI阅卷系统只使用了简单的关键词匹配。
此外,口语评测中人工评分和机器评分也存在较大差异。尽管近年来语音识别技术在深度学习的推动下有了显著进步,但在复杂环境和噪声条件下,识别率会大幅下降。如果机器误听了一个单词,后续的评测结果就会出现错误。
自动评测指标的设计方法众多,也有很多改进的空间。例如,除了计算准确率外,还可以计算召回率等指标。另外,还有人专门研究评测指标本身,以寻找更完善的指标,使其更接近人工评分。
深度学习技术的应用可以帮助自动评测更好地应对语言多样性,但需要大量的数据支持。例如,OpenAI的预训练语言模型GPT-3通过学习大量文本,具有很强的语言表示能力,可以完成多种任务,但其高昂的成本限制了其广泛应用。
AI阅卷系统在阅卷速度、理性判断等方面有明显优势。但为了降低阅卷难度,可以将主观题合理地转化为客观题。对于无法完全客观化的主观题,可以设定某一方面的评测标准,从而提高准确性。
还可以引入人工评分作为补充,通过反复修正来积累大量评测数据,使机器评分更加智能。利用自然语言处理等技术进一步完善主观智能评分系统,将是未来教育领域的重要课题。