在开学季,一款在美国服务两万多所学校的AI阅卷系统引起了广泛关注。一些学生发现,通过利用系统漏洞,即使输入毫无关联的关键词,也能获得高分。
随着人工智能技术的进步,许多教育应用程序采用了智能评分系统。这类系统能够快速评阅试卷并即时反馈成绩,受到师生们的欢迎。然而,家长们对智能评分系统提出了不少批评,特别是在英语口语评分方面,有些评分结果令人困惑。
AI阅卷系统不仅应用于英语口语评分,还在其他科目中发挥着作用。然而,这类系统偶尔会出现失误。据报道,在开学季,一款声称服务于两万多所学校的AI阅卷系统遭到质疑。学生们通过系统漏洞,无需准备就能轻松通过考试。这种情况的发生是因为系统主要依赖关键词进行评分,而不是整体内容的质量。
天津大学智能与计算学部的教授熊德意指出,自动评分系统需要预先设定评测标准,再根据这些标准设计相应的评分算法。例如,在英语口语评分中,系统会评估发音是否准确、重音是否恰当、语句是否连贯等。
AI阅卷系统在语言文字的评判上涉及广泛的技术,包括语法和语义等方面。自然语言处理技术是AI的重要分支,它使计算机能够智能化地处理人类语言。这种技术涵盖了音位、形态、词汇、句法、语义、语用和篇章等多个层次,广泛应用于机器翻译、对话、问答和文档摘要等领域。
这次AI阅卷系统的问题源于一位美国历史系教授的儿子在历史考试中只得到50%的分数,而他觉得儿子的答案并没有太大问题。同样的答案,人工评分和机器评分却出现了巨大差异。
这种差异主要是因为AI评分系统难以与人工评分保持一致。制定合适的评测标准、应对语言的多样性以及设计综合性评测指标都是需要解决的问题。例如,BLEU指标只考虑单词的严格匹配,而忽略了形态变化、语义相似性和句法合理性等因素。
“评测规则和评判出发点的不同会导致算法模型产生很大差异,因此最终结果也会有所不同。”熊德意解释道。这也解释了为什么当母亲在答案中加入“财富、商队、中国、印度”等关键词时,即使这些关键词之间没有任何联系,她也能获得满分。可能是因为该系统仅依赖于简单的关键词匹配。
此外,口语的人工评分与机器评分也存在较大差距。“尽管近年来语音识别技术有了显著进步,但在开放环境和噪音环境中,识别率仍会大幅下降。”熊德意说。一旦机器听错了单词,就会形成错误传播,导致评分结果大相径庭。
熊德意指出,传统的自动评分指标通常是基于符号计算的,但现在越来越多地应用深度学习等AI技术。通过深度学习,可以将语言符号映射到语义空间,从而计算相似度。即使语言表达不同,只要语义一致,机器也能做出准确的判断。这种方法可以在一定程度上应对语言多样性带来的挑战。然而,深度学习需要大量的数据进行训练。
近年来,基于自监督学习的预训练语言模型取得了重大进展。OpenAI的GPT-3模型在海量语料库上训练,具备强大的语言表示能力,可以执行多种任务。不过,这种模型的高昂成本使其普及仍有一定距离。
AI阅卷系统的优势在于速度快、理性且不受外界干扰。它可以迅速完成阅卷,并提供学情分析,帮助教师减轻负担,提高教学效率。对于无法完全客观化的主观题,可以设定特定的评测标准,逐步提高评分准确性。
熊德意认为,结合人工评测,对AI评分系统进行复核和修正,有助于累积更多训练数据,使评分系统更加智能。未来,进一步完善主观智能评分系统将是教育领域的重要课题。随着技术的进步,AI阅卷系统将越来越“聪明”,人工智能与教育的结合也将更加紧密。