语言生成的质量提升一直是个挑战。为了更好地评估生成文本的“自然性”,Percy Liang等来自斯坦福大学的研究者提出了一种新的评估标准——HUSE。该标准结合了人类和统计评估的优点,旨在提供更全面的评估方法。
传统的评估方法如困惑度虽然能反映语言模型生成句子的流畅度,但难以全面衡量生成文本的质量和多样性。尤其是对于需要创造性思维的任务,如对话或故事生成,单纯依赖困惑度并不足以准确评估生成文本的优劣。
斯坦福大学的研究团队提出了一个全新的框架,即HUSE,以解决上述问题。HUSE通过设计一个判别器来区分生成的文本是来自模型还是参考分布,以此来评估生成文本的质量和多样性。具体来说,HUSE通过比较模型生成的文本与真实文本之间的差异,来衡量生成文本的质量和多样性。
研究者们指出,当前的评估方法往往存在误导性,因为它们通常分别评估文本的质量和多样性,而不是同时考虑两者。HUSE通过结合人类判断和统计评估,提供了一个更加综合的视角。通过这种方式,HUSE能够识别出那些仅仅在表面上看似高质量但实际上缺乏多样性的生成文本。
为了实现这一目标,HUSE采用了对抗训练的思想,利用判别器来区分模型生成的文本和参考文本。理想情况下,如果模型生成的文本质量较低,判别器应该能够准确地将其与参考文本区分开来。同样,如果参考文本包含了模型无法生成的内容,判别器也应该能够准确地进行区分。
然而,由于最优判别器难以获取,研究团队提出了一个实用的替代方案。他们使用了基于人类判断分数和模型预测概率的二维空间来近似最优判别器。这种方法不仅能够捕捉到生成文本的质量,还能够衡量其多样性,从而为自然语言生成提供了更全面的评估手段。
这项研究在多个NLP任务上进行了验证,包括文本摘要、故事生成和聊天对话系统。实验结果表明,HUSE在评估生成文本的质量和多样性方面表现出色。尤其是在需要高多样性的任务中,HUSE能够有效识别出那些质量较高但多样性不足的生成文本。
此外,研究团队还提供了代码和数据,以便其他研究人员可以复现实验结果。这些资源可以在CodaLab平台上找到,这是一个由Percy Liang等人创建的开放平台,旨在促进可重复研究的发展。
总的来说,HUSE为自然语言生成提供了一个创新且有效的评估方法。它不仅能够全面衡量生成文本的质量和多样性,还为未来的研究提供了宝贵的工具。通过使用HUSE,研究者们可以更准确地评估和改进自然语言生成系统的性能。