还在滑动鼠标找答案?自然语言处理技术助力实现“即问即答”
作者头像
  • 大朋VR
  • 2022-04-25 08:40:07 18

人工智能自然语言处理中的开放域问答技术在智能搜索、智能助手和智能客服等领域扮演着重要角色。近年来,随着智能手机和智能音箱的普及,智能搜索技术迅速进步,使用户能够在这些设备上更高效地获取所需信息。

最近,百度提出了一种名为RocketQA的新型检索模型训练方法,旨在提高机器问答的理解能力,推动智能问答技术的发展。这种方法在多个问答相关的数据集中表现卓越,包括在微软MSMARCO数据集的段落排序任务中名列前茅,超越了谷歌、微软、脸书、阿里、美团、卡内基梅隆大学和清华大学等机构。

微软MSMARCO数据集是一个大规模的问答数据集,包含约100万个问题、880万个相关段落以及人工标注的答案。RocketQA在此数据集上的出色表现体现了百度在检索模型方面的领先地位。

百度的RocketQA采用了一种对偶式检索模型训练方法,结合了百度自主研发的语义理解技术——文心(ERNIE)。这种对偶式检索模型基于深度语义表示,能进行更深层次的学习,同时借助预训练语言模型来增强语义理解。尽管如此,这种模型在某些问答场景中仍存在不足,如训练和预测场景中的样本数量差异、数据集中存在大量未标注的正确答案,以及人工标注数据规模小、成本高等问题。

为了应对这些问题,百度RocketQA引入了三种关键技术:跨批次负采样、去噪的强负例采样和数据增强。这些技术有效提升了对偶式检索模型的效果。在实现RocketQA的过程中,这些技术层层递进,最终形成一套完整的解决方案。此外,百度文心(ERNIE)也被用于初始化模型参数。

实验结果表明,RocketQA在微软MSMARCO和谷歌Natural Questions数据集上的性能均超过了现有最佳检索模型。在答案抽取任务中,RocketQA也展现了其有效性。

RocketQA的提出标志着“端到端问答”技术迈出了重要一步。与传统的级联式问答系统相比,“端到端问答”系统更为简洁,每个模块(如段落检索和答案定位)都是可学习的。这种设计使得系统能够进行端到端训练,从而更好地适应用户的实时反馈,而非仅依赖于封闭数据集。

高性能的并行训练也是研发过程中不可或缺的一环。百度RocketQA的实现完全基于飞桨深度学习框架。通过使用飞桨分布式训练API(paddle.distributed.fleet)和飞桨分布式训练扩展工具FleetX,研究人员能够大幅提升试验效率和使用效率。

目前,RocketQA已被应用于百度搜索、广告等核心业务中,并有望在更多场景中发挥作用。例如,在百度搜索中,问答技术的应用显著改善了用户体验。用户在搜索时能够更快地获得精确答案,而不是过去常见的十条链接。这不仅提高了搜索效率,也提升了用户的满意度。

正如示例所示,当用户在百度搜索框中输入问题时,如“佩奇是公猪还是母猪”,搜索结果的第一条直接展示出明确的答案,而不是一系列链接。这种改进大大提升了问答的效率,使用户能更快获得所需信息。随着RocketQA的广泛应用,百度搜索的用户体验将进一步提升。

    本文来源:图灵汇
责任编辑: : 大朋VR
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
自然语言滑动助力鼠标答案实现处理技术
    下一篇