Facebook 开源自然言语处理模型,可检索文档回答成绩
作者头像
  • 天星资本mp
  • 2020-09-29 18:57:26 8

Facebook 和 AI 初创公司 Hugging Face 将于明日发布一种名为检索增强生成(RAG)的AI模型。这是一种自然语言处理工具,能够搜索并解释上下文信息,从而完成各种任务。

RAG 的独特之处在于它可以通过动态调整或补充其外部知识库,使得研究人员能够在不重新训练模型的情况下,控制其获取的信息内容。从明天起,RAG 将作为 Hugging Face 转换器库的一部分提供,与新的数据库集成,以支持 RAG 所需的知识索引。

RAG 的“后融合”知识整合方法

目前,自然语言处理领域的许多通用模型虽已广泛使用,但仍存在一些局限性。它们通常适用于无需专业知识背景的任务,如情绪分析等。

相比之下,RAG 通过从像维基百科这样的数据库中检索相关信息来处理问题。例如,针对“地球上第一只哺乳动物是什么时候出现的?”这样的问题,RAG 可能会搜索与“哺乳动物”、“地球历史”和“哺乳动物进化”相关的文献,然后将其作为上下文输入模型,生成最终答案。

据 Facebook 介绍,RAG 使用了一种“后融合”的知识整合方法,在汇总最终预测结果前对检索到的文档内容进行答案预测。这种方式特别适合那些答案并非完全明示的情况。在某些情况下,即使目标答案并未出现在检索到的文档中,RAG 仍能生成正确的答案。

RAG 在知识密集型任务中的表现

Facebook 表示,在对 NaturalQuestions 数据集进行基准测试时,RAG 展现出了强大的能力,即便是在无法直接找到答案的情况下也能生成准确的结果。

此外,RAG 在处理知识密集型的自然语言任务方面也表现出色。Facebook 通过设计类似于《危险边缘》游戏中的问题来评估其性能。与其他模型相比,RAG 生成的问题更加具体、多样且贴近现实。这可能得益于 RAG 能够综合不同信息源提供的多种数据的能力。

RAG 的研究负责人塞巴斯蒂安·里德尔指出,尽管 RAG 目前尚未在 Facebook 的产品中应用,但研发团队正积极优化,努力减少模型中的偏见。他们将训练数据限制在维基百科上,认为这是比许多现有语言模型使用的网络爬虫更为可靠的数据来源。

RAG 的主要优势:灵活性

研究人员正在探索一种改进版的 RAG,旨在最大限度地降低潜在风险,确保输入的安全性。他们正在研究如何扩展 RAG 的功能,使其能够同时利用多个知识源进行操作。

塞巴斯蒂安·里德尔强调,RAG 的一大亮点是其高度的灵活性。传统上,改变一个预训练的语言模型所需的信息需要对整个模型进行重新训练。而通过 RAG,只需更换用于知识检索的文档即可更新模型所掌握的信息。在 NaturalQuestions、CuratedTrec 和 WebQuestions 数据集上的测试显示,RAG 的表现优异,证明了其在最新机器阅读理解任务中的有效性。

Facebook 认为,RAG 有着巨大的应用前景。该模型能够让研究人员仅通过几行代码就实现复杂知识密集型任务的解决方案部署。Facebook 预计,未来 RAG 将在各种需要深度知识处理的任务中发挥重要作用,如当前的情绪分析等任务。

    本文来源:图灵汇
责任编辑: : 天星资本mp
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
开源Facebook模型言语回答成绩检索自然文档处理
    下一篇