自然言语了解作为人工智能皇冠上的明珠 百度真的摘到了
作者头像
  • 舒尚娥
  • 2020-08-26 14:22:57 4

如今,许多公司都在涉足人工智能领域,但在这些公司中,能够每天服务于数亿用户的却寥寥无几。人工智能不仅仅是单一的技术,而是多种技术融合的结果。任何一个环节出现问题,都可能影响整体的技术水平。然而,要推动人工智能达到更高的水平,关键在于“自然语言理解”(即NLP)的发展。这就好比一个人学习语言的能力,掌握的知识越多,语言表达就越丰富,反之则可能显得浅薄无力。

8月25日,百度CTO王海峰发表了主旨演讲,解读了百度在自然语言和知识技术方面的历程及最新成果,并首次发布了百度大脑自然语言与知识产品的全景图。

王海峰提到,在百度自然语言与知识技术的发展过程中,一直注重把握技术发展趋势和产业趋势,并力求引领潮流。“自然语言和知识技术是人工智能认知能力的核心。”他强调,“通过对语言和知识的研究,使机器能够像人类一样掌握知识和理解语言的自然语言处理技术,对于人工智能的发展至关重要。”

历经近十年的发展,百度已经建立了一套完整的自然语言与知识技术体系,涵盖了知识图谱、语言理解和生成技术,以及基于这些技术的各种应用系统,如智能搜索、机器翻译、对话系统、智能写作和深度问答等。

其中,知识图谱是机器认知世界的基础。随着机器认知能力的提升,对知识和大规模知识图谱的应用也越来越重要。百度打造了全球最大的多源异构知识图谱,拥有超过50亿实体和5500亿事实,并不断更新,广泛应用于各个行业,每天的调用次数超过400亿次。

王海峰详细介绍了百度自然语言与知识技术的整体规划和最新进展。除了基础的知识图谱外,百度还建立了多样化的知识图谱类型,包括行业知识图谱、事件图谱、兴趣图谱等,以及融合语音、视频、图片的多模态知识图谱。这背后是百度创造的一系列知识图谱构建技术,包括无标签大数据开放知识挖掘技术、知识图谱自学习技术和多源异构数据的知识补全与整合技术。

首先,知识图谱是机器认知世界的重要基础。百度打造了全球最大的知识图谱,拥有超过50亿实体和5500亿事实,并不断更新。百度的知识图谱已广泛应用于各行各业,每天的调用次数超过400亿次。

其次,在融入知识的基础上,语言理解能力不断增强。2019年3月,百度提出了知识增强的语义理解框架ERNIE,将知识融入深度学习,具有持续学习能力,并在权威数据集GLUE上取得了突破,首次突破90分大关。基于知识图谱和语义表示,百度在阅读理解、对话理解和跨模态深度语义理解等方面取得了显著进展。

通过ERNIE系统,百度增加了百科知识、篇章结构知识等,提高了模型的效果。此外,百度在语言生成方面也取得了进展。基于多流机制的语言生成预训练技术,能够兼顾词、短语等不同粒度的语义信息,显著提升了生成效果。百度还在探索多文档摘要生成技术,通过图结构语义表示引入篇章知识,提升了单文档和多文档摘要的质量。

百度翻译支持200多种语言,每天处理超过千亿字符的翻译请求,服务超过40万家第三方应用。技术方面,百度提出了多智能体联合学习、基于语义单元的同传模型、稀缺语种分组混合训练算法等。

自然语言和知识技术的进步在搜索、翻译、对话系统等多个产品中得到了体现。王海峰介绍,通过知识图谱、语言理解和跨模态语义理解等技术,智能搜索帮助用户更高效、精准、便捷地获取知识和信息。未来,搜索将无处不在。

百度提出了知识图谱驱动的对话控制技术和首个基于隐空间的大规模开放域对话模型PLATO,并推出了智能对话定制和服务平台UNIT,帮助开发者高效构建智能对话系统,实现规模化应用。百度翻译支持200多种语言,每天处理超过千亿字符的翻译请求,服务超过40万家第三方应用,技术方面,提出了多智能体联合学习、基于语义单元的同传模型、稀缺语种分组混合训练算法等。

百度的语言和知识技术成果也通过开源平台不断向外输出,在互联网、金融、医疗、教育等领域发挥着重要作用,提升了产业智能化水平,得到了广泛认可。

百度在自然语言处理方面继续前进,百度集团副总裁吴甜发布了语义理解技术与平台文心、智能文档分析平台TextMind和AI同传会议解决方案等新产品,并宣布了六项升级,包括智能创作平台的三个场景方案和智能对话定制与服务平台UNIT的三项全新升级。

吴甜表示:“我们将自然语言和知识技术凝聚成一系列技术平台和产品,以实际应用中产生的大量价值,为开发者和产业实践者提供以自然语言和知识技术为核心的系列产品。”

百度研发了知识增强的跨模态深度语义理解技术,通过知识关联跨模态信息,利用语言描述不同模态信息的语义,使机器从“看清”到“看懂”,从“听清”到“听懂”,实现图像和语言、语音和语言的综合理解。融合场景图知识的跨模态语义理解预训练技术大幅提升了跨模态推理能力。

除了理解自然语言,与人交互还需要生成语言。百度基于多流机制的语言生成预训练技术,在生成过程中兼顾词、短语等不同粒度的语义信息,提升了生成效果。多文档摘要生成则通过图结构语义表示,引入篇章结构知识,增强了长文本语义表示能力,解决了跨文档范畴关系建模的问题。结合语言生成技术和其他自然语言和知识技术,百度打造了智能创作平台,被20多家媒体采用,日均调用量超过35万次。

百度的语义理解技术平台“文心”,基于深度学习平台飞桨打造,集成了领先的语义理解核心技术、优秀的预训练模型、全面的自然语言处理算法集、端到端的开发套件和平台,提供一站式自然语言处理开发与服务,让开发者更简单、高效地定制企业级自然语言处理模型。“文心”经过大量实际应用场景的验证,具有强大的工业级落地能力。

“文心”大大减少了开发者的数据标注时间、计算资源投入和模型开发时间。在演示中,百度将100条带情感导向的商品评论注入“文心”中,结束后还能对模型效果进行评估,开发者可以通过API直接调用模型,非常方便。

新发布的智能文档分析平台TextMind,基于OCR和自然语言处理技术,以文档解析为核心能力,支持文档对比与审核,具备“多快好省”的核心优势,促进了企业办公的智能化升级。它可以将原本需要3至5天的工作在1分钟内完成,节省了80%以上的人力成本。

百度大脑智能创作平台针对媒体应用场景进行了升级,推出了智能策划、智能采编、智能审校三大媒体场景方案,进一步帮助媒体工作者更快、更好地创作,切实解决了媒体人的痛点问题。

智能对话定制与服务平台UNIT进行了三项升级:更智能的任务导向对话理解、更便捷的表格问答和融合通用的新对话引擎。此次UNIT的三项新能力将进一步降低任务导向对话和智能问答的定制成本,并融合通用对话能力,提升交互体验。

新发布的AI同传会议解决方案覆盖会议全场景、全流程,旨在打造用户身边的“会议同传专家”。吴甜现场演示了如何仅用一台电脑和一部手机快速搭建一套同传服务,只需简单的操作就能获得专业的同传服务。

数据稀缺和计算资源不足一直是自然语言处理技术研发中的瓶颈。为了突破这一瓶颈,百度联合中国计算机学会、中国中文信息学会发起中文自然语言处理数据共建计划——千言,解决数据稀缺问题。千言一期由来自国内11所高校和企业的数据资源开发者共同建设,涵盖开放域对话、阅读理解等七大任务,20多个中文开源数据集。

百度技术委员会主席吴华表示:“未来,我们希望更多的数据集开发者参与共建千言,共同推进中文信息处理技术的发展,提升在全球范围内的影响力。我们计划在未来三年,面向20多项任务,收集和建设不少于100个中文自然语言处理数据集,覆盖自然语言处理的所有领域。”

    本文来源:图灵汇
责任编辑: : 舒尚娥
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
皇冠明珠人工言语作为了解真的自然智能百度
    下一篇