近日,国际自然语言处理领域的顶级学术会议“国际计算语言学协会年会”(ACL 2019)公布了今年大会论文的录用结果。据统计,今年大会的有效投稿数量达到了2694篇,相比去年的1544篇增长了75%。在这次大会中,国内自然语言处理领域的领军企业百度共有10篇论文被收录,展示了其在这一领域的深厚积累和技术实力。
国际计算语言学协会(ACL)成立于1962年,是自然语言处理领域最有影响力的国际学术组织之一,致力于推动计算语言学及相关研究的发展和国际交流。百度高级副总裁、AI技术平台体系(AIG)和基础技术体系(TG)的总负责人王海峰曾在2013年担任ACL主席,成为该组织五十多年来首位华人主席,并且是ACL亚太分会(AACL)的创始人。研究论文被ACL学术年会收录,意味着研究成果获得了国际学术界的认可。
百度入选的10篇论文涵盖了信息抽取、机器阅读理解、对话系统、视频语义理解和机器翻译等多个自然语言处理领域的热门和前沿方向。其中包括基于注意力正则化的ARNOR框架、融合语言表示与知识表示的KT-NET模型、多粒度跨模态注意力机制以及基于端到端深度强化学习的共指解析方法等,这些成果在人机交互、智能客服、视频理解及机器翻译等领域具有重要的应用价值。
百度之所以能在国际学术界取得如此成就,离不开其在自然语言处理领域的领军人物王海峰博士及其团队的努力。王博士在自然语言处理领域的研究及工程成果得到了国际同行的高度认可。他领导的百度自然语言处理团队始终保持着技术领先地位,并且培养和吸引了大量国内外优秀人才。
百度自然语言处理技术广泛应用于其各项业务之中,是智能搜索、信息流、智能家居等产品的重要技术支撑。此外,百度还积极开放其核心能力,赋能各行各业,推动产业智能化升级。作为百度大脑开放平台的核心组成部分,自然语言处理相关技术的日均调用量已超过千亿次,广泛应用于互联网、金融、医疗、零售、出行和服务等行业。在当前国内各行各业积极拥抱人工智能技术的背景下,百度自然语言处理技术正为中国产业智能化进程作出重要贡献。
以下是百度被收录的ACL 2019论文概览:
ARNOR: 基于注意力正则化的噪声减少框架
- 摘要:远监督是一种自动获取标注数据的方法,常用于关系抽取。然而,这种方法通常会产生大量噪声数据。为了减少这种噪声,我们提出了ARNOR框架,它通过注意力机制,使模型能够关注关系指示词,进而识别并减少噪声数据,最终通过迭代方法选择出高质量的数据,显著提升了模型效果。
- 应用价值:该方法降低了对标注数据的依赖,可以低成本地实现基于知识库的自动关系学习,适用于医疗和金融等行业。
KT-NET: 语言表示与知识表示深度融合模型
- 摘要:机器阅读理解不仅需要语言理解能力,还需要知识支持复杂的推理。为此,我们提出了KT-NET模型,该模型结合了语言表示和知识表示,通过注意力机制筛选相关知识,实现了文本表示和知识表示的深度融合,提升了答案边界预测的准确性。
- 应用价值:该技术可以应用于搜索问答、智能音箱等产品中,直接精准定位用户问题的答案,并通过搜索结果或语音播报呈现给用户。
多轮对话的复合评估
- 摘要:传统的对话系统缺乏对多轮对话方向的控制和规划,容易出现重复和发散的问题。为此,我们提出了多轮对话的复合评估方法,并利用强化学习优化对话策略,通过复合评估作为奖励,指导优化对话生成机器人之间的对话策略。
- 应用价值:该技术可以应用于对话系统和智能客服。
基于知识图谱的主动对话
- 摘要:当前的人机对话大多处于被动状态,我们提出了基于知识图谱的主动对话任务,让机器能够主动引领对话进程,完成预先设定的话题转移目标,并保持对话的自然和流畅性。
- 应用价值:该技术可以应用于智能音箱中的对话技能,也可以开发闲聊技能,让机器主动发起基于知识图谱的聊天。
多粒度跨模态注意力机制
- 摘要:视觉问答任务要求系统理解视觉图片信息,并回答相关问题。我们提出了一种多粒度跨模态注意力机制,在图片-句子粒度注意力的基础上,增加了物体级别的注意力机制,增强了对复杂图像和细小物体的识别能力。
- 应用价值:该技术可以应用于基于多模态信息和知识图谱的小视频内容理解项目。
双语词典编纂的高效最近邻搜索
- 摘要:双语词典编纂是提高机器翻译准确性的关键步骤。我们提出了一种高效的最近邻搜索方法,不仅能显著提升双语词典编纂的准确率,还可以应用于其他涉及最近邻搜索的任务。
- 应用价值:该技术可以提高翻译系统的准确率,特别是在小语种文本和专业文献的翻译中。
STACL: 超前预测和可控延迟的同声翻译算法
- 摘要:同声翻译是人工智能领域的一大难题。我们提出了STACL算法,可以在预测的同时控制延迟,显著提升了翻译质量和效率。
- 应用价值:该技术可以用于同声传译系统,如百度世界大会上的应用。
基于模仿学习的同声翻译
- 摘要:我们提出了一种基于模仿学习的同声翻译算法,通过模仿动态策略,模型可以实时决定是否需要等待更多信息来继续翻译,从而在保持低延迟的情况下提高了翻译质量。
- 应用价值:该技术可以用于同声传译系统。
鲁棒的神经机器翻译
- 摘要:该文章旨在提高翻译的鲁棒性,特别是在面对同音词噪声时的表现。我们通过联合嵌入的方法,加入了输入单词的发音信息,实验结果表明该方法显著提升了翻译系统在噪声情况下的鲁棒性和非噪声情况下的性能。
- 应用价值:该技术可以应用于翻译,尤其是语音到语音的同声传译系统。
基于端到端深度强化学习的共指解析
- 摘要:共指解析是信息抽取任务中不可或缺的一部分。我们提出了基于端到端深度强化学习的共指解析方法,直接优化共指解析的评价指标,取得了良好的效果。
- 应用价值:该技术可以应用于知识图谱构建和信息抽取。
以上内容是根据原文进行改写后的内容,确保了信息的准确性和完整性,并且避免了直接引用原文,以降低版权风险。