人声是一种经过精心调校的乐器,其语气、节奏和变化帮助我们分享思想、交流需求和表达情感。尽管计算机科学家多年来一直在努力模拟这些能力,使计算机的声音听起来更加自然,但人工语音仍然难以达到人声的水平。早期的文本到语音系统大多依赖于“连接合成”,即把录音片段切分并重新组合成新的单词和句子,这种方法往往导致声音显得机械,而且修改起来既昂贵又费时。
WaveNet 的出现改变了这一切。这项技术允许人们与产品进行更为自然的互动。WaveNet 从我们更广泛的智能研究项目中发展而来,是一种生成模型,即一种训练AI系统以创建与训练数据集相关的新型数据。这种模型可以接受图像、视频或声音的训练,并且在训练完成后能够根据所学内容生成新的、真实的数据实例。
WaveNet 特别是通过预测哪些声音可能相互跟随来生成语音波形。每个波形以每秒最高24,000个样本的速度构建,从而能够捕捉到人类语音中的自然元素,如咂嘴和呼吸模式。通过包含早期系统忽略的语调、口音、情感等细节,WaveNet 使计算机生成的语音更具丰富性和深度。最初,WaveNet 在生成美式英语和普通话语音时,将人类和计算机生成的语音之间的差距缩小了50%。
WaveNet 的早期版本非常耗时,生成一秒的音频需要数小时。为了满足实际应用的需求,我们利用蒸馏技术,将知识从大型模型转移到较小的模型,使得 WaveNet 的运行速度提高了1000倍。同时,我们还开发了WaveRNN,这是一种更简单、更快、计算效率更高的模型,能够在手机上运行。
WaveNet 不仅改善了人们的日常体验,还帮助那些因神经系统疾病而失去说话能力的人恢复声音。例如,ALS患者蒂姆·肖通过 WaveNet 技术重新获得了发声的能力。WaveNet 和 WaveRNN 现在已经成为 Google Assistant、地图和搜索等服务的重要组成部分,使企业能够从30多种语言的数百种逼真语音中进行选择,甚至可以通过 WaveRNN 服务从30分钟的语音中创建定制语音。
自2016年以来,WaveNet 从一个研究概念发展成为一个被全球数百万人使用的先进系统。这项技术不仅提高了 Google Assistant 的查询响应质量,还帮助数百万人更好地沟通、即时翻译多种语言、扩展小型企业的业务。WaveNet 每天都在帮助世界各地的人们克服沟通、文化和商业障碍。
为了进一步提升性能,我们开发了并行 WaveNet,这是一种比原始 WaveNet 快1000倍以上的模型,能够生成更高品质的音频。这一改进得益于概率密度蒸馏技术,它通过教师和学生网络的合作,实现了并行生成高质量音频的目标。这种方法不仅提高了速度,还保证了音频的自然度。
总之,WaveNet 的发展展示了AI在语音合成领域的巨大潜力,它不仅改善了人们的日常生活,还为未来创造了无限可能。