机器翻译的应用范围越来越广泛,不仅能够创作诗歌、对联,还能推导微分方程,甚至解读脑波信息。
近日,加州大学旧金山分校的Joseph Makin等学者在《自然·神经科学》杂志上发表了一篇论文,题为《利用编码器-解码器框架将大脑皮质活动转化为文本》。研究者们将脑波到文本的转换类比为机器翻译的过程,其中脑波作为输入序列,文本则是输出序列。
研究团队通过让受试者朗读特定文本,并记录相应脑区的电波活动,构建了训练数据集。随后,他们训练了一个端到端的机器翻译模型,该模型能够将受试者的脑波信息精准、实时地转换为句子文本,错误率仅为3%。这一成果具有划时代的意义。
当前,许多用于大脑控制打字的脑机接口技术主要依赖于头部或眼部的残余运动。例如,霍金可以通过手指运动来控制虚拟键盘,但这种方式的速度非常有限。而其他试图将语音解码为文字的技术,即便在较短的文本上,错误率也往往高达60%以上。
相比之下,Joseph Makin等人的研究实现了脑波近乎零延迟地转化为文本,为瘫痪患者带来了极大的便利。
作者借鉴了自然语言处理领域的概念,将自然语言的机器翻译类比为脑波到文本的转换。二者均旨在建立不同表示形式之间的映射关系。具体而言,无论是哪种情况,目标都是将任意长度的序列转换为同样长度的另一序列。值得注意的是,输入和输出序列的长度都是变化的,并且彼此间不一定存在一一对应的关系。
在此次研究中,作者尝试一次性解码一个完整的句子,类似于现代基于深度学习的端到端机器翻译模型。不过,两者的区别在于输入类型:机器翻译的输入是文本,而Joseph等人工作的输入是神经信号,即受试者朗读句子时产生的脑电波。
因此,通过对神经信号进行简单的预处理,即可直接使用序列到序列架构的机器翻译模型进行端到端训练,无需进行重大修改。
为了构建训练数据集,研究人员要求参与者大声朗读一系列句子。一部分数据来源于图片描述,约30个句子,共125个单词;另一部分则来自MOCHA-TIMIT语料库中的数据,以50个句子为一组。此外,还有一组包含60个句子的数据。
研究过程中,参与者需重复朗读选定的句子集三次,其中一次用于测试,另两次用于训练。参与者在朗读时,研究人员通过高密度脑电图网格(ECoG grids)从其大脑皮层采集信号。
收集到的脑电波信号与对应的朗读句子被输入到“编码器-解码器”架构的人工神经网络中进行处理。
人工神经网络处理输入数据的过程分为三个阶段:
时间卷积:为了有效捕捉脑电信号中的重复模式,网络使用固定步长的时间滤波器,对信号的不同部分进行处理。
编码器循环神经网络:经过时间卷积处理后,生成特征序列,该序列被送入编码器循环神经网络,从而得到整个序列的高维编码。
解码器循环神经网络:在解码阶段,高维编码被逐词转化为文本。解码器循环神经网络初始化后,逐步预测每个单词,直至遇到结束标志符为止。
作者采用的神经网络框架如图所示,整个网络的训练目标是接近MFCC(梅尔倒谱系数特征)。然而,在模型测试阶段,MFCC被弃用,解码完全依靠解码器神经网络的输入。训练过程中采用了随机梯度下降法,所有网络层均应用了dropout。
模型性能通过错词率(WER)进行评估,最终结果显示,所有参与者的平均WER为33%,显著优于现有语音解码技术的60%WER。
论文中进行了两个实验:一是探究为何该模型表现优异,二是尝试通过迁移学习提升模型效果。
在“控制变量”实验中,研究人员重新训练了网络,发现使用低密度脑电图网格和减少通道数会导致错词率大幅上升。此外,去除MFCC后,错词率与低密度脑电图网格相近,但优于传统的语音解码尝试。采用全连接网络导致错词率大幅增加,但在特定条件下可通过下采样处理部分改善。
实验还表明,至少需要15次重复训练才能将错词率降至25%以下。为了提高效果,研究者尝试了迁移学习。结果显示,预训练模型能显著降低错词率,特别是在结合了双重迁移学习的情况下,错词率降低了36%。
尽管该研究展示了令人振奋的成果,但也存在明显局限性,即数据集较小,仅包含250个单词和30至50个句子。要将此技术推广至更广泛的自然语言处理领域,还需进一步探索所需数据量及其获取方法。
长期植入脑电图网格(ECoG)可能会显著增加可用数据量,尽管某些情况下功能可能略有下降。此外,机器翻译的核心在于信息序列之间的映射。只要能将问题转化为序列到序列的映射问题,并拥有充足的训练数据,现有的机器翻译技术就能实现重大突破。