在短短几年内,深度学习算法取得了显著进展,不仅在棋类游戏中战胜了世界顶尖选手,还能以与人类相当甚至更高的准确率识别人脸。然而,人类语言依然是一个独特且复杂的难题,也是人工智能领域面临的最大挑战之一。
尽管如此,突破是否会如期到来? 一旦计算机能够有效地理解人类语言,这将彻底改变全球各品牌、企业和组织间的互动方式。目前,许多企业无法为每一位客户提供一对一的解答服务。但当语言AI真正成熟时,企业将能够在任何时间通过任何渠道接收、理解并回应每个问题。这是一个令人振奋的发展前景,但实现这一目标仍需漫长的路程。
直到2015年,才有一种人脸识别算法的准确率接近人类水平。Facebook的DeepFace准确率为97.4%,仅比人类的97.5%低一点。相比之下,FBI的传统算法准确率只有85%,意味着其判断错误的概率超过七分之一。FBI的算法由工程师手动开发,每项特征都需要手动编程。而Facebook的算法则实现了特征学习,利用卷积神经网络这种特殊的深度学习架构,模仿人类视觉皮层处理图像的方式。这些皮层之间的联系机制尚不清楚,所以算法自主探索所有“奥秘”。
Facebook取得这一成就的关键在于两点:首先建立一个能够学习特征的架构,然后使用数百万张经过标记的高质量图像进行训练。这两个关键因素使得Facebook的算法能够接近人类的识别能力。
语言理解的挑战 尽管视觉识别已经取得了显著进展,但语言的理解仍然是一个巨大的挑战。人类是目前唯一能够使用复杂语言交流思想的物种。不到十年前,AI算法只能通过某些词汇的频率大致推测语义,但这种方法忽略了同义词的存在,也无法应对不同语境下词语的不同含义。
2013年,Tomas Mikolov和他的谷歌团队发明了一种能够学习单词含义的架构。他们的Word2Vec算法能够将同义词相互映射,从而建模大小、性别、速度等语义,甚至能够将国家与首都等特征关联起来。然而,这种算法仍然缺乏理解上下文的能力。
真正的突破发生在2018年,谷歌推出了BERT模型。Jacob Devlin和他的团队借鉴了传统的机器翻译架构,但加入了学习句子内上下文信息的能力。通过训练该模型填补维基百科文章中的空白,他们成功将语言结构嵌入BERT模型。仅使用少量高质量的标记数据,他们就完成了对BERT的优化,使其能够完成从寻找正确答案到真正理解句子意义的各种任务。这项成就使他们成为了破解语言理解难题的先锋。
2019年,Facebook的研究人员在此基础上更进一步。他们使用100种语言训练出了类似的BERT模型。这个模型能够以一种语言(如英语)进行特征学习,然后将这些能力应用于其他任何语言(如阿拉伯语、汉语和北印度语)。这种跨语言模型在训练所选语言上的表现与BERT相当,并且在转移到其他语言时效果稳定。
这些技术令人印象深刻,但2020年初,谷歌研究人员在广泛的语言理解任务上超越了人类的表现。谷歌引入了更大规模的网络架构和更多的训练数据,最终将BERT架构推向了极限。现在,名为T5的架构在标记句子和寻找答案方面的表现已超过人类。去年10月发布的多语种mT5模型在双语翻译方面达到了接近人类的水平,甚至支持多达100种语言。谷歌最近还公布了新的万亿级参数模型,整体架构规模更大,性能进一步提升。
可能性 想象一下,未来的聊天机器人能够理解您用任何语言书写的内容,真正理解上下文并记住之前的对话。这意味着我们不再只是收到一些简单的预设回复,而是能得到真正关心和解答。
搜索引擎将能理解您的问题,并给出正确的答案,而不再纠结于您的用词是否精准。您或许还会拥有一个了解业务流程的AI助手。更重要的是,如果能使用正确的术语,谷歌搜索可能直接解决客户的具体问题。繁杂的内部文档将不再需要,只需交给AI模型快速浏览即可。
数据库将迎来新时代。我们将彻底告别繁琐的数据构造工作——所有的备忘录、邮件和报告都将由AI模型自动解释、存储和索引。由于数据库能够理解人类语言,您无需求助IT部门即可直接查询和创建报告。
这一切只是冰山一角。目前依赖于人类语言理解能力的所有流程,都有可能被自动化技术彻底改变。
并非易事 然而,问题依然存在。既然这些算法如此出色,为什么它们还没有广泛应用?训练T5模型的成本高昂,谷歌为此花费了约130万美元。幸运的是,谷歌研究人员慷慨地分享了这些模型。但如果要针对特定任务进行微调,仍需投入大量资源和时间。
不过,随着企业的持续探索和研究,相信未来会有更多应用场景出现。如果相信摩尔定律,那么五年左右后我们将会看到更加复杂的语言AI应用,届时会有新的模型超越T5算法。
2021年,我们距离AI技术的转折性突破还有很长的路要走。但只要能够克服这一障碍,AI技术必将释放出无限潜力。