引燃AI社区,OpenAI新模型打破自然言语与视觉次元壁
作者头像
  • 梁有崴
  • 2021-01-06 18:41:49 6

艺术创作的未来,或许只需要动动手指输入几行文字,剩下的工作就可以交给人工智能来完成。

自然语言与视觉的界限正逐渐模糊。最近,OpenAI 推出了两款连接文本与图像的神经网络——DALL·E 和 CLIP。DALL·E 能够直接根据文本生成图像,而 CLIP 则可以将图像与文本类别匹配。这两款工具引起了人工智能界的广泛关注。

Coursera 的创始人、斯坦福大学教授吴恩达也在社交媒体上表示祝贺,并分享了自己喜爱的“蓝色衬衫+黑色长裤”的设计。

OpenAI 的联合创始人兼首席科学家 Ilya Sutskever 表示,人工智能的长远目标是构建多模态神经网络,即 AI 系统能够学习多个不同模式的概念,从而更好地理解世界。DALL·E 和 CLIP 朝着这个目标迈出了重要一步。

DALL·E 是一个拥有120亿参数的神经网络,通过大量的文本与图像对数据集进行训练,可以根据文本描述生成图像。这个项目的名字来源于皮克斯的经典动画《机器人总动员(WALL·E)》。

DALL·E 不仅可以将文本描述转化为图像,还能将动物和物品拟人化,或将不同概念结合在一起。例如,它可以生成一只穿着芭蕾舞裙的胡萝卜遛狗的画面。此外,DALL·E 还可以生成写着“OpenAI”的商店招牌。

DALL·E 的成功率受到多种因素的影响,包括文本长度和重复次数等。它是一种基于 Transformer 的语言模型,可以接收包含多达1280个 token 的文本和图像数据,并通过最大似然法进行训练。

DALL·E 的词汇表包含文本和图像的 token,每个图像的文本描述最多使用256个 BPE 编码的 token,词汇表大小为16384;图像部分则使用1024个 token,词汇表大小为8192。

在最新发布的博客中,OpenAI 展示了 DALL·E 的多样功能。每段文本生成示例展示了512个生成结果中的前32个,这些结果根据 CLIP 的排序而选择,无需人工干预。

DALL·E 在修改对象属性方面表现优秀,可以生成多边形形状的物体,甚至是现实中不太可能存在的物体,例如绿色闹钟。同时,DALL·E 还能控制多个对象及其属性和空间关系,例如生成一只戴着红色帽子、黄色手套、穿着蓝色衬衫和绿色裤子的刺猬。

此外,DALL·E 还可以生成不同视角的图像,展示物体的内部结构,甚至生成带有特定背景和风格的图像。例如,DALL·E 可以生成不同风格的“看日出的水豚鼠”图像,包括波普艺术风格、超现实主义风格等。

DALL·E 还可以应用于时尚设计和室内设计。例如,它可以生成身穿蓝色衬衫和黑色裤子的橱窗模特形象。此外,DALL·E 能够将不相关的概念结合在一起,例如生成“竖琴蜗牛”这样的图像。

DALL·E 的另一个特点是它可以将不同想法结合起来,生成现实中不存在的新奇物体。例如,它可以生成“长颈鹿龟”这样虚构的物种。

除了 DALL·E,OpenAI 还推出了 CLIP,这是一种可以将图像与文本类别匹配的神经网络。CLIP 的设计旨在解决深度学习在计算机视觉领域面临的一些问题,如数据集创建的成本和时间问题等。

CLIP 在多种图像上进行训练,这些图像具有自然语言监督,并且可以从互联网上轻松获取。CLIP 可以通过自然语言指导执行多种分类任务,而无需针对特定基准进行优化。

CLIP 的训练效率非常高,通过对比目的的方法,CLIP 在零样本分类任务中的性能提升了3至9倍。此外,CLIP 在多种视觉分类任务中表现出色,例如细粒度的目标检测、地理定位等。

尽管 CLIP 在识别常见对象时表现良好,但在更复杂的任务上,如计算图像中对象的数量或预测照片中最接近车辆间的距离时,CLIP 的表现并不理想。此外,CLIP 在非常细粒度的分类任务上不如特定任务的模型,例如区分不同类型的汽车或花卉。

总的来说,DALL·E 和 CLIP 的推出标志着人工智能在多模态理解方面的重大进展。

    本文来源:图灵汇
责任编辑: : 梁有崴
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
引燃模型言语打破视觉自然OpenAI社区
    下一篇