2 月 12 日消息,Arm 发布了其人工智能(AI)平台的重要新产品,包括全新机器学习处理器 Cortex-M55 和神经网络处理器 Ethos-U55。
其中,Ethos-U55 是 Arm 首款针对 Cortex-M 系列处理器的微神经网络处理器(microNPU),与 Cortex-M 系列处理器配合使用,可以显著提升机器学习能力和能效。
Arm 表示,Cortex-M55 与 Ethos-U55 的结合,可以使微控制器的机器学习性能提升 480 倍。随着机器学习在各行各业的应用越来越广泛,Arm 认为终端 AI 市场在未来几年将出现爆发式增长,终端智能设备市场也将进一步发展。
因此,Arm 通过推出全新的 IP 内核和神经网络处理器,不仅扩展了其 AI 产品线,还帮助客户降低芯片开发成本,满足他们提升终端数字信号处理(DSP)和机器学习能力的需求。
一、Cortex-M55:定制指令集和向量扩展
Arm 宣称,此次发布的 Cortex-M55 是其迄今最强大的 AI 处理器之一,也是首款基于 Armv8.1-M 架构、内置 Arm Helium 向量处理技术的处理器。
相较于之前的 Cortex-M 系列处理器,Cortex-M55 的机器学习性能最多可提升 15 倍,DSP 性能最多可提升 5 倍,且功耗更低。此外,Cortex-M55 支持定制指令集(Custom Instructions)。在去年的 Arm TechCon 技术大会上,Arm 首次宣布了这项功能,并与 Cortex-M33 一同推出。
实际上,这种功能与 RISC-V 内核提供的功能类似,目的是在密集执行的内核中,将紧凑的指令序列折叠成一条指令,从而节省功耗和吞吐量。过去,用户需要通过内存映射设备实现这一功能,而现在,Arm 已经可以通过协处理器接口将其更紧密地与 CPU 集成在一起。
这意味着用户能够利用 Cortex-M55 的定制指令集扩展处理器的能力,对特定任务进行优化。除了定制指令集,Cortex-M55 还在内核中首次引入了 Helium 向量处理技术。
Helium,也称为 M-Profile Vector Extension(MVE),可以在 Arm TrustZone 的安全基础上提升 Armv8.1-M 架构的计算性能。它还引入了新的单指令多数据流(SIMD)128 位矢量操作,进一步增强了 DSP 和机器学习应用的性能。
在性能方面,Helium 可以将 Cortex-M55 的数字信号处理器性能提升 5 倍,机器学习性能提升 15 倍。此外,它还依赖现有的寄存器(非 NEON 矢量寄存器),并支持通道(lane)预测、循环(loop)预测、分散/聚集(scatter-gather)等复杂操作。
二、Ethos-U55:简化设计的 NPU
如果希望拥有更强大的机器学习系统,用户可以将 Cortex-M55 与 Ethos-U55 结合使用。
Ethos-U55 是 Arm 的首款微神经网络处理器(microNPU),与现有的 Cortex-M 系列处理器相比,Cortex-M55 与 Ethos-U55 的结合能使机器学习性能提升 480 倍。
功能方面,Ethos-U55 具有高度的可配置性,可以加速空间受限的嵌入式和物联网设备的机器学习推理能力。它的压缩技术可以节省电力并减小机器学习模型的大小,同时还能运行以前只能在较大系统上执行的神经网络计算。
实际上,Ethos-U55 与其他 Ethos-N 系列有所不同。首先,Ethos-N 是独立的 IP 模块,可以放置在 SoC 上,而 Ethos-U55 是为了与配套的 Cortex-M 处理器紧密协作而设计的,并充分利用其处理能力。
同时,Ethos-U55 还可以与较旧的 Cortex-M 系列处理器一起使用,如 Cortex-M7、M4 和 M33 等。从 Ethos-N 系列的多层神经网络(MLP)设计来看,它们是由多个计算引擎实例构成的,每个实例都包含几个主要组件,如 SRAM、MAC 计算引擎(MCE)和可编程层引擎(PLE)。然而,Ethos-U55 由于受功率和面积限制,设计更为简洁,因此 Arm 将其称为 microNPU。
从概念上讲,Ethos-U55 只是一个具有计算引擎的 MLP,但在设计上,Ethos-U55 删除了 PLE。主要原因在于,Ethos-N 系列的 PLE 将 Cortex-M CPU 和 16 通道的矢量引擎集成在一起,导致面积和功耗较高,这对高性能 SoC 来说是可接受的,但对 Ethos-U55 来说则不适用。
Ethos-U55 通过与 Cortex-M55 等 CPU 结合,让用户摆脱了 PLE,改为在配套的 Cortex-M 处理器上进行处理。尽管这不是一个完整的替代方案,但在严格的功率和面积限制下,这是一个可行的折中方案。此外,Ethos-U55 删除了较为昂贵的专用 SRAM 库,因为它只需要很小的 SRAM 就能完成足够的外部处理。
Ethos-U55 假设外部系统具有某种缓存,并与 Cortex-M 处理器共享,仍能完成 MLP 设计的其他工作。例如,让直接内存访问(DMA)根据需求获取 NN 层,此外 NPU 还可以处理内存中的压缩权重和激活工作,在处理前即时解码。
三、M55 与 U55 结合的最高推理性能提升 50 倍
Arm 表示,与 Cortex-M7 相比,基于 Helium 扩展的 Cortex-M55 对典型语音助手类工作负载的推理性能最高可提升 6 倍,能效可提升 7 倍。与 Ethos-U55 结合使用时,这两项性能分别可提升 50 倍和 25 倍。
值得注意的是,要实现这些性能提升,必须重新编译代码,以充分利用新的 M-Profile 向量扩展及 Ethos MAC 引擎的处理能力。
据了解,Cortex-M 系列适用于各种芯片和多种工艺技术。基于此,Arm 表示,在 55nm 或 40nm 等成熟节点上,Ethos-U55 的时钟频率可达 100MHz 至 400MHz,甚至更高。为了更好地调整 NPU 到应用程序,用户可以将 MAC 计算引擎(Compute Engine)配置为 32、64、128 或 256 个 MAC。
在最小配置下(32 个 MAC),用户可以获得 6.4-25.6GOPS 的峰值计算能力;在最大配置下(256 个 MAC),可达到 51.2-205GOPS。在 7nm 或 5nm 这类先进制程节点上,Ethos-U55 的时钟频率可达 1GHz 或更高。此时,128 个 MAC 和 256 个 MAC 配置的峰值计算能力分别为 0.25TOPS 和 0.5TOPS。
四、主要合作伙伴已获得授权
目前,Arm 已向主要合作伙伴开放了 Cortex-M55 和 Ethos-U55 的授权,并将在未来几个月内进一步开放。基于这些 IP 的芯片预计将在 2021 年底上市并实际投入使用。
在应用方面,Cortex-M55 广泛应用于移动设备终端。例如,在智能手机的语音助手、指纹传感器和 RF 系统中,它能够进一步优化这些工作负载。
据了解,已经获得 Cortex-M55 和 Ethos-U55 授权的公司包括谷歌、恩智浦、意法半导体、赛普拉斯和恒玄科技等。
其中,谷歌微控制器部门产品经理 Ian Nappier 表示,Arm 的这一全新 IP 进一步推动了在终端设备上实现机器学习,并达成了数十亿台具有 TensorFlow 功能设备的共同愿景。这些设备仅依靠电池就能运行神经网络模型,并持续多年,还可以直接在终端设备上实现低延迟的推理。
意法半导体微控制器部门总经理 Ricardo De Sa Earp 也提到,全新的 Arm Cortex-M55 可以为意法半导体的下一代微控制器带来所需的机器学习功能和效率提升,从而进一步增强各种 AI 应用。
作为半导体领域重要的 IP 架构供应商,长期以来,Arm 架构一直占据着移动设备领域指令集架构的重要位置。对于 Arm 自身来说,随着 AI 和机器学习技术的不断发展,它也在不断研发新的 IP 架构,完善各类 AI 产品组合,以满足市场上日益增长的 AI 需求。此次 Cortex-M55 和 Ethos-U55 的发布,也为当前的 AI 终端市场开辟了新的创新方向。