Google Coral 和 Hailo-8 M.2 加速模块

Coral Edge TPU 与 Hailo-8 独立服务器

两个 M.2 推理模块,作为单租户 Moonshot 卡匣的可选配置提供。它们在数据旁边为小型 int8 量化网络打分——它们既不训练也不运行大型语言模型,因此本页不会声称它们能做到。
查看卡匣

M.2 加速器实际适合的工作:

检测与分类

逐帧目标检测、图像分类和姿态估计是这里的原生工作负载。SSD-MobileNet 和 YOLO 系列网络,已经量化为 int8 并为该芯片构建,可在毫秒内返回结果,数据始终不会离开你的机器。

持续打分,低功耗

每个模块仅消耗几瓦功率,因此摄像头或传感器流可以全天候打分,而背后的 Xeon 则运行你的实际应用。这种卸载正是该部件的全部意义:运算转移了,主机保持空闲。

语言模型在别处

两个模块都无法容纳以十亿参数计量的模型,无论是否量化,本页也不会假装可以。确定某个模型需要什么,是 LLM 托管的问题;能回答这个问题的独立显卡,价格见 GPU 独立服务器

Coral M.2 加速器

Google 将 Coral 的 Edge TPU 标定为 8 位整数下 4 TOPS,功耗约两瓦。该标定是 Google 自己的数据,此处按发布值转载——我们尚未自行对该部件进行基准测试。


实际能带来什么:TensorFlow Lite 模型,提前量化为 int8 并通过 Edge TPU 编译器处理,在模块上而非处理器上运行。网络要么能为其编译,要么不能——成熟的视觉模型可以,而那个编译步骤才是真正的入门成本。

Coral 加速器

Hailo-8 M.2 2280 模块

Hailo 自己对 Hailo-8 的标定是 8 位整数下最高 26 TOPS;我们按制造商发布的数据转载该数字,没有自己的基准测试。它是两个选项中更强的一个,当 Coral 级网络不再够用时,就选它。


网络从 TensorFlow 或 ONNX 经由 Hailo 的 Dataflow Compiler 传入,编译结果由 HailoRT 在你选择的操作系统上运行。与 Coral 一样,它只加速神经网络,别无其他——它不是备用的通用算力。

Hailo-8 模块
一个复选框,而非套餐

两个加速器都不是独立产品。每个都只是卡匣配置器上的一行选项,与搭载它的机器一起定价——本页不写任何数字,因为订单表单上才有当前价格。

两种主机卡匣

该插槽搭载 HPE Moonshot 硬件:m710x 采用四核 Xeon E3-1585L v5,或 m510 采用 Xeon D——D-1548 为八核,D-1587 为十六核。先选主机,再为其添加模块。

连驱动都由你掌控

单租户裸金属,带 root 权限。供应商技术栈——Coral 的 Edge TPU 运行时、Hailo-8 的 HailoRT——由你安装,在你的操作系统上,使用你指定的版本。没有任何东西会在你背后更新机器。

当 int8 不再够用

超越 M.2 模块的下一步是独立显卡,而非两个模块。我们上架的每张显卡都与其机器一起列在 GPU 独立服务器;多张显卡——或多台机器——则属于 HPC 领域。

选一个卡匣,勾选模块。

Configure a cartridge