Módulos aceleradores Google Coral y Hailo-8 M.2

Servidores dedicados Coral Edge TPU & Hailo-8

Dos módulos de inferencia M.2, ofrecidos como opción en cartuchos Moonshot de un solo inquilino. Puntúan redes pequeñas cuantizadas a int8 junto a los datos — y ni entrenan ni sirven modelos de lenguaje grandes, así que esta página no dirá que lo hacen.
Ver los cartuchos

El trabajo para el que un acelerador M.2 está realmente dimensionado:

Detección y clasificación

La detección de objetos fotograma a fotograma, la clasificación de imágenes y la estimación de poses son la carga de trabajo nativa aquí. Las redes de la familia SSD-MobileNet y YOLO, ya cuantizadas a int8 y creadas para el silicio, responden en milisegundos sin que los datos salgan nunca de su máquina.

Puntuación continua, bajo consumo

Cada módulo consume un puñado de vatios, de modo que una transmisión de cámara o sensor puede puntuarse las veinticuatro horas mientras el Xeon que hay detrás ejecuta su aplicación real. Esa descarga es el sentido mismo de la pieza: la aritmética se mueve, el host queda libre.

Los modelos de lenguaje viven en otra parte

Ninguno de los dos módulos puede alojar un modelo de miles de millones de parámetros, cuantizado o no, y nada en esta página finge lo contrario. Determinar qué necesita un modelo dado es una cuestión para el alojamiento de LLM; las tarjetas discretas que lo responden tienen precio en servidores dedicados con GPU.

Acelerador Coral M.2

Google califica la Edge TPU del Coral en 4 TOPS con enteros de 8 bits, con un consumo de unos dos vatios. Esa calificación es de Google, repetida aquí tal como se publicó — nosotros no hemos evaluado la pieza por nuestra cuenta.


Lo que aporta en la práctica: los modelos de TensorFlow Lite, cuantizados a int8 y pasados por el compilador de Edge TPU con antelación, se ejecutan en el módulo en lugar del procesador. Una red o compila para él o no lo hace — los modelos de visión establecidos sí lo hacen, y ese paso de compilación es el verdadero precio de entrada.

Acelerador Coral

Módulo Hailo-8 M.2 2280

La calificación propia de Hailo para el Hailo-8 es de hasta 26 TOPS con enteros de 8 bits; repetimos la cifra tal como la publica el fabricante, sin una evaluación propia. Es la más potente de las dos opciones, y la que hay que marcar cuando una red de clase Coral deja de ser suficiente.


Una red llega desde TensorFlow u ONNX a través del compilador Dataflow de Hailo, y el resultado compilado lo sirve HailoRT en el sistema operativo que usted eligió. Como el Coral, acelera redes neuronales y nada más — no es cómputo de propósito general de repuesto.

Módulo Hailo-8
Una casilla, no un plan

Ninguno de los dos aceleradores es un producto por sí mismo. Cada uno es una línea de opción en el configurador de un cartucho, con precio allí junto a la máquina que lo lleva — en esta página no se escribe ninguna cifra, porque el formulario de pedido tiene la vigente.

Dos cartuchos anfitriones

La ranura va sobre hardware HPE Moonshot: el m710x con un Xeon E3-1585L v5 de cuatro núcleos, o el m510 con Xeon D — ocho núcleos como el D-1548, dieciséis como el D-1587. Elija primero el anfitrión y luego añádale el módulo.

Suyo hasta el controlador

Metal desnudo de un solo inquilino con root. La pila del proveedor — el runtime de Edge TPU para el Coral, HailoRT para el Hailo-8 — la instala usted, en su sistema operativo, en las versiones que fije. Nada actualiza la máquina a sus espaldas.

Cuando int8 deja de ser suficiente

El paso más allá de un módulo M.2 es una tarjeta discreta, no dos módulos. Cada tarjeta que montamos figura con su máquina en servidores dedicados con GPU; más de una tarjeta — o más de una máquina — es territorio de HPC.

Elija un cartucho, marque el módulo.

Configure a cartridge