Modules accélérateurs Google Coral et Hailo-8 M.2

Serveurs dédiés Coral Edge TPU & Hailo-8

Deux modules d’inférence M.2, proposés en option sur les cartouches Moonshot mono-tenant. Ils évaluent de petits réseaux quantifiés en int8 juste à côté des données — et ils n’entraînent ni ne servent de grands modèles de langage, cette page ne prétendra donc pas le contraire.
Voir les cartouches

Le travail pour lequel un accélérateur M.2 est réellement dimensionné :

Détection et classification

La détection d’objets image par image, la classification d’images et l’estimation de pose constituent ici la charge de travail native. Les réseaux de la famille SSD-MobileNet et YOLO, déjà quantifiés en int8 et conçus pour le silicium, répondent en quelques millisecondes sans que les données quittent jamais votre machine.

Évaluation continue, faible consommation

Chaque module consomme quelques watts, de sorte qu’un flux de caméra ou de capteur peut être évalué en continu pendant que le Xeon derrière lui exécute votre application réelle. C’est là tout l’intérêt du composant : le calcul se déplace, l’hôte reste libre.

Les modèles de langage vivent ailleurs

Aucun des deux modules ne peut contenir un modèle mesuré en milliards de paramètres, quantifié ou non, et rien sur cette page ne prétend le contraire. Déterminer ce dont un modèle donné a besoin relève de l’hébergement LLM ; les cartes discrètes qui y répondent sont tarifées sur les serveurs dédiés GPU.

Accélérateur Coral M.2

Google évalue l’Edge TPU du Coral à 4 TOPS sur entiers 8 bits, pour une consommation d’environ deux watts. Cette évaluation est celle de Google, reprise ici telle que publiée — nous n’avons pas nous-mêmes testé le composant.


Ce que cela apporte en pratique : les modèles TensorFlow Lite, quantifiés en int8 et passés au préalable par le compilateur Edge TPU, s’exécutent sur le module plutôt que sur le processeur. Un réseau se compile pour lui ou non — les modèles de vision établis le font, et cette étape de compilation est le véritable prix d’entrée.

Accélérateur Coral

Module Hailo-8 M.2 2280

L’évaluation propre de Hailo pour le Hailo-8 va jusqu’à 26 TOPS sur entiers 8 bits ; nous reprenons le chiffre tel que le fabricant le publie, sans test de notre part. C’est la plus puissante des deux options, et celle à cocher lorsqu’un réseau de classe Coral ne suffit plus.


Un réseau arrive depuis TensorFlow ou ONNX via le compilateur Dataflow de Hailo, et le résultat compilé est servi par HailoRT sur le système d’exploitation que vous avez choisi. Comme le Coral, il accélère les réseaux de neurones et rien d’autre — ce n’est pas de la puissance de calcul généraliste de réserve.

Module Hailo-8
Une case à cocher, pas un forfait

Aucun des deux accélérateurs n’est un produit à part entière. Chacun est une ligne d’option dans le configurateur d’une cartouche, tarifée là, à côté de la machine qui le porte — aucun chiffre n’est inscrit sur cette page, car le bon de commande détient le tarif en vigueur.

Deux cartouches hôtes

L’emplacement repose sur le matériel HPE Moonshot : la m710x sur un Xeon E3-1585L v5 quadricœur, ou la m510 sur Xeon D — huit cœurs en D-1548, seize en D-1587. Choisissez d’abord l’hôte, puis ajoutez-lui le module.

À vous jusqu’au pilote

Bare metal mono-tenant avec accès root. La pile du fournisseur — le runtime Edge TPU pour le Coral, HailoRT pour le Hailo-8 — est installée par vous, sur votre OS, aux versions que vous figez. Rien ne met à jour la machine dans votre dos.

Quand l’int8 ne suffit plus

L’étape au-delà d’un module M.2 est une carte discrète, pas deux modules. Chaque carte que nous montons en baie est listée avec sa machine sur les serveurs dédiés GPU ; plus d’une carte — ou plus d’une machine — relève du HPC.

Choisissez une cartouche, cochez le module.

Configure a cartridge