Module acceleratoare Google Coral și Hailo-8 M.2

Servere dedicate Coral Edge TPU & Hailo-8

Două module de inferență M.2, oferite ca opțiune pe cartușele Moonshot single-tenant. Evaluează rețele mici, cuantizate int8, chiar lângă date — și nici nu antrenează, nici nu servesc modele de limbaj mari, așa că această pagină nu va pretinde contrariul.
Vezi cartușele

Munca pentru care un accelerator M.2 este de fapt dimensionat:

Detecție și clasificare

Detecția de obiecte cadru cu cadru, clasificarea imaginilor și estimarea poziției sunt sarcina nativă aici. Rețelele din familia SSD-MobileNet și YOLO, deja cuantizate la int8 și construite pentru siliciu, revin în milisecunde fără ca datele să părăsească vreodată mașina ta.

Scoring continuu, consum redus

Fiecare modul consumă câțiva wați, astfel încât un flux de cameră sau senzor poate fi evaluat non-stop în timp ce Xeon-ul din spate rulează aplicația ta reală. Această descărcare este întregul scop al componentei: aritmetica se mută, gazda rămâne liberă.

Modelele de limbaj trăiesc în altă parte

Niciunul dintre module nu poate găzdui un model măsurat în miliarde de parametri, cuantizat sau nu, și nimic de pe această pagină nu pretinde altceva. A stabili de ce are nevoie un anumit model este o întrebare pentru găzduirea LLM; plăcile discrete care răspund la ea sunt listate pe servere dedicate GPU.

Accelerator Coral M.2

Google evaluează Edge TPU-ul Coral la 4 TOPS pe numere întregi pe 8 biți, la un consum de aproximativ doi wați. Această evaluare este a Google, reprodusă aici așa cum a fost publicată — nu am testat noi înșine componenta.


Ce oferă în practică: modelele TensorFlow Lite, cuantizate la int8 și trecute în prealabil prin compilatorul Edge TPU, rulează pe modul în locul procesorului. O rețea fie se compilează pentru el, fie nu — modelele de viziune consacrate se compilează, iar acel pas de compilare este adevăratul preț de intrare.

Accelerator Coral

Modul Hailo-8 M.2 2280

Evaluarea proprie a Hailo pentru Hailo-8 este de până la 26 TOPS pe numere întregi pe 8 biți; reproducem cifra așa cum o publică producătorul, fără un test propriu. Este cea mai puternică dintre cele două opțiuni și cea de bifat atunci când o rețea de clasă Coral nu mai este suficientă.


O rețea ajunge din TensorFlow sau ONNX prin intermediul Dataflow Compiler de la Hailo, iar rezultatul compilat este servit de HailoRT pe sistemul de operare pe care l-ai ales. La fel ca și Coral, accelerează rețele neuronale și nimic altceva — nu este putere de calcul generală de rezervă.

Modul Hailo-8
O bifă, nu un plan

Niciun accelerator nu este un produs de sine stătător. Fiecare este o linie de opțiune în configuratorul unui cartuș, cu prețul afișat acolo lângă mașina care îl poartă — nicio cifră nu este scrisă pe această pagină, deoarece formularul de comandă o conține pe cea actuală.

Două cartușe gazdă

Slotul rulează pe hardware HPE Moonshot: m710x pe un Xeon E3-1585L v5 quad-core, sau m510 pe Xeon D — opt nuclee ca D-1548, șaisprezece ca D-1587. Alege mai întâi gazda, apoi adaugă modulul la ea.

Al tău până la driver

Bare metal single-tenant cu root. Stiva furnizorului — runtime-ul Edge TPU pentru Coral, HailoRT pentru Hailo-8 — este instalată de tine, pe sistemul tău de operare, la versiunile pe care le fixezi. Nimic nu actualizează mașina pe la spatele tău.

Când int8 nu mai este suficient

Pasul dincolo de un modul M.2 este o placă discretă, nu două module. Fiecare placă pe care o montăm este listată cu mașina sa pe servere dedicate GPU; mai mult de o placă — sau mai mult de o mașină — este teritoriu HPC.

Alege un cartuș, bifează modulul.

Configure a cartridge