Moduły akceleratorów Google Coral i Hailo-8 M.2

Serwery dedykowane Coral Edge TPU i Hailo-8

Dwa moduły inferencyjne M.2, oferowane jako opcja na kartridżach Moonshot dla jednego najemcy. Oceniają małe, skwantyzowane do int8 sieci tuż obok danych — a nie trenują ani nie obsługują dużych modeli językowych, więc ta strona nie będzie twierdzić, że to robią.
Zobacz kartridże

Do jakiej pracy akcelerator M.2 jest faktycznie przystosowany:

Detekcja i klasyfikacja

Detekcja obiektów klatka po klatce, klasyfikacja obrazów i estymacja pozy to tutaj naturalne obciążenie. Sieci z rodziny SSD-MobileNet i YOLO, już skwantyzowane do int8 i zbudowane pod ten układ, zwracają wyniki w milisekundach, a dane nigdy nie opuszczają Twojej maszyny.

Ciągłe ocenianie, niski pobór mocy

Każdy moduł pobiera zaledwie kilka watów, więc strumień z kamery lub czujnika może być oceniany przez całą dobę, podczas gdy Xeon za nim obsługuje Twoją właściwą aplikację. To odciążenie jest całym sensem tego podzespołu: obliczenia się przenoszą, host pozostaje wolny.

Modele językowe mieszkają gdzie indziej

Żaden z modułów nie pomieści modelu o miliardach parametrów, skwantyzowanego czy nie, i nic na tej stronie nie udaje, że jest inaczej. Ustalenie, czego potrzebuje dany model, to pytanie do hostingu LLM; dyskretne karty, które na nie odpowiadają, są wycenione na serwerach dedykowanych GPU.

Akcelerator Coral M.2

Google ocenia Edge TPU w Coral na 4 TOPS przy liczbach całkowitych 8-bitowych, przy poborze mocy około dwóch watów. Ta wartość pochodzi od Google i jest tu powtórzona zgodnie z publikacją — sami nie testowaliśmy tego podzespołu.


Co to daje w praktyce: modele TensorFlow Lite, skwantyzowane do int8 i wcześniej przepuszczone przez kompilator Edge TPU, działają na module zamiast na procesorze. Sieć albo się dla niego kompiluje, albo nie — uznane modele wizyjne się kompilują, a ten krok kompilacji to prawdziwa cena wejścia.

Akcelerator Coral

Moduł Hailo-8 M.2 2280

Własna ocena Hailo dla Hailo-8 to do 26 TOPS przy liczbach całkowitych 8-bitowych; powtarzamy tę liczbę tak, jak podaje ją producent, bez własnych testów. To silniejsza z dwóch opcji i tę należy zaznaczyć, gdy sieć klasy Coral przestaje wystarczać.


Sieć trafia z TensorFlow lub ONNX przez kompilator Dataflow firmy Hailo, a skompilowany wynik jest obsługiwany przez HailoRT na wybranym przez Ciebie systemie operacyjnym. Podobnie jak Coral przyspiesza sieci neuronowe i nic poza tym — to nie zapasowa moc obliczeniowa ogólnego przeznaczenia.

Moduł Hailo-8
Pole wyboru, nie plan

Żaden z akceleratorów nie jest osobnym produktem. Każdy to jedna linia opcji w konfiguratorze kartridża, wyceniona tam obok maszyny, która go nosi — na tej stronie nie podajemy żadnej kwoty, bo aktualną trzyma formularz zamówienia.

Dwa kartridże hosta

Gniazdo jeździ na sprzęcie HPE Moonshot: m710x na czterordzeniowym Xeon E3-1585L v5 lub m510 na Xeon D — osiem rdzeni jako D-1548, szesnaście jako D-1587. Najpierw wybierz hosta, potem dodaj do niego moduł.

Twój aż po sterownik

Bare metal dla jednego najemcy z uprawnieniami root. Stos dostawcy — środowisko uruchomieniowe Edge TPU dla Coral, HailoRT dla Hailo-8 — instalujesz sam, na swoim systemie, w wersjach, które sam przypniesz. Nic nie aktualizuje maszyny za Twoimi plecami.

Gdy int8 przestaje wystarczać

Krok dalej niż moduł M.2 to dyskretna karta, nie dwa moduły. Każda karta, którą montujemy w szafie, jest wymieniona ze swoją maszyną na serwerach dedykowanych GPU; więcej niż jedna karta — lub więcej niż jedna maszyna — to terytorium HPC.

Wybierz kartridż, zaznacz moduł.

Configure a cartridge