CMP 170HX ma ten sam rdzeń GA100 co A100, a z fabryki wyjechał z większością tego rdzenia odgrodzoną: widoczne 8 GB pamięci HBM2e, przepustowość FP32 zdławiona do minimum, łącze ograniczone do PCIe Gen 1. Poprawiona wersja otwartego sterownika NVIDIA’ego usuwa te ograniczenia. Kompilujemy ją w Ubuntu podczas instalacji Twojego serwera, dzięki czemu karta jest odblokowana, zanim zalogujesz się po raz pierwszy.
LTT Labs odblokowało CMP 170HX we wrześniu 2026 i przetestowało go przeciwko sobie — zablokowanego i odblokowanego — na jednym stanowisku testowym. To ich liczby, nie nasze, a każdy wiersz wskazuje, skąd pochodzi. Cytujemy je ze względu na skalę zmiany: szybkość tokenów zależy od modelu, kwantyzacji, wersji llama.cpp i flag, więc traktuj je raczej jako proporcję niż obietnicę.
| Measure | As NVIDIA shipped it | Unlocked | Source |
|---|---|---|---|
| Card memory | 8 GB HBM2e | 64 GB HBM2e | cmpunlocker; 65,536 MiB measured by LTT Labs |
| FP32 fused multiply-add | about 0.39 TFLOPS | unthrottled | 170th Street (stock); cmpunlocker (full SM throughput) |
| PCIe link | Gen 1 x4 | Gen 2 x4 | cmpunlocker |
| Host to card, measured | 0.84 GB/s | 1.68 GB/s | LTT Labs, nvbandwidth |
| 8B model at 4-bit, generating | 30 tokens/s | 113 tokens/s | LTT Labs, llama.cpp, Granite 4.1 8B Q4_K_M |
| 8B model at 4-bit, reading a prompt | 351 tokens/s | 2,994 tokens/s | LTT Labs, llama.cpp, pp512 |
| 27B model at 4-bit (~16 GB) | does not fit | 38 tokens/s | LTT Labs, llama.cpp, Qwen 3.6 27B Q4_K_M |
| 27B model at 8-bit (~29 GB) | does not fit | 33 tokens/s | LTT Labs, llama.cpp, Qwen 3.8 27B Q8_0 |
Pamięć to zmiana, która ma znaczenie. Przy 8 GB karta mieści mały model i niewiele więcej. Przy 64 GB mieści model o 27 miliardach parametrów w 8-bitach, a większość karty pozostaje wolna na kontekst — to różnica między kartą, na której można eksperymentować, a taką, z której można serwować.
Generowanie tokenów opiera się na przepustowości, odczytywanie promptu na arytmetyce. Generowanie tekstu jest ograniczone tym, jak szybko wagi wypływają z pamięci, w czym HBM2e zawsze było dobre; odczytywanie długiego promptu jest ograniczone jednostkami mnożąco-sumującymi, czyli tam, gdzie dławienie bolało najbardziej i gdzie odblokowanie daje największy efekt.
Łącze prawie nie ma znaczenia, gdy model jest już załadowany. Gen 2 x4 podwaja przepustowość host-karta, co skraca ładowanie. Potem wagi znajdują się na karcie, a magistrala jest bezczynna.
Każdy może przeczytać README cmpunlockera. To, za co warto zapłacić, to wszystko wokół niego — wykonane przed przekazaniem i utrzymywane w działaniu po nim. Ty nie musisz niczego uruchamiać.
Instalator dodaje repozytorium CUDA firmy NVIDIA i instaluje przestrzeń użytkownika otwartego sterownika dla wersji 610.57.04, bez środowiska graficznego i bez DKMS, a następnie przytrzymuje każdy jego element na tej wersji: pakiet nvidia-driver-pinning-610.57.04 na Ubuntu i Debianie oraz blokadę wersji dnf na AlmaLinux i Rocky. Odblokowanie jest zbudowane pod jedną konkretną wersję sterownika; to właśnie przypięcie sprawia, że rutynowa aktualizacja nie wyciągnie bibliotek spod niego.
Pobieramy cmpunlocker w ustalonym commicie i budujemy jego załatany moduł nvidia.ko wewnątrz nowego systemu, pod jądro, które zaraz wystartuje, zanim instalator wyłączy zasilanie. Łaty zmieniają sposób, w jaki sterownik uruchamia kartę. Na karcie nic nie jest flashowane, więc usunięcie sterownika przywraca ją dokładnie do stanu pierwotnego.
Odblokowanie działa tylko przy pierwszym załadowaniu sterownika po całkowitym odcięciu zasilania karty, dlatego każda z tych instalacji kończy się wyłączeniem serwera i ponownym włączeniem go przez BMC, a pierwszą rzeczą, która dotyka karty, jest załatany sterownik.
Gdy zainstalowany system po raz pierwszy odpowiada, instalacja pyta każdą kartę, jako co się zgłosiła — pamięć, generacja PCIe i szerokość łącza — a następnie zapisuje i odczytuje każdy bajt pamięci, który wydaje sterownik, wzorcami stałymi, adresowymi i pseudolosowymi. Obie odpowiedzi trafiają do dziennika konfiguracji serwera, gdzie widzi je dział wsparcia. cmp-unlock status i cmp-unlock memtest dają te same odpowiedzi z powłoki.
Hak jądra (/etc/kernel/postinst.d lub /etc/kernel/install.d na AlmaLinux i Rocky) przebudowuje załatane moduły dla każdego nowego jądra, z kopii źródeł NVIDIA przechowywanej na maszynie, dzięki czemu nienadzorowana aktualizacja nie odeśle po cichu karty do 8 GB. Menedżer pakietów otrzymuje też polecenie odrzucania pakietów, które umieściłyby obok drugi, standardowy sterownik; zainstaluj CUDA przez apt install cuda-toolkit lub dnf install cuda-toolkit, a on nigdy się nie pojawi.
Wyłącznie wagi, zaokrąglane w górę. Model uznaje się za mieszczący się, gdy karta może go pomieścić z zapasem od ćwierci do połowy na pamięć podręczną KV i środowisko uruchomieniowe; poniżej tego ładuje się, a potem kończy pamięć w chwili, gdy rośnie kontekst. To ta sama reguła, według której nasza strona o LLM dobiera rozmiar każdej karty.
| Model size | Precision | Weights | 8 GB, locked | 64 GB, unlocked |
|---|---|---|---|---|
| 7-8 billion parameters | 16-bit | 16 GB | — | fits |
| 8-bit | 8 GB | — | fits | |
| 4-bit | 5 GB | fits | fits | |
| 13-14 billion parameters | 16-bit | 28 GB | — | fits |
| 8-bit | 14 GB | — | fits | |
| 4-bit | 8 GB | — | fits | |
| 30-34 billion parameters | 16-bit | 68 GB | — | — |
| 8-bit | 34 GB | — | fits | |
| 4-bit | 19 GB | — | fits | |
| 70 billion parameters | 16-bit | 140 GB | — | — |
| 8-bit | 70 GB | — | — | |
| 4-bit | 38 GB | — | fits |
Odblokowany CMP to bardzo dobra karta inferencyjna w swojej cenie. To nie jest A100 i w tych miejscach to widać.
Karta to osobna pozycja na fakturze, a maszyna to druga; obie się sumują. Poniższe kwoty to minimum, jakie może kosztować ta konfiguracja: karta w najtańszej kompletnej maszynie, która ją przyjmie, przed naliczeniem podatku od sprzedaży. Konfigurator może otworzyć się z większą ilością pamięci; zmień tam procesor, pamięć lub dyski, a każda zmiana zostanie od razu wyceniona.
| Card | NVIDIA CMP 170HX: 64 GB HBM2e unlocked (8 GB HBM2e without the patched driver) |
|---|---|
| Card, per month | $189 |
| Machine | Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps |
| Machine, per month | $83.67 |
| Together | $272.67 a month |
| Setup | $29 once |
| Cards per machine | 1 to 4 |
| Cities | New York, Bucharest, San Francisco and Miami |
| Term | Monthly; 15% off on a twelve-month cycle |
| Driver | NVIDIA open 610.57.04, patched by cmpunlocker, on Ubuntu 22.04–26.04, Debian 12/13, AlmaLinux 9/10 or Rocky Linux 9/10 |
| Memory test | Every byte the driver hands out, written and read back on each card before handover |
Do wynajęcia również na miesiąc: maszyny CMP 170HX, które ich właściciele wystawili na naszym rynku, każda w cenie ustalonej przez właściciela. Niektóre są wystawiane za pośrednictwem naszej siostrzanej firmy, Primcast, i te wynajmuje się na primcast.com.