NVIDIA CMP 170HX · GA100 · odblokowana podczas instalacji

Odblokowane serwery dedykowane CMP. Całe 64 GB karty, a nie 8 GB, które NVIDIA pozostawiła włączone.

CMP 170HX ma ten sam rdzeń GA100 co A100, a z fabryki wyjechał z większością tego rdzenia odgrodzoną: widoczne 8 GB pamięci HBM2e, przepustowość FP32 zdławiona do minimum, łącze ograniczone do PCIe Gen 1. Poprawiona wersja otwartego sterownika NVIDIA’ego usuwa te ograniczenia. Kompilujemy ją w Ubuntu podczas instalacji Twojego serwera, dzięki czemu karta jest odblokowana, zanim zalogujesz się po raz pierwszy.

64 GB HBM2e per cardUbuntu, Debian, AlmaLinux or RockyUp to 4 cards per machinefrom $272.67/mo complete
Przed i po, na tej samej karcie

Co zmienia załatany sterownik

LTT Labs odblokowało CMP 170HX we wrześniu 2026 i przetestowało go przeciwko sobie — zablokowanego i odblokowanego — na jednym stanowisku testowym. To ich liczby, nie nasze, a każdy wiersz wskazuje, skąd pochodzi. Cytujemy je ze względu na skalę zmiany: szybkość tokenów zależy od modelu, kwantyzacji, wersji llama.cpp i flag, więc traktuj je raczej jako proporcję niż obietnicę.

MeasureAs NVIDIA shipped itUnlockedSource
Card memory8 GB HBM2e64 GB HBM2ecmpunlocker; 65,536 MiB measured by LTT Labs
FP32 fused multiply-addabout 0.39 TFLOPSunthrottled170th Street (stock); cmpunlocker (full SM throughput)
PCIe linkGen 1 x4Gen 2 x4cmpunlocker
Host to card, measured0.84 GB/s1.68 GB/sLTT Labs, nvbandwidth
8B model at 4-bit, generating30 tokens/s113 tokens/sLTT Labs, llama.cpp, Granite 4.1 8B Q4_K_M
8B model at 4-bit, reading a prompt351 tokens/s2,994 tokens/sLTT Labs, llama.cpp, pp512
27B model at 4-bit (~16 GB)does not fit38 tokens/sLTT Labs, llama.cpp, Qwen 3.6 27B Q4_K_M
27B model at 8-bit (~29 GB)does not fit33 tokens/sLTT Labs, llama.cpp, Qwen 3.8 27B Q8_0

Pamięć to zmiana, która ma znaczenie. Przy 8 GB karta mieści mały model i niewiele więcej. Przy 64 GB mieści model o 27 miliardach parametrów w 8-bitach, a większość karty pozostaje wolna na kontekst — to różnica między kartą, na której można eksperymentować, a taką, z której można serwować.

Generowanie tokenów opiera się na przepustowości, odczytywanie promptu na arytmetyce. Generowanie tekstu jest ograniczone tym, jak szybko wagi wypływają z pamięci, w czym HBM2e zawsze było dobre; odczytywanie długiego promptu jest ograniczone jednostkami mnożąco-sumującymi, czyli tam, gdzie dławienie bolało najbardziej i gdzie odblokowanie daje największy efekt.

Łącze prawie nie ma znaczenia, gdy model jest już załadowany. Gen 2 x4 podwaja przepustowość host-karta, co skraca ładowanie. Potem wagi znajdują się na karcie, a magistrala jest bezczynna.

Źródła: LTT Labs, “Actually Download More RAM” (12 września 2026) dla każdego zmierzonego wiersza; 170th Street dla fabrycznej wartości FP32; cmpunlocker dla tego, co przywracają łatki.

Instalacja krok po kroku

Jak odblokowanie trafia na maszynę

Każdy może przeczytać README cmpunlockera. To, za co warto zapłacić, to wszystko wokół niego — wykonane przed przekazaniem i utrzymywane w działaniu po nim. Ty nie musisz niczego uruchamiać.

  1. Otwarty sterownik NVIDIA przypięty do jednej wersji

    Instalator dodaje repozytorium CUDA firmy NVIDIA i instaluje przestrzeń użytkownika otwartego sterownika dla wersji 610.57.04, bez środowiska graficznego i bez DKMS, a następnie przytrzymuje każdy jego element na tej wersji: pakiet nvidia-driver-pinning-610.57.04 na Ubuntu i Debianie oraz blokadę wersji dnf na AlmaLinux i Rocky. Odblokowanie jest zbudowane pod jedną konkretną wersję sterownika; to właśnie przypięcie sprawia, że rutynowa aktualizacja nie wyciągnie bibliotek spod niego.

  2. cmpunlocker skompilowany pod twoje jądro

    Pobieramy cmpunlocker w ustalonym commicie i budujemy jego załatany moduł nvidia.ko wewnątrz nowego systemu, pod jądro, które zaraz wystartuje, zanim instalator wyłączy zasilanie. Łaty zmieniają sposób, w jaki sterownik uruchamia kartę. Na karcie nic nie jest flashowane, więc usunięcie sterownika przywraca ją dokładnie do stanu pierwotnego.

  3. Zimny pierwszy rozruch

    Odblokowanie działa tylko przy pierwszym załadowaniu sterownika po całkowitym odcięciu zasilania karty, dlatego każda z tych instalacji kończy się wyłączeniem serwera i ponownym włączeniem go przez BMC, a pierwszą rzeczą, która dotyka karty, jest załatany sterownik.

  4. Sprawdzenie, a potem test pamięci, przy pierwszym logowaniu

    Gdy zainstalowany system po raz pierwszy odpowiada, instalacja pyta każdą kartę, jako co się zgłosiła — pamięć, generacja PCIe i szerokość łącza — a następnie zapisuje i odczytuje każdy bajt pamięci, który wydaje sterownik, wzorcami stałymi, adresowymi i pseudolosowymi. Obie odpowiedzi trafiają do dziennika konfiguracji serwera, gdzie widzi je dział wsparcia. cmp-unlock status i cmp-unlock memtest dają te same odpowiedzi z powłoki.

  5. Aktualizacje jądra nie blokują go ponownie

    Hak jądra (/etc/kernel/postinst.d lub /etc/kernel/install.d na AlmaLinux i Rocky) przebudowuje załatane moduły dla każdego nowego jądra, z kopii źródeł NVIDIA przechowywanej na maszynie, dzięki czemu nienadzorowana aktualizacja nie odeśle po cichu karty do 8 GB. Menedżer pakietów otrzymuje też polecenie odrzucania pakietów, które umieściłyby obok drugi, standardowy sterownik; zainstaluj CUDA przez apt install cuda-toolkit lub dnf install cuda-toolkit, a on nigdy się nie pojawi.

Dobór rozmiaru według reguły stosowanej na całej stronie

Co mieści się w 64 GB, a co mieściło się w 8

Wyłącznie wagi, zaokrąglane w górę. Model uznaje się za mieszczący się, gdy karta może go pomieścić z zapasem od ćwierci do połowy na pamięć podręczną KV i środowisko uruchomieniowe; poniżej tego ładuje się, a potem kończy pamięć w chwili, gdy rośnie kontekst. To ta sama reguła, według której nasza strona o LLM dobiera rozmiar każdej karty.

Model sizePrecisionWeights8 GB, locked64 GB, unlocked
7-8 billion parameters16-bit16 GB—fits
8-bit8 GB—fits
4-bit5 GBfitsfits
13-14 billion parameters16-bit28 GB—fits
8-bit14 GB—fits
4-bit8 GB—fits
30-34 billion parameters16-bit68 GB——
8-bit34 GB—fits
4-bit19 GB—fits
70 billion parameters16-bit140 GB——
8-bit70 GB——
4-bit38 GB—fits

Dwie karty w jednej maszynie mieszczą to, czego nie mieści jedna: model o 70 miliardach parametrów w 8 bitach potrzebuje około 70 GB, co mieści się na parze kart. Dzielenie modelu na kilka kart lub kilka maszyn opisuje strona o wielu GPU. Maszynie należy też dać co najmniej tyle pamięci systemowej, ile waży największy plik modelu; najtańszy zestaw poniżej ma 16 GB, co ładuje plik 38 GB, tylko wolno.

Przeczytaj, zanim zamówisz

Czego odblokowanie nie zmienia

Odblokowany CMP to bardzo dobra karta inferencyjna w swojej cenie. To nie jest A100 i w tych miejscach to widać.

Brak ECC
Korekcja błędów w HBM2e jest nadal wyłączona; znajduje się na liście rzeczy, których nikt jeszcze nie odblokował. Przy inferencji przekręcony bit kosztuje ponowienie próby. Do tygodniowego treningu lub czegokolwiek, co musi być bitowo dokładne, wybierz kartę z chronioną pamięcią, na przykład L40S.
PCIe Gen 2 x4
Około 1,7 GB/s z hosta do karty, zmierzone, więc sama magistrala potrzebuje około 25 sekund na przeniesienie modelu o wielkości 38 GB. Model przechodzi przez nią raz, a potem mieszka na karcie, dlatego serwowanie prawie tego nie odczuwa. Pętla treningowa strumieniująca paczki z pamięci systemowej odczuwa to na każdym kroku.
Formaty liczb Ampere’a
FP16, BF16, TF32 i INT8 na rdzeniach tensorowych. Brak FP8 i FP4; oba pojawiły się w generacjach po Ampere. Modele skwantyzowane w GGUF, AWQ lub GPTQ działają dobrze, ponieważ rozpakowują się do formatów, które karta obsługuje.
Tylko Linux
Odblokowanie to sterownik jądra Linux. Zamów maszynę z Ubuntu, Debianem, AlmaLinux lub Rocky Linux i jest wbudowane; na Windows lub Proxmox VE karta działa tak, jak dostarczyła ją NVIDIA, z 8 GB.
Secure Boot wyłączony
Złatane moduły są niepodpisane, więc jądro z wymuszonym Secure Boot je odrzuca, a karta zostaje całkowicie bez sterownika. Pozostaw go wyłączonym.
Kod społeczności, nie NVIDII
cmpunlocker to projekt open source (GPL-2.0) autorstwa Amogha Munikote, a NVIDIA go nie wspiera. Instalujemy commit, który sami zbudowaliśmy i sprawdziliśmy, i celowo utrzymujemy tę wersję, nigdy automatycznie.
Karta 10 GB zatrzymuje się na 40 GB
Karta 8 GB odblokowuje się do 64 GB. Karta 10 GB ma więcej pamięci w obudowie, niż wytrzymuje pod obciążeniem, więc odblokowanie zatrzymuje ją na 40 GB, czyli rozmiarze, który pozostaje stabilny. Instalator odczytuje, która karta jest w maszynie, i stosuje właściwą geometrię do każdej z nich.
Maszyna za przyciskiem

Jeden odblokowany CMP, w najtańszej maszynie, która go przyjmie

Karta to osobna pozycja na fakturze, a maszyna to druga; obie się sumują. Poniższe kwoty to minimum, jakie może kosztować ta konfiguracja: karta w najtańszej kompletnej maszynie, która ją przyjmie, przed naliczeniem podatku od sprzedaży. Konfigurator może otworzyć się z większą ilością pamięci; zmień tam procesor, pamięć lub dyski, a każda zmiana zostanie od razu wyceniona.

NVIDIA CMP 170HX, pełnowymiarowa karta pasywna bez wyjść wideo na śledziu
Pasywna, pełnowymiarowa karta o poborze mocy do 250 W, bez wentylatora. Została zaprojektowana do obudowy serwerowej z przepływem powietrza od przodu do tyłu i właśnie w takich pracuje u nas.
CardNVIDIA CMP 170HX: 64 GB HBM2e unlocked (8 GB HBM2e without the patched driver)
Card, per month$189
MachineIntel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps
Machine, per month$83.67
Together$272.67 a month
Setup$29 once
Cards per machine1 to 4
CitiesNew York, Bucharest, San Francisco and Miami
TermMonthly; 15% off on a twelve-month cycle
DriverNVIDIA open 610.57.04, patched by cmpunlocker, on Ubuntu 22.04–26.04, Debian 12/13, AlmaLinux 9/10 or Rocky Linux 9/10
Memory testEvery byte the driver hands out, written and read back on each card before handover

Otwórz tę konfigurację w konfiguratorze →

Opłata instalacyjna wynika z tego, że karta jest montowana na zamówienie: maszyna z dodaną kartą to konfiguracja niestandardowa. Miesięczna kwota pozostaje taka sama przy odnowieniu. Każdą inną kartę, którą montujemy, wyceniamy w ten sam sposób na stronie GPU.

Pytania o tę kartę

Serwery CMP z odblokowaniem — pytania i odpowiedzi

Czym jest odblokowany CMP 170HX?
NVIDIA CMP 170HX działający na poprawionej wersji otwartego sterownika jądra NVIDIA z projektu cmpunlocker. Karta to GA100, ten sam układ co w A100, który NVIDIA wypuściła z widocznymi 8 GB pamięci HBM2e, ograniczonym mnożeniem-dodawaniem FP32 i łączem trzymanym na PCIe Gen 1. Poprawiony sterownik udostępnia 64 GB, usuwa ograniczenie i przy każdym starcie karty negocjuje łącze w standardzie Gen 2. Na samej karcie nic nie jest modyfikowane.
Ile pamięci ma odblokowany CMP 170HX?
64 GB HBM2e na karcie 8 GB — tyle pokazuje nvidia-smi, gdy działa poprawiony sterownik. Wersja 10 GB karty jest utrzymywana na 40 GB, czyli rozmiarze, który pozostaje na niej stabilny. Bez poprawionego sterownika każda karta pokazuje to, co dostarczyła NVIDIA: 8 lub 10 GB.
Czy odblokowanie przetrwa ponowne uruchomienia i aktualizacje jądra?
Tak. Poprawione moduły są instalowane jak każdy inny moduł jądra i ładują się przy każdym rozruchu. Gdy pojawia się nowe jądro, hak przebudowuje je dla niego ze źródeł NVIDIA przechowywanych na maszynie, zanim w ogóle z niego uruchomisz system. Jeśli karta mimo to wystartuje z 8 GB, uruchom cmp-unlock build z wersją swojego jądra i zrestartuj serwer z panelu sterowania.
Które systemy operacyjne otrzymują odblokowany sterownik?
Ubuntu 22.04, 24.04 i 26.04, Debian 12 i 13, AlmaLinux 9 i 10 oraz Rocky Linux 9 i 10, instalowane przez nas, na każdej maszynie z tą kartą: to część instalacji, a nie opcja do zaznaczenia. Windows i Proxmox VE otrzymują kartę w wersji dostarczonej przez NVIDIA: odblokowanie to sterownik jądra Linux, a na Proxmoksie karty zwykle trafiają do maszyn wirtualnych, do których sterownik hosta nie dociera.
Czy mogę na niej używać CUDA, PyTorch, vLLM i llama.cpp?
Tak. Sterownik to własny 610.57.04 NVIDIA z naniesionymi poprawkami, więc wszystko zbudowane dla karty Ampere z aktualnym sterownikiem będzie działać. Zainstaluj zestaw narzędzi CUDA osobno, przez apt install cuda-toolkit lub dnf install cuda-toolkit; metapakiety cuda i cuda-drivers przyniosłyby ze sobą drugi, standardowy sterownik, dlatego menedżer pakietów jest ustawiony tak, by je odrzucać.
Czy model o 70 miliardach parametrów uruchomi się na jednej karcie?
Przy kwantyzacji 4-bitowej tak: wagi zajmują około 38 GB, co pozostawia zapas wymagany przez naszą zasadę doboru rozmiaru na karcie 64 GB. Przy 8-bitowej zajmują około 70 GB, co wymaga dwóch kart; jedna maszyna mieści do czterech.
Ile kart mogę umieścić w jednym serwerze?
Do czterech w maszynie, do której prowadzi ta strona. Liczbę wybierz w konfiguratorze. Więcej niż cztery lub model podzielony między maszyny znajdziesz na stronie multi-GPU.
Czy odblokowana pamięć jest niezawodna?
Karta 8 GB przy 64 GB to kombinacja, która sprawdziła się w publicznych testach, a karta 10 GB zatrzymuje się na 40 GB z tego samego powodu. To wciąż pamięć posegregowana przez NVIDIA, a pojedyncza karta może mieć słaby fragment: LTT Labs znalazło jeden wśród testowanych kart. Dlatego każda instalacja to sprawdza: po pierwszym zimnym rozruchu każda karta ma zapisany i odczytany każdy bajt, który sterownik przydzieli, wzorcami stałymi, adresowymi i pseudolosowymi, każdy odwracany w miejscu, a wynik trafia do dziennika konfiguracji serwera. To kontrola przy przekazaniu, a nie gwarancja na lata; jeśli karta później zacznie szwankować, uruchom cmp-unlock memtest i powiedz nam, co pokazuje. Uszkodzona karta jest wymieniana jak każda inna część.
Dlaczego ta konfiguracja ma opłatę instalacyjną?
Ponieważ karta jest montowana na zamówienie. Maszyna z dodaną kartą to konfiguracja niestandardowa, a taka wiąże się z jednorazową opłatą instalacyjną pokazaną w tabeli powyżej. Naliczana jest raz, a miesięczna kwota nie zmienia się przy przedłużeniu.
Gdzie znajdują się te serwery?
W każdym mieście wymienionym w tabeli powyżej. Linia jest również sprzedawana w Amsterdamie, ale konfigurator nie może tam zamontować karty, więc odblokowany CMP nie jest dostępny w tym mieście.

Gdzie jeszcze szukać