A CMP 170HX traz o mesmo chip GA100 de uma A100 e saiu de fábrica com a maior parte desse chip isolada: 8 GB de sua HBM2e visíveis, FP32 reduzido a um fio, o link preso em PCIe Gen 1. Uma compilação corrigida do driver aberto da NVIDIA’ derruba as cercas. Nós a compilamos no Ubuntu durante a instalação do seu servidor, para que a placa já esteja desbloqueada antes do seu primeiro login.
O LTT Labs desbloqueou uma CMP 170HX em setembro de 2026 e a testou contra si mesma, bloqueada e desbloqueada, em uma única bancada. Estes são os números deles, não os nossos, e cada linha indica de onde veio. Nós os citamos pelo tamanho da mudança: as taxas de tokens variam com o modelo, a quantização, a compilação do llama.cpp e as flags, então leia-os como uma proporção, não como uma promessa.
| Measure | As NVIDIA shipped it | Unlocked | Source |
|---|---|---|---|
| Card memory | 8 GB HBM2e | 64 GB HBM2e | cmpunlocker; 65,536 MiB measured by LTT Labs |
| FP32 fused multiply-add | about 0.39 TFLOPS | unthrottled | 170th Street (stock); cmpunlocker (full SM throughput) |
| PCIe link | Gen 1 x4 | Gen 2 x4 | cmpunlocker |
| Host to card, measured | 0.84 GB/s | 1.68 GB/s | LTT Labs, nvbandwidth |
| 8B model at 4-bit, generating | 30 tokens/s | 113 tokens/s | LTT Labs, llama.cpp, Granite 4.1 8B Q4_K_M |
| 8B model at 4-bit, reading a prompt | 351 tokens/s | 2,994 tokens/s | LTT Labs, llama.cpp, pp512 |
| 27B model at 4-bit (~16 GB) | does not fit | 38 tokens/s | LTT Labs, llama.cpp, Qwen 3.6 27B Q4_K_M |
| 27B model at 8-bit (~29 GB) | does not fit | 33 tokens/s | LTT Labs, llama.cpp, Qwen 3.8 27B Q8_0 |
A memória é a mudança que importa. Com 8 GB, a placa comporta um modelo pequeno e pouco mais. Com 64 GB, ela comporta um modelo de 27 bilhões de parâmetros em 8 bits, com a maior parte da placa ainda livre para contexto — a diferença entre uma placa para experimentos e uma para servir em produção.
A geração de tokens depende da largura de banda; a leitura de prompts, da aritmética. Gerar texto é limitado pela velocidade com que os pesos saem da memória, algo em que a HBM2e sempre foi boa; ler um prompt longo é limitado pelas unidades de multiplicação e soma, exatamente onde o gargalo mais doía e onde o desbloqueio aparece com mais força.
O link quase não importa depois que o modelo é carregado. O Gen 2 x4 dobra a taxa entre host e placa, o que encurta o carregamento. Depois disso, os pesos ficam na placa e o barramento fica ocioso.
Qualquer pessoa pode ler o README do cmpunlocker. A parte que vale a pena pagar é tudo ao redor dele, feita antes da entrega e mantida em funcionamento depois. Não há nada para você executar.
O instalador adiciona o repositório CUDA da NVIDIA e instala o userspace do driver aberto para 610.57.04, headless e sem DKMS, e mantém cada parte dele nessa versão: o pacote nvidia-driver-pinning-610.57.04 no Ubuntu e no Debian, um version lock do dnf no AlmaLinux e no Rocky. O unlock é feito para um driver exato; a fixação é o que impede uma atualização de rotina de puxar as bibliotecas de debaixo dele.
Buscamos o cmpunlocker em um commit fixo e compilamos o nvidia.ko patcheado dentro do novo sistema, contra o kernel que ele está prestes a iniciar, antes de o instalador desligar. Os patches mudam como o driver ativa a placa. Nada é gravado na placa, então remover o driver a devolve exatamente ao que era.
O unlock só entra em vigor no primeiro carregamento do driver depois que a placa foi desligada, então cada uma dessas instalações termina com o servidor desligado e religado pelo BMC, e a primeira coisa a tocar a placa é o driver patcheado.
Quando o sistema instalado responde pela primeira vez, a instalação pergunta a cada placa como ela se apresentou — memória, geração PCIe e largura do link — e então grava e lê de volta cada byte de memória que o driver entrega, com padrões fixos, de endereço e pseudoaleatórios. As duas respostas vão para o log de configuração do servidor, onde o suporte pode vê-las. cmp-unlock status e cmp-unlock memtest dão as mesmas respostas a partir de um shell.
Um hook de kernel (/etc/kernel/postinst.d, ou /etc/kernel/install.d no AlmaLinux e no Rocky) recompila os módulos patcheados para cada kernel novo, a partir de uma cópia do código-fonte da NVIDIA mantida na máquina, para que uma atualização automática não mande a placa de volta silenciosamente para 8 GB. O gerenciador de pacotes também é instruído a recusar os pacotes que colocariam um segundo driver, original, ao lado dele; instale o CUDA com apt install cuda-toolkit ou dnf install cuda-toolkit e ele nunca aparece.
Apenas pesos, arredondados para cima. Um modelo conta como cabendo quando a placa consegue mantê-lo com um quarto a metade de sobra para o cache KV e o runtime; abaixo disso, ele carrega e depois fica sem memória no momento em que o contexto cresce. É a mesma regra que nossa página de LLM usa para dimensionar cada placa.
| Model size | Precision | Weights | 8 GB, locked | 64 GB, unlocked |
|---|---|---|---|---|
| 7-8 billion parameters | 16-bit | 16 GB | — | fits |
| 8-bit | 8 GB | — | fits | |
| 4-bit | 5 GB | fits | fits | |
| 13-14 billion parameters | 16-bit | 28 GB | — | fits |
| 8-bit | 14 GB | — | fits | |
| 4-bit | 8 GB | — | fits | |
| 30-34 billion parameters | 16-bit | 68 GB | — | — |
| 8-bit | 34 GB | — | fits | |
| 4-bit | 19 GB | — | fits | |
| 70 billion parameters | 16-bit | 140 GB | — | — |
| 8-bit | 70 GB | — | — | |
| 4-bit | 38 GB | — | fits |
Uma CMP desbloqueada é uma placa de inferência muito boa pelo seu preço. Não é uma A100, e é nestes pontos que isso se nota.
A placa é uma linha própria na fatura e a máquina é outra; as duas somam. Os valores abaixo são o mínimo que esta configuração pode custar: a placa na máquina completa mais barata que a aceita, antes de qualquer imposto sobre vendas. O configurador pode abrir com mais memória do que isso; altere o processador, a memória ou os discos ali e ele precifica cada mudança conforme você a faz.
| Card | NVIDIA CMP 170HX: 64 GB HBM2e unlocked (8 GB HBM2e without the patched driver) |
|---|---|
| Card, per month | $189 |
| Machine | Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps |
| Machine, per month | $83.67 |
| Together | $272.67 a month |
| Setup | $29 once |
| Cards per machine | 1 to 4 |
| Cities | New York, Bucharest, San Francisco and Miami |
| Term | Monthly; 15% off on a twelve-month cycle |
| Driver | NVIDIA open 610.57.04, patched by cmpunlocker, on Ubuntu 22.04–26.04, Debian 12/13, AlmaLinux 9/10 or Rocky Linux 9/10 |
| Memory test | Every byte the driver hands out, written and read back on each card before handover |