NVIDIA CMP 170HX · GA100 · desbloqueada na instalação

Servidores dedicados CMP desbloqueados. Todos os 64 GB da placa, não os 8 que a NVIDIA deixou ligados.

A CMP 170HX traz o mesmo chip GA100 de uma A100 e saiu de fábrica com a maior parte desse chip isolada: 8 GB de sua HBM2e visíveis, FP32 reduzido a um fio, o link preso em PCIe Gen 1. Uma compilação corrigida do driver aberto da NVIDIA’ derruba as cercas. Nós a compilamos no Ubuntu durante a instalação do seu servidor, para que a placa já esteja desbloqueada antes do seu primeiro login.

64 GB HBM2e per cardUbuntu, Debian, AlmaLinux or RockyUp to 4 cards per machinefrom $272.67/mo complete
Antes e depois, na mesma placa

O que o driver corrigido muda

O LTT Labs desbloqueou uma CMP 170HX em setembro de 2026 e a testou contra si mesma, bloqueada e desbloqueada, em uma única bancada. Estes são os números deles, não os nossos, e cada linha indica de onde veio. Nós os citamos pelo tamanho da mudança: as taxas de tokens variam com o modelo, a quantização, a compilação do llama.cpp e as flags, então leia-os como uma proporção, não como uma promessa.

MeasureAs NVIDIA shipped itUnlockedSource
Card memory8 GB HBM2e64 GB HBM2ecmpunlocker; 65,536 MiB measured by LTT Labs
FP32 fused multiply-addabout 0.39 TFLOPSunthrottled170th Street (stock); cmpunlocker (full SM throughput)
PCIe linkGen 1 x4Gen 2 x4cmpunlocker
Host to card, measured0.84 GB/s1.68 GB/sLTT Labs, nvbandwidth
8B model at 4-bit, generating30 tokens/s113 tokens/sLTT Labs, llama.cpp, Granite 4.1 8B Q4_K_M
8B model at 4-bit, reading a prompt351 tokens/s2,994 tokens/sLTT Labs, llama.cpp, pp512
27B model at 4-bit (~16 GB)does not fit38 tokens/sLTT Labs, llama.cpp, Qwen 3.6 27B Q4_K_M
27B model at 8-bit (~29 GB)does not fit33 tokens/sLTT Labs, llama.cpp, Qwen 3.8 27B Q8_0

A memória é a mudança que importa. Com 8 GB, a placa comporta um modelo pequeno e pouco mais. Com 64 GB, ela comporta um modelo de 27 bilhões de parâmetros em 8 bits, com a maior parte da placa ainda livre para contexto — a diferença entre uma placa para experimentos e uma para servir em produção.

A geração de tokens depende da largura de banda; a leitura de prompts, da aritmética. Gerar texto é limitado pela velocidade com que os pesos saem da memória, algo em que a HBM2e sempre foi boa; ler um prompt longo é limitado pelas unidades de multiplicação e soma, exatamente onde o gargalo mais doía e onde o desbloqueio aparece com mais força.

O link quase não importa depois que o modelo é carregado. O Gen 2 x4 dobra a taxa entre host e placa, o que encurta o carregamento. Depois disso, os pesos ficam na placa e o barramento fica ocioso.

Fontes: LTT Labs, “Actually Download More RAM” (12 de setembro de 2026) para todas as linhas medidas; 170th Street para o valor de FP32 de fábrica; cmpunlocker para o que os patches restauram.

A instalação, passo a passo

Como o unlock chega à máquina

Qualquer pessoa pode ler o README do cmpunlocker. A parte que vale a pena pagar é tudo ao redor dele, feita antes da entrega e mantida em funcionamento depois. Não há nada para você executar.

  1. Driver aberto da NVIDIA, fixado em uma versão

    O instalador adiciona o repositório CUDA da NVIDIA e instala o userspace do driver aberto para 610.57.04, headless e sem DKMS, e mantém cada parte dele nessa versão: o pacote nvidia-driver-pinning-610.57.04 no Ubuntu e no Debian, um version lock do dnf no AlmaLinux e no Rocky. O unlock é feito para um driver exato; a fixação é o que impede uma atualização de rotina de puxar as bibliotecas de debaixo dele.

  2. cmpunlocker, compilado para o seu kernel

    Buscamos o cmpunlocker em um commit fixo e compilamos o nvidia.ko patcheado dentro do novo sistema, contra o kernel que ele está prestes a iniciar, antes de o instalador desligar. Os patches mudam como o driver ativa a placa. Nada é gravado na placa, então remover o driver a devolve exatamente ao que era.

  3. Um primeiro boot a frio

    O unlock só entra em vigor no primeiro carregamento do driver depois que a placa foi desligada, então cada uma dessas instalações termina com o servidor desligado e religado pelo BMC, e a primeira coisa a tocar a placa é o driver patcheado.

  4. Verificado e depois testado na memória, no primeiro login

    Quando o sistema instalado responde pela primeira vez, a instalação pergunta a cada placa como ela se apresentou — memória, geração PCIe e largura do link — e então grava e lê de volta cada byte de memória que o driver entrega, com padrões fixos, de endereço e pseudoaleatórios. As duas respostas vão para o log de configuração do servidor, onde o suporte pode vê-las. cmp-unlock status e cmp-unlock memtest dão as mesmas respostas a partir de um shell.

  5. Atualizações de kernel não o bloqueiam de novo

    Um hook de kernel (/etc/kernel/postinst.d, ou /etc/kernel/install.d no AlmaLinux e no Rocky) recompila os módulos patcheados para cada kernel novo, a partir de uma cópia do código-fonte da NVIDIA mantida na máquina, para que uma atualização automática não mande a placa de volta silenciosamente para 8 GB. O gerenciador de pacotes também é instruído a recusar os pacotes que colocariam um segundo driver, original, ao lado dele; instale o CUDA com apt install cuda-toolkit ou dnf install cuda-toolkit e ele nunca aparece.

Dimensionamento, pela regra que o resto do site usa

O que cabe em 64 GB, e o que cabia em 8

Apenas pesos, arredondados para cima. Um modelo conta como cabendo quando a placa consegue mantê-lo com um quarto a metade de sobra para o cache KV e o runtime; abaixo disso, ele carrega e depois fica sem memória no momento em que o contexto cresce. É a mesma regra que nossa página de LLM usa para dimensionar cada placa.

Model sizePrecisionWeights8 GB, locked64 GB, unlocked
7-8 billion parameters16-bit16 GB—fits
8-bit8 GB—fits
4-bit5 GBfitsfits
13-14 billion parameters16-bit28 GB—fits
8-bit14 GB—fits
4-bit8 GB—fits
30-34 billion parameters16-bit68 GB——
8-bit34 GB—fits
4-bit19 GB—fits
70 billion parameters16-bit140 GB——
8-bit70 GB——
4-bit38 GB—fits

Duas placas em uma máquina comportam o que uma placa não consegue: um modelo de 70 bilhões de parâmetros em 8 bits precisa de cerca de 70 GB, o que cabe em um par. Dividir um modelo entre várias placas, ou várias máquinas, é o assunto da página de multi-GPU. Dê à máquina pelo menos tanta memória de sistema quanto o maior arquivo de modelo; a configuração mais barata abaixo tem 16 GB, o que carrega um arquivo de 38 GB, apenas lentamente.

Leia isto antes de encomendar

O que o desbloqueio não altera

Uma CMP desbloqueada é uma placa de inferência muito boa pelo seu preço. Não é uma A100, e é nestes pontos que isso se nota.

Sem ECC
A correção de erros na HBM2e continua desligada; está na lista de coisas que ainda ninguém desbloqueou. Em inferência, um bit trocado custa uma nova tentativa. Para um treino de uma semana, ou qualquer coisa que tenha de ser exata ao bit, escolha uma placa com memória protegida, como a L40S.
PCIe Gen 2 x4
Cerca de 1,7 GB/s do host para a placa, medido, pelo que só o barramento precisa de cerca de 25 segundos para mover um modelo de 38 GB. Um modelo atravessa-o uma vez e depois fica na placa, razão pela qual o serving quase não nota. Um ciclo de treino que faz streaming de batches da memória do sistema nota-o a cada passo.
Formatos numéricos da Ampere’s
FP16, BF16, TF32 e INT8 nos tensor cores. Sem FP8 e sem FP4; ambos chegaram nas gerações posteriores à Ampere. Modelos quantizados em GGUF, AWQ ou GPTQ funcionam bem, porque são desempacotados para formatos que a placa tem.
Apenas Linux
O desbloqueio é um driver de kernel Linux. Encomende a máquina com Ubuntu, Debian, AlmaLinux ou Rocky Linux e já vem integrado; no Windows ou no Proxmox VE a placa funciona como a NVIDIA a enviou, com 8 GB.
Secure Boot desligado
Os módulos corrigidos não são assinados, por isso um kernel com Secure Boot ativo recusa-os, e a placa fica sem driver nenhum. Deixe-o desligado.
Código da comunidade, não da NVIDIA’s
O cmpunlocker é um projeto open-source (GPL-2.0) de Amogh Munikote, e a NVIDIA não o suporta. Instalamos um commit que compilámos e verificámos, e movemos esse pin de propósito, nunca automaticamente.
A placa de 10 GB fica nos 40 GB
A placa de 8 GB desbloqueia para 64 GB. A placa de 10 GB tem mais memória no seu package do que aguenta sob carga, por isso o desbloqueio limita-a a 40 GB, o tamanho que se mantém estável. A instalação lê qual está na máquina e aplica a geometria certa a cada placa.
A máquina por trás do botão

Um CMP desbloqueado, na máquina mais barata que o aceita

A placa é uma linha própria na fatura e a máquina é outra; as duas somam. Os valores abaixo são o mínimo que esta configuração pode custar: a placa na máquina completa mais barata que a aceita, antes de qualquer imposto sobre vendas. O configurador pode abrir com mais memória do que isso; altere o processador, a memória ou os discos ali e ele precifica cada mudança conforme você a faz.

A NVIDIA CMP 170HX, uma placa passiva de comprimento total sem saídas de vídeo no suporte
Uma placa passiva de comprimento total que consome até 250 W e não tem ventoinha. Foi feita para um chassi de servidor que puxa o ar da frente para trás, e é onde as nossas operam.
CardNVIDIA CMP 170HX: 64 GB HBM2e unlocked (8 GB HBM2e without the patched driver)
Card, per month$189
MachineIntel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps
Machine, per month$83.67
Together$272.67 a month
Setup$29 once
Cards per machine1 to 4
CitiesNew York, Bucharest, San Francisco and Miami
TermMonthly; 15% off on a twelve-month cycle
DriverNVIDIA open 610.57.04, patched by cmpunlocker, on Ubuntu 22.04–26.04, Debian 12/13, AlmaLinux 9/10 or Rocky Linux 9/10
Memory testEvery byte the driver hands out, written and read back on each card before handover

Abrir esta configuração no configurador →

A taxa de instalação existe porque a placa é montada sob encomenda: uma máquina com uma placa adicionada é uma configuração personalizada. O valor mensal é o mesmo na renovação. Todas as outras placas que instalamos são precificadas da mesma forma na página de GPU.

Perguntas sobre esta placa

Servidores CMP desbloqueados, perguntas e respostas

O que é uma CMP 170HX desbloqueada?
Uma NVIDIA CMP 170HX rodando uma versão corrigida do driver de kernel aberto da NVIDIA’, do projeto cmpunlocker. A placa é uma GA100, o mesmo chip da A100, que a NVIDIA enviou com 8 GB de sua HBM2e visível, o multiplicador-somador FP32 limitado e o link mantido em PCIe Gen 1. O driver corrigido ativa os 64 GB, remove a limitação e treina o link em Gen 2 toda vez que inicializa a placa. Nada na placa em si é modificado.
Quanta memória tem uma CMP 170HX desbloqueada?
64 GB de HBM2e na placa de 8 GB, que é o que o nvidia-smi reporta quando o driver corrigido está em execução. A versão de 10 GB da placa fica em 40 GB, o tamanho que se mantém estável nela. Sem o driver corrigido, qualquer uma das placas mostra o que a NVIDIA enviou: 8 ou 10 GB.
O desbloqueio sobrevive a reinicializações e atualizações de kernel?
Sim. Os módulos corrigidos são instalados como qualquer outro módulo de kernel e carregam a cada inicialização. Quando um novo kernel chega, um hook os reconstrói para ele a partir do código-fonte da NVIDIA mantido na máquina, antes mesmo de você inicializar com ele. Se uma placa ainda assim subir com 8 GB, execute cmp-unlock build com a versão do seu kernel e reinicie o servidor pelo painel de controle.
Quais sistemas operacionais recebem o driver desbloqueado?
Ubuntu 22.04, 24.04 e 26.04, Debian 12 e 13, AlmaLinux 9 e 10, e Rocky Linux 9 e 10, instalados por nós, em qualquer máquina com a placa: faz parte da instalação, não é uma opção para marcar. Windows e Proxmox VE recebem a placa como a NVIDIA a enviou: o desbloqueio é um driver de kernel Linux, e no Proxmox as placas geralmente vão para máquinas virtuais, que um driver de host não alcança.
Posso usar CUDA, PyTorch, vLLM e llama.cpp nela?
Sim. O driver é o 610.57.04 da própria NVIDIA’ com os patches aplicados, então qualquer coisa compilada para uma placa Ampere com um driver atual funciona. Instale o toolkit CUDA separadamente, com apt install cuda-toolkit ou dnf install cuda-toolkit; os meta-pacotes cuda e cuda-drivers trariam junto um segundo driver padrão, então o gerenciador de pacotes é configurado para recusá-los.
Um modelo de 70 bilhões de parâmetros roda em uma única placa?
Em 4 bits, sim: os pesos ocupam cerca de 38 GB, o que deixa a folga que nossa regra de dimensionamento pede em uma placa de 64 GB. Em 8 bits, ocupam cerca de 70 GB, o que exige duas placas; uma máquina aceita até quatro.
Quantas placas posso colocar em um servidor?
Até quatro na máquina para a qual esta página aponta. Escolha a quantidade no configurador. Para mais de quatro, ou para um modelo dividido entre máquinas, veja a página de multi-GPU.
A memória desbloqueada é confiável?
A placa de 8 GB com 64 GB é a combinação que se manteve estável em testes públicos, e a placa de 10 GB para em 40 GB pelo mesmo motivo. Ainda assim, é memória que a NVIDIA classificou, e uma placa pode carregar um trecho fraco: o LTT Labs encontrou uma entre as placas que testaram. Por isso, toda instalação a testa: após o primeiro boot a frio, cada placa tem cada byte que o driver entregará escrito e lido de volta, com padrões fixos, de endereço e pseudoaleatórios, cada um invertido no lugar, e o resultado vai para o log de configuração do servidor’. Isso é uma verificação na entrega, não uma garantia para anos; se uma placa mais tarde apresentar mau comportamento, execute cmp-unlock memtest e nos diga o que ele informa. Uma placa que falha é substituída como qualquer outra peça.
Por que há uma taxa de configuração nesta montagem?
Porque a placa é instalada sob encomenda. Uma máquina com placa adicionada é uma montagem personalizada, e uma montagem personalizada carrega a taxa única de configuração mostrada na tabela acima. Ela é cobrada uma vez, e o valor mensal não muda na renovação.
Onde ficam esses servidores?
Em cada cidade listada na tabela acima. A linha também é vendida em Amsterdã, mas o configurador não consegue instalar uma placa lá, então uma CMP desbloqueada não está disponível nessa cidade.

Outro lugar para consultar