La CMP 170HX lleva el mismo chip GA100 que una A100, y salió de fábrica con la mayor parte de ese chip vallada: 8 GB de su HBM2e visibles, el FP32 limitado a un goteo y el enlace fijado en PCIe Gen 1. Una versión parcheada del controlador abierto de NVIDIA’ derriba las vallas. Lo compilamos en Ubuntu mientras instalamos su servidor, de modo que la tarjeta queda desbloqueada antes de que inicie sesión por primera vez.
LTT Labs liberó una CMP 170HX en septiembre de 2026 y la puso a prueba contra sí misma, bloqueada y desbloqueada, en un mismo banco de pruebas. Son sus cifras, no las nuestras, y cada fila indica de dónde procede. Las citamos por la magnitud del cambio: las tasas de tokens varían según el modelo, la cuantización, la compilación de llama.cpp y los flags, así que léalas como una proporción, no como una promesa.
| Measure | As NVIDIA shipped it | Unlocked | Source |
|---|---|---|---|
| Card memory | 8 GB HBM2e | 64 GB HBM2e | cmpunlocker; 65,536 MiB measured by LTT Labs |
| FP32 fused multiply-add | about 0.39 TFLOPS | unthrottled | 170th Street (stock); cmpunlocker (full SM throughput) |
| PCIe link | Gen 1 x4 | Gen 2 x4 | cmpunlocker |
| Host to card, measured | 0.84 GB/s | 1.68 GB/s | LTT Labs, nvbandwidth |
| 8B model at 4-bit, generating | 30 tokens/s | 113 tokens/s | LTT Labs, llama.cpp, Granite 4.1 8B Q4_K_M |
| 8B model at 4-bit, reading a prompt | 351 tokens/s | 2,994 tokens/s | LTT Labs, llama.cpp, pp512 |
| 27B model at 4-bit (~16 GB) | does not fit | 38 tokens/s | LTT Labs, llama.cpp, Qwen 3.6 27B Q4_K_M |
| 27B model at 8-bit (~29 GB) | does not fit | 33 tokens/s | LTT Labs, llama.cpp, Qwen 3.8 27B Q8_0 |
La memoria es el cambio que importa. Con 8 GB, la tarjeta aloja un modelo pequeño y poco más. Con 64 GB, aloja un modelo de 27 000 millones de parámetros en 8 bits y aún queda libre la mayor parte de la tarjeta para contexto, que es la diferencia entre una tarjeta con la que experimentar y una desde la que servir.
La generación de tokens depende del ancho de banda; la lectura de prompts, de la aritmética. Generar texto está limitado por la velocidad a la que los pesos salen de la memoria, algo en lo que HBM2e siempre fue buena; leer un prompt largo está limitado por las unidades de multiplicación-suma, que es donde más apretaba el freno y donde más se nota la liberación.
El enlace apenas importa una vez cargado el modelo. Gen 2 x4 duplica la tasa de host a tarjeta, lo que acorta la carga. Después, los pesos viven en la tarjeta y el bus queda inactivo.
Cualquiera puede leer el README de cmpunlocker. Lo que vale la pena pagar es todo lo que lo rodea, hecho antes de la entrega y mantenido en funcionamiento después. No hay nada que usted tenga que ejecutar.
El instalador añade el repositorio CUDA de NVIDIA e instala el espacio de usuario del controlador abierto para 610.57.04, sin entorno gráfico y sin DKMS, y mantiene cada pieza en esa versión: el paquete nvidia-driver-pinning-610.57.04 en Ubuntu y Debian, un bloqueo de versión de dnf en AlmaLinux y Rocky. El desbloqueo está construido para un controlador exacto; el fijado es lo que evita que una actualización rutinaria le quite las bibliotecas de debajo.
Obtenemos cmpunlocker en un commit fijo y compilamos su nvidia.ko parcheado dentro del sistema nuevo, contra el kernel que está a punto de arrancar, antes de que el instalador se apague. Los parches cambian la forma en que el controlador inicializa la tarjeta. Nada se graba en la tarjeta, así que quitar el controlador la devuelve exactamente a como estaba.
El desbloqueo solo surte efecto en la primera carga del controlador después de que la tarjeta se haya apagado por completo, así que cada una de estas instalaciones termina con el servidor apagado y encendido de nuevo a través de su BMC, y lo primero que toca la tarjeta es el controlador parcheado.
Cuando el sistema instalado responde por primera vez, la instalación pregunta a cada tarjeta cómo se presentó — memoria, generación PCIe y ancho de enlace — y luego escribe y lee de vuelta cada byte de memoria que el controlador entrega, con patrones fijos, por dirección y pseudoaleatorios. Ambas respuestas van al registro de configuración del servidor, donde el soporte puede verlas. cmp-unlock status y cmp-unlock memtest le dan las mismas respuestas desde una shell.
Un hook del kernel (/etc/kernel/postinst.d, o /etc/kernel/install.d en AlmaLinux y Rocky) recompila los módulos parcheados para cada kernel nuevo, a partir de una copia del código fuente de NVIDIA guardada en la máquina, de modo que una actualización desatendida no devuelva silenciosamente la tarjeta a 8 GB. También se le indica al gestor de paquetes que rechace los paquetes que colocarían un segundo controlador estándar junto a él; instale CUDA con apt install cuda-toolkit o dnf install cuda-toolkit y nunca aparecerá.
Solo pesos, redondeados al alza. Un modelo cuenta como que cabe cuando la tarjeta puede alojarlo con entre un cuarto y la mitad de margen para la caché KV y el tiempo de ejecución; por debajo de eso, carga y luego se queda sin memoria en cuanto crece el contexto. Es la misma regla con la que nuestra página de LLM dimensiona cada tarjeta.
| Model size | Precision | Weights | 8 GB, locked | 64 GB, unlocked |
|---|---|---|---|---|
| 7-8 billion parameters | 16-bit | 16 GB | — | fits |
| 8-bit | 8 GB | — | fits | |
| 4-bit | 5 GB | fits | fits | |
| 13-14 billion parameters | 16-bit | 28 GB | — | fits |
| 8-bit | 14 GB | — | fits | |
| 4-bit | 8 GB | — | fits | |
| 30-34 billion parameters | 16-bit | 68 GB | — | — |
| 8-bit | 34 GB | — | fits | |
| 4-bit | 19 GB | — | fits | |
| 70 billion parameters | 16-bit | 140 GB | — | — |
| 8-bit | 70 GB | — | — | |
| 4-bit | 38 GB | — | fits |
Una CMP desbloqueada es una tarjeta de inferencia muy buena por su precio. No es una A100, y estos son los puntos donde se nota.
La tarjeta es una línea propia en la factura y la máquina es otra; ambas se suman. Las cifras de abajo son lo mínimo que puede costar esta configuración: la tarjeta en la máquina completa más barata que la admite, antes de impuestos sobre las ventas. El configurador puede abrirse con más memoria que esa; cambie allí el procesador, la memoria o los discos y verá el precio de cada cambio al momento.
| Card | NVIDIA CMP 170HX: 64 GB HBM2e unlocked (8 GB HBM2e without the patched driver) |
|---|---|
| Card, per month | $189 |
| Machine | Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps |
| Machine, per month | $83.67 |
| Together | $272.67 a month |
| Setup | $29 once |
| Cards per machine | 1 to 4 |
| Cities | New York, Bucharest, San Francisco and Miami |
| Term | Monthly; 15% off on a twelve-month cycle |
| Driver | NVIDIA open 610.57.04, patched by cmpunlocker, on Ubuntu 22.04–26.04, Debian 12/13, AlmaLinux 9/10 or Rocky Linux 9/10 |
| Memory test | Every byte the driver hands out, written and read back on each card before handover |
También alquilables por mes: máquinas CMP 170HX que sus propietarios han publicado en nuestro marketplace, cada una al precio fijado por su dueño. Algunas se publican a través de nuestra empresa hermana, Primcast, y esas se alquilan en primcast.com.