NVIDIA CMP 170HX · GA100 · desbloqueada al instalarla

Servidores dedicados CMP desbloqueados. Los 64 GB de la tarjeta, no los 8 que NVIDIA dejó activados.

La CMP 170HX lleva el mismo chip GA100 que una A100, y salió de fábrica con la mayor parte de ese chip vallada: 8 GB de su HBM2e visibles, el FP32 limitado a un goteo y el enlace fijado en PCIe Gen 1. Una versión parcheada del controlador abierto de NVIDIA’ derriba las vallas. Lo compilamos en Ubuntu mientras instalamos su servidor, de modo que la tarjeta queda desbloqueada antes de que inicie sesión por primera vez.

64 GB HBM2e per cardUbuntu, Debian, AlmaLinux or RockyUp to 4 cards per machinefrom $272.67/mo complete
Antes y después, en la misma tarjeta

Qué cambia el controlador parcheado

LTT Labs liberó una CMP 170HX en septiembre de 2026 y la puso a prueba contra sí misma, bloqueada y desbloqueada, en un mismo banco de pruebas. Son sus cifras, no las nuestras, y cada fila indica de dónde procede. Las citamos por la magnitud del cambio: las tasas de tokens varían según el modelo, la cuantización, la compilación de llama.cpp y los flags, así que léalas como una proporción, no como una promesa.

MeasureAs NVIDIA shipped itUnlockedSource
Card memory8 GB HBM2e64 GB HBM2ecmpunlocker; 65,536 MiB measured by LTT Labs
FP32 fused multiply-addabout 0.39 TFLOPSunthrottled170th Street (stock); cmpunlocker (full SM throughput)
PCIe linkGen 1 x4Gen 2 x4cmpunlocker
Host to card, measured0.84 GB/s1.68 GB/sLTT Labs, nvbandwidth
8B model at 4-bit, generating30 tokens/s113 tokens/sLTT Labs, llama.cpp, Granite 4.1 8B Q4_K_M
8B model at 4-bit, reading a prompt351 tokens/s2,994 tokens/sLTT Labs, llama.cpp, pp512
27B model at 4-bit (~16 GB)does not fit38 tokens/sLTT Labs, llama.cpp, Qwen 3.6 27B Q4_K_M
27B model at 8-bit (~29 GB)does not fit33 tokens/sLTT Labs, llama.cpp, Qwen 3.8 27B Q8_0

La memoria es el cambio que importa. Con 8 GB, la tarjeta aloja un modelo pequeño y poco más. Con 64 GB, aloja un modelo de 27 000 millones de parámetros en 8 bits y aún queda libre la mayor parte de la tarjeta para contexto, que es la diferencia entre una tarjeta con la que experimentar y una desde la que servir.

La generación de tokens depende del ancho de banda; la lectura de prompts, de la aritmética. Generar texto está limitado por la velocidad a la que los pesos salen de la memoria, algo en lo que HBM2e siempre fue buena; leer un prompt largo está limitado por las unidades de multiplicación-suma, que es donde más apretaba el freno y donde más se nota la liberación.

El enlace apenas importa una vez cargado el modelo. Gen 2 x4 duplica la tasa de host a tarjeta, lo que acorta la carga. Después, los pesos viven en la tarjeta y el bus queda inactivo.

Fuentes: LTT Labs, “Actually Download More RAM” (12 de septiembre de 2026) para cada fila medida; 170th Street para la cifra de FP32 de fábrica; cmpunlocker para lo que restauran los parches.

La instalación, paso a paso

Cómo llega el desbloqueo a la máquina

Cualquiera puede leer el README de cmpunlocker. Lo que vale la pena pagar es todo lo que lo rodea, hecho antes de la entrega y mantenido en funcionamiento después. No hay nada que usted tenga que ejecutar.

  1. El controlador abierto de NVIDIA, fijado a una versión

    El instalador añade el repositorio CUDA de NVIDIA e instala el espacio de usuario del controlador abierto para 610.57.04, sin entorno gráfico y sin DKMS, y mantiene cada pieza en esa versión: el paquete nvidia-driver-pinning-610.57.04 en Ubuntu y Debian, un bloqueo de versión de dnf en AlmaLinux y Rocky. El desbloqueo está construido para un controlador exacto; el fijado es lo que evita que una actualización rutinaria le quite las bibliotecas de debajo.

  2. cmpunlocker, compilado para su kernel

    Obtenemos cmpunlocker en un commit fijo y compilamos su nvidia.ko parcheado dentro del sistema nuevo, contra el kernel que está a punto de arrancar, antes de que el instalador se apague. Los parches cambian la forma en que el controlador inicializa la tarjeta. Nada se graba en la tarjeta, así que quitar el controlador la devuelve exactamente a como estaba.

  3. Un primer arranque en frío

    El desbloqueo solo surte efecto en la primera carga del controlador después de que la tarjeta se haya apagado por completo, así que cada una de estas instalaciones termina con el servidor apagado y encendido de nuevo a través de su BMC, y lo primero que toca la tarjeta es el controlador parcheado.

  4. Verificado, y luego probado en memoria, en el primer inicio de sesión

    Cuando el sistema instalado responde por primera vez, la instalación pregunta a cada tarjeta cómo se presentó — memoria, generación PCIe y ancho de enlace — y luego escribe y lee de vuelta cada byte de memoria que el controlador entrega, con patrones fijos, por dirección y pseudoaleatorios. Ambas respuestas van al registro de configuración del servidor, donde el soporte puede verlas. cmp-unlock status y cmp-unlock memtest le dan las mismas respuestas desde una shell.

  5. Las actualizaciones del kernel no lo vuelven a bloquear

    Un hook del kernel (/etc/kernel/postinst.d, o /etc/kernel/install.d en AlmaLinux y Rocky) recompila los módulos parcheados para cada kernel nuevo, a partir de una copia del código fuente de NVIDIA guardada en la máquina, de modo que una actualización desatendida no devuelva silenciosamente la tarjeta a 8 GB. También se le indica al gestor de paquetes que rechace los paquetes que colocarían un segundo controlador estándar junto a él; instale CUDA con apt install cuda-toolkit o dnf install cuda-toolkit y nunca aparecerá.

Dimensionamiento, según la regla que usa el resto del sitio

Qué cabe en 64 GB y qué cabía en 8

Solo pesos, redondeados al alza. Un modelo cuenta como que cabe cuando la tarjeta puede alojarlo con entre un cuarto y la mitad de margen para la caché KV y el tiempo de ejecución; por debajo de eso, carga y luego se queda sin memoria en cuanto crece el contexto. Es la misma regla con la que nuestra página de LLM dimensiona cada tarjeta.

Model sizePrecisionWeights8 GB, locked64 GB, unlocked
7-8 billion parameters16-bit16 GB—fits
8-bit8 GB—fits
4-bit5 GBfitsfits
13-14 billion parameters16-bit28 GB—fits
8-bit14 GB—fits
4-bit8 GB—fits
30-34 billion parameters16-bit68 GB——
8-bit34 GB—fits
4-bit19 GB—fits
70 billion parameters16-bit140 GB——
8-bit70 GB——
4-bit38 GB—fits

Dos tarjetas en una misma máquina alojan lo que una sola no puede: un modelo de 70 mil millones de parámetros en 8 bits necesita unos 70 GB, que caben en un par. Dividir un modelo entre varias tarjetas, o varias máquinas, se explica en la página de multi-GPU. Dale a la máquina al menos tanta memoria de sistema como el archivo de modelo más grande; la configuración más barata de abajo tiene 16 GB, que cargan un archivo de 38 GB, solo que lentamente.

Lea esto antes de hacer su pedido

Lo que el desbloqueo no cambia

Una CMP desbloqueada es una tarjeta de inferencia muy buena por su precio. No es una A100, y estos son los puntos donde se nota.

Sin ECC
La corrección de errores en la HBM2e sigue desactivada; está en la lista de cosas que nadie ha desbloqueado todavía. Para inferencia, un bit invertido cuesta un reintento. Para un entrenamiento de una semana, o cualquier cosa que deba ser exacta bit a bit, elija una tarjeta con memoria protegida, como la L40S.
PCIe Gen 2 x4
Aproximadamente 1,7 GB/s del host a la tarjeta, medido, así que solo el bus necesita unos 25 segundos para mover un modelo de 38 GB. Un modelo lo cruza una vez y luego vive en la tarjeta, por eso el servicio apenas lo nota. Un bucle de entrenamiento que transmite lotes desde la memoria del sistema lo nota en cada paso.
Formatos numéricos de Ampere’s
FP16, BF16, TF32 e INT8 en los núcleos tensoriales. Sin FP8 y sin FP4; ambos llegaron con las generaciones posteriores a Ampere. Los modelos cuantizados en GGUF, AWQ o GPTQ funcionan bien, porque se desempaquetan a formatos que la tarjeta tiene.
Solo Linux
El desbloqueo es un controlador del kernel de Linux. Pida la máquina con Ubuntu, Debian, AlmaLinux o Rocky Linux y viene integrado; en Windows o Proxmox VE la tarjeta funciona como la envió NVIDIA, con 8 GB.
Secure Boot desactivado
Los módulos parcheados no están firmados, así que un kernel con Secure Boot aplicándolo los rechaza, y la tarjeta se queda sin controlador alguno. Déjelo desactivado.
Código comunitario, no de NVIDIA’s
cmpunlocker es un proyecto de código abierto (GPL-2.0) de Amogh Munikote, y NVIDIA no lo soporta. Instalamos un commit que hemos compilado y comprobado, y movemos ese pin a propósito, nunca automáticamente.
La tarjeta de 10 GB se detiene en 40 GB
La tarjeta de 8 GB se desbloquea a 64 GB. La tarjeta de 10 GB tiene más memoria en su paquete de la que aguanta bajo carga, así que el desbloqueo la detiene en 40 GB, el tamaño que se mantiene estable. La instalación lee cuál está en la máquina y aplica la geometría correcta a cada tarjeta.
La máquina detrás del botón

Una CMP desbloqueada, en la máquina más barata que la admite

La tarjeta es una línea propia en la factura y la máquina es otra; ambas se suman. Las cifras de abajo son lo mínimo que puede costar esta configuración: la tarjeta en la máquina completa más barata que la admite, antes de impuestos sobre las ventas. El configurador puede abrirse con más memoria que esa; cambie allí el procesador, la memoria o los discos y verá el precio de cada cambio al momento.

La NVIDIA CMP 170HX, una tarjeta pasiva de longitud completa sin salidas de vídeo en su soporte
Una tarjeta pasiva de longitud completa que consume hasta 250 W y no tiene ventilador. Está pensada para un chasis de servidor con flujo de aire de delante hacia atrás, y es ahí donde funcionan las nuestras.
CardNVIDIA CMP 170HX: 64 GB HBM2e unlocked (8 GB HBM2e without the patched driver)
Card, per month$189
MachineIntel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps
Machine, per month$83.67
Together$272.67 a month
Setup$29 once
Cards per machine1 to 4
CitiesNew York, Bucharest, San Francisco and Miami
TermMonthly; 15% off on a twelve-month cycle
DriverNVIDIA open 610.57.04, patched by cmpunlocker, on Ubuntu 22.04–26.04, Debian 12/13, AlmaLinux 9/10 or Rocky Linux 9/10
Memory testEvery byte the driver hands out, written and read back on each card before handover

Abrir esta configuración en el configurador →

El cargo de instalación existe porque la tarjeta se monta bajo pedido: una máquina con una tarjeta añadida es una configuración personalizada. La cuota mensual es la misma al renovar. Todas las demás tarjetas que instalamos se valoran igual en la página de GPU.

Preguntas sobre esta tarjeta

Servidores CMP desbloqueados, preguntas y respuestas

¿Qué es una CMP 170HX desbloqueada?
Una NVIDIA CMP 170HX que ejecuta una compilación parcheada del controlador de kernel abierto de NVIDIA’, del proyecto cmpunlocker. La tarjeta es una GA100, el chip de la A100, que NVIDIA envió con 8 GB de su HBM2e visibles, su multiplicación-suma FP32 limitada y su enlace fijado en PCIe Gen 1. El controlador parcheado activa los 64 GB, elimina la limitación y entrena el enlace en Gen 2 cada vez que arranca la tarjeta. Nada en la propia tarjeta se modifica.
¿Cuánta memoria tiene una CMP 170HX desbloqueada?
64 GB de HBM2e en la tarjeta de 8 GB, que es lo que nvidia-smi reporta una vez que el controlador parcheado está en ejecución. La versión de 10 GB de la tarjeta se mantiene en 40 GB, el tamaño que resulta estable en ella. Sin el controlador parcheado, cualquiera de las dos tarjetas muestra lo que NVIDIA envió: 8 o 10 GB.
¿El desbloqueo sobrevive a reinicios y actualizaciones del kernel?
Sí. Los módulos parcheados se instalan como cualquier otro módulo del kernel y se cargan en cada arranque. Cuando llega un kernel nuevo, un hook los recompila para él desde el código fuente de NVIDIA guardado en la máquina, antes de que arranques con él. Si una tarjeta apareciera igualmente con 8 GB, ejecuta cmp-unlock build con tu versión de kernel y apaga y enciende el servidor desde el panel de control.
¿Qué sistemas operativos reciben el controlador desbloqueado?
Ubuntu 22.04, 24.04 y 26.04, Debian 12 y 13, AlmaLinux 9 y 10, y Rocky Linux 9 y 10, instalados por nosotros, en cualquier máquina que tenga la tarjeta: forma parte de la instalación, no es una opción que marcar. Windows y Proxmox VE reciben la tarjeta tal como NVIDIA la envió: el desbloqueo es un controlador de kernel de Linux, y en Proxmox las tarjetas suelen ir a máquinas virtuales, a las que un controlador del host no llega.
¿Puedo usar CUDA, PyTorch, vLLM y llama.cpp en ella?
Sí. El controlador es el propio 610.57.04 de NVIDIA’ con los parches aplicados, así que todo lo compilado para una tarjeta Ampere con un controlador actual funciona. Instala el kit de herramientas CUDA por separado, con apt install cuda-toolkit o dnf install cuda-toolkit; los metapaquetes cuda y cuda-drivers traerían consigo un segundo controlador estándar, por lo que el gestor de paquetes está configurado para rechazarlos.
¿Un modelo de 70 mil millones de parámetros funcionará en una sola tarjeta?
En 4 bits, sí: los pesos ocupan unos 38 GB, lo que deja el margen que pide nuestra regla de dimensionamiento en una tarjeta de 64 GB. En 8 bits ocupan unos 70 GB, lo que requiere dos tarjetas; una máquina admite hasta cuatro.
¿Cuántas tarjetas puedo poner en un servidor?
Hasta cuatro en la máquina a la que enlaza esta página. Elige la cantidad en el configurador. Para más de cuatro, o para un modelo dividido entre máquinas, consulta la página multi-GPU.
¿Es fiable la memoria desbloqueada?
La tarjeta de 8 GB a 64 GB es la combinación que se ha mantenido en las pruebas públicas, y la tarjeta de 10 GB se detiene en 40 GB por la misma razón. Aun así, sigue siendo memoria que NVIDIA clasificó, y una tarjeta puede traer un sector débil: LTT Labs encontró una entre las tarjetas que probaron. Por eso cada instalación la comprueba: tras el primer arranque en frío, cada tarjeta escribe y lee cada byte que el controlador entregará, con patrones fijos, de dirección y pseudoaleatorios, cada uno invertido en su sitio, y el resultado va al registro de configuración del servidor’. Es una comprobación en la entrega, no una garantía por años; si una tarjeta más adelante se comporta mal, ejecuta cmp-unlock memtest y cuéntanos qué dice. Una tarjeta que falla se sustituye como cualquier otra pieza.
¿Por qué hay un cargo de configuración en esta compilación?
Porque la tarjeta se instala bajo pedido. Una máquina con una tarjeta añadida es una compilación personalizada, y una compilación personalizada lleva el cargo único de configuración que se muestra en la tabla de arriba. Se cobra una sola vez, y la cifra mensual no cambia en la renovación.
¿Dónde están estos servidores?
En cada ciudad que la tabla de arriba enumera. La línea también se vende en Ámsterdam, pero el configurador no puede instalar una tarjeta allí, así que una CMP desbloqueada no está disponible en esa ciudad.

Otro lugar donde mirar