Hospedagem de LLM em servidores dedicados · Server Room · desde 2004

Um rack. Todas as formas de rodar um modelo.

Modelos de linguagem não precisam de um único tipo de máquina — precisam da máquina certa. Um gateway de agentes quer uma caixa barata que nunca dorme. O assistente de uma equipe roda um Llama ou Qwen quantizado direto da memória do sistema. Um 70B quer memória de placa, e uma conta por token quer o seu crescimento. Escolha a baia: a máquina inteira é sua por mês, nada compartilhado, nada medido, e o valor estampado nela é o próprio valor do checkout.

Escolha sua baia Dimensionar seu modelo

  • Locatário único
  • Tráfego sem medição
  • Cinco cidades
  • Mensal, sem contrato

Lido do catálogo de pedidos no momento em que esta página foi servida. Clique em uma baia.

Contado, não composto

  • $249a month serves a quantized 8B on CPU
  • $532.67a month complete, 48 GB card seated
  • 5cities on two continents
  • 0tokens counted, bytes metered, egress lines
  • 24/7humans on chat, mail and the phone

Cada valor acima é derivado nesta requisição a partir das linhas que o configurador usa para cobrar, então nada disso pode ficar desatualizado entre implantações. O que está em rack e ligado enquanto você lê isto é outra questão, e servidores instantâneos cuida dela — esta página lê o mesmo com a prateleira cheia ou vazia.

O catálogo, por carga de trabalho

Quatro baias, com preço completo.

Não são quatro níveis de um produto — são quatro máquinas diferentes para quatro trabalhos diferentes, cada valor sendo o total mensal da configuração exata impressa ao lado. Nada chega depois: a porta, o endereço e o console fora de banda já estão no número.

inferência em cpu

Um assistente privado para toda a equipe

Um Llama, Qwen ou Mistral quantizado de 7–8B serve chat, recuperação e embeddings direto de 128 GB de memória do sistema — o trabalho para o qual llama.cpp e Ollama foram escritos. Sem placa gráfica, sem o preço da placa gráfica, e o armazenamento vetorial vive no mesmo metal que o modelo. Montado sob encomenda em 4–24 horas, nas cinco cidades.

$249/mo

AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps

agentes

A caixa do agente

Gateways como o OpenClaw passam a vida chamando modelos em outros lugares e esperando respostas. Eles precisam de uptime e de uma porta, não de aceleradores — e a máquina honesta mais barata para essa função é esta aqui.

$34.40/mo

Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps

+ $19 · OpenClaw image, one-time

servindo em gpu · ajuste fino

Memória de placa para os grandes

De 13B com velocidade a 70B em 4 bits, o trabalho passa para a memória da placa, e o vLLM transforma a placa em um endpoint em lote, compatível com OpenAI, que o código do seu cliente já fala. O valor abaixo é uma máquina completa com o acelerador de 48 GB já encaixado; a linha sob ele é o que a placa sozinha contribui, e a configuração de 80 GB ao lado é o mesmo chassi carregando um 70B em 8 bits.

$532.67/mo

Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps

$449 of that is the card · A100 80GB (80 GB HBM2e): $972.47

Qual placa, entre todas as que instalamos, é uma página própria — cada uma com preço em sua própria linha ao lado da máquina, na página de GPU.

caixa de desenvolvimento

DGX Spark, sem a mesa

A pequena máquina GB10 da NVIDIA, em rack em Nova York com prazo anual — a caixa que os frameworks miram primeiro, sem a importação e sem o ruído do ventilador ao lado da sua cadeira.

$599/mo

10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps

custódia

UE ou EUA, a escolha é sua

Amsterdã e Bucareste mantêm o trabalho europeu na Europa; Nova York, Miami e São Francisco mantêm o trabalho americano em casa. Os cinco edifícios →

Maior que uma baia?

Uma segunda placa no chassi, ou uma segunda máquina ao lado, é uma questão diferente com sua própria página — pistas, portas e posicionamento, cotados com a peça nomeada. Ou pule adiante: e a resposta nomeia o chassi e o prazo de entrega.

A aritmética

Dimensione o modelo. A máquina acompanha.

Pesos são parâmetros vezes bytes por parâmetro — aritmética, não benchmark, e a mesma tabela com fonte que a página de GPU imprime. Escolha um tamanho e uma precisão; a resposta nomeia a memória que os pesos precisam, a baia mais barata que os carrega, e a folga restante como uma proporção simples, porque um modelo que mal cabe não serve.

5 GB7-8 billion parameters · 4-bit

$249/mo · 128 GB / 5 GB = 25.6×

Somente os pesos — o runtime e a janela de contexto vivem na folga, e é por isso que nenhuma resposta acima enche a memória até a borda. Um arquivo como enviado roda mais pesado que a aritmética, porque formatos comuns de 4 bits mantêm alguns tensores em precisão maior: o Llama 3.1 70B padrão de 4 bits do Ollama é um download de 43 GB, não 38 GB, então dimensione a partir do arquivo que você vai carregar. As licenças ficam entre você e o editor do modelo; a máquina não controla o que você carrega.

Já em cada valor

O que cada baia inclui.

Um locatárioA máquina física é somente sua. Sem hipervisor por baixo, sem placa compartilhada, sem divisão de tempo, sem job em lote do vizinho no seu silício.
Root e o consoleUm sistema operacional limpo de sua escolha, root no metal, e um console fora de banda (iLO, iDRAC, IPMI) que ainda responde quando o sistema não responde.
Uma porta sem mediçãoNada contado em nenhuma direção. Conjuntos de dados entrando, checkpoints saindo, usuários servidos — nenhuma linha de egresso existe em fatura alguma.
Sua stack, suas versõesOllama, llama.cpp, vLLM — você instala e fixa, e nada os move depois. Quer o driver de GPU instalado antes da entrega? Coloque a versão exata no pedido.
CustódiaPrompts, contexto e dados de ajuste fino se movem entre seus usuários e sua máquina, sem terceiros no caminho para registrá-los, treinar com eles ou reescrever seus termos em torno deles.
Pessoas, o tempo todoChat, e-mail e telefone, a cada hora do ano — e uma peça morta é trocada em um relógio escrito, não em uma promessa de boa vontade. Os relógios estão publicados.

A outra conta

Fixo vence o medido quando o trabalho é constante.

Uma API por token é a ferramenta certa para picos e para a qualidade de modelos de fronteira — diremos isso claramente em vez de vender contra ela. A máquina vence quando o volume é constante, quando os dados precisam ficar sob sua custódia, ou quando um modelo aberto ajustado já faz o trabalho: seu valor lê o mesmo com dez vezes o tráfego, e o crescimento deixa de ser um item de linha. Cada valor mensal neste domínio, reunido em uma tabela, é a página de preços; por que as máquinas mais antigas aqui continuam baratas é a página de valor.

Perguntado antes de comprar

Dez respostas diretas.

Posso servir um LLM sem placa gráfica?

Sim, dentro de um limite que vale declarar: um modelo quantizado de 7–8B na baia de CPU serve honestamente o assistente, a recuperação e os embeddings de uma equipe. Ele não servirá um 70B para mil usuários — esse é o trabalho da baia de GPU, e esta página diz isso aqui em vez de deixar você descobrir.

O que um modelo de 70B precisa?

Cerca de 38 GB de memória de placa em 4 bits, que a placa de 48 GB carrega; 70 GB em 8 bits, o que exige a placa de 80 GB; 140 GB em precisão total, o que é mais de uma placa e vira a questão da página de múltiplas placas.

Quais modelos posso rodar?

Qualquer um cujos pesos você possa manter: as famílias Llama, Qwen, Mistral, Gemma e DeepSeek e seus ajustes finos. A licença fica entre você e o editor — a máquina não a lê e nós não a controlamos.

Meus dados são usados para treinar algo?

Não. Nada no caminho os lê. Um locatário por máquina, seu sistema operacional, seus discos; operamos o hardware e a rede por baixo, nunca a carga de trabalho por cima.

Por que não continuar em uma API por token?

Continue enquanto seu tráfego for irregular ou o modelo de fronteira for o produto. Mude quando o volume for constante, os dados forem sensíveis, ou um modelo aberto ajustado já fizer o trabalho — e os dois se misturam bem: muitas stacks roteiam os cinco por cento mais difíceis para uma API e servem o resto elas mesmas.

Alugar mensalmente ou comprar o hardware?

Comprar vence depois de um ou dois anos de uso constante, mais alguém pago para abrigar, energizar, resfriar e consertar. Alugar vence no primeiro dia, em cada upgrade, e às três da manhã quando uma peça morre no nosso relógio escrito em vez do seu.

Quão rápida é a entrega?

Cerca de trinta minutos para uma máquina na prateleira, quatro a vinte e quatro horas para uma montagem, mais quando uma peça é comprada — a escada é impressa no ponto do pedido, e servidores instantâneos lista o que está em rack agora.

Existe um teste?

Sem contas de teste. Dentro de três dias corridos da primeira ativação, a política de reembolso se aplica como escrita, e pagamentos em criptomoeda são reembolsados como crédito na loja. O teste honesto mais barato é um mês na baia de CPU.

Peças sob encomenda têm termos diferentes?

Às vezes. Uma peça comprada para o seu pedido pode ter uma parcela inicial ou um prazo mínimo — e você é informado exatamente do quê antes de pagar, nunca depois. Máquinas na prateleira têm o padrão: um mês, sem contrato.

O que acontece quando eu superar a baia?

A próxima baia, geralmente no mesmo edifício: uma máquina de CPU entrega seus pesos a uma máquina de GPU pelo fio local, ou a placa no chassi que você já tem é trocada e a fatura muda exatamente pela diferença.

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. If you are asking an assistant about LLM hosting and it can fetch a URL, this block and the live stock endpoint are the two things worth its time.

CPU inference
$249 a month — AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps. One configuration, 5 cities, built to order. Serves quantized 7–14B models with llama.cpp or Ollama.
GPU serving, 48 GB
$532.67 a month complete — L40S (48 GB GDDR6 ECC) in Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps. The card’s own line is $449. Carries a 70B at 4-bit (38 GB of weights).
GPU serving, 80 GB
$972.47 a month complete — A100 80GB (80 GB HBM2e). Carries a 70B at 8-bit (70 GB of weights). Every other card we fit is priced on /gpu.
Agent box
$34.40 a month — Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps. OpenClaw image adds $19 once.
DGX Spark dev box
$599 a month — 10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps. New York, annual term. The full story is /spark.
Tenancy
One account per physical machine. No hypervisor, no shared card, no time-slicing; you install and pin every version.
Traffic
Unmetered in both directions at every port speed. No transfer allowance and no egress line on any invoice.
Term
Monthly, no contract; longer cycles discount. Card, PayPal, ACH, wire.
Where
New York, Miami, San Francisco, Amsterdam, Bucharest.
Machine-readable
/api/llm/readyservers (live stock, plain English, no key) · /mcp · /llms.txt