Hospedagem de LLM em servidores dedicados · Server Room · desde 2004

Um rack. Todas as formas de rodar um modelo.

Modelos de linguagem não precisam de um tipo de máquina — precisam da máquina certa. Um gateway de agentes quer uma caixa barata que nunca dorme. O assistente de uma equipe roda um Llama ou Qwen quantizado direto da memória do sistema. Um 70B quer memória de placa, e uma conta por token quer o seu crescimento. Escolha a baia: a máquina inteira é sua por mês, nada compartilhado, nada medido, e o valor estampado nela é o próprio do checkout.

Escolha sua baia Dimensionar seu modelo

  • Locatário único
  • Tráfego sem medição
  • Cinco cidades
  • Mensal, sem contrato

Lido do catálogo de pedidos no momento em que esta página foi servida. Clique em uma baia.

Contado, não composto

  • $249a month serves a quantized 8B on CPU
  • $532.67a month complete, 48 GB card seated
  • 5cities on two continents
  • 0tokens counted, bytes metered, egress lines
  • 24/7humans on chat, mail and the phone

Cada valor acima é derivado nesta requisição a partir das linhas que o configurador usa para faturar, então nada disso pode ficar desatualizado entre implantações. O que está em rack e ligado enquanto você lê isto é outra questão, e servidores instantâneos cuida dela — esta página lê o mesmo com a prateleira cheia ou vazia.

O catálogo, por carga de trabalho

Quatro baias, com preço completo.

Não são quatro níveis de um produto — são quatro máquinas diferentes para quatro trabalhos diferentes, cada valor sendo o total mensal da configuração exata impressa ao lado. Nada chega depois: a porta, o endereço e o console fora de banda já estão no número.

inferência em cpu

Um assistente privado para toda a equipe

Um Llama, Qwen ou Mistral quantizado de 7–8B serve chat, recuperação e embeddings direto de 128 GB de memória do sistema — o trabalho para o qual llama.cpp e Ollama foram escritos. Sem placa gráfica, sem o preço de placa gráfica, e o armazenamento vetorial vive no mesmo metal que o modelo. Montado sob encomenda em 4–24 horas, nas cinco cidades.

$249/mo

AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps

agentes

A caixa do agente

Gateways como o OpenClaw passam a vida chamando modelos em outros lugares e esperando respostas. Precisam de uptime e de uma porta, não de aceleradores — e a máquina honesta mais barata para essa função é esta.

$34.40/mo

Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps

+ $19 · OpenClaw image, one-time

serving em gpu · fine-tuning

Memória de placa para os grandes

De 13B com velocidade a 70B em 4 bits, o trabalho passa para a memória da placa, e o vLLM transforma a placa em um endpoint em lote compatível com OpenAI que o código do seu cliente já fala. O valor abaixo é uma máquina completa com o acelerador de 48 GB já instalado; a linha sob ele é o que a placa sozinha contribui, e a configuração de 80 GB ao lado é o mesmo chassi carregando um 70B em 8 bits.

$532.67/mo

Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps

$449 of that is the card · A100 80GB (80 GB HBM2e): $972.47

Qual placa, entre todas as que instalamos, é uma página própria — cada uma com preço como linha própria ao lado da máquina, na página de GPU.

caixa de desenvolvimento

DGX Spark, sem a mesa

A pequena máquina GB10 da NVIDIA, em rack em Nova York com prazo anual — a caixa que os frameworks miram primeiro, sem a importação e o ruído de ventoinha ao lado da sua cadeira.

$599/mo

10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps

custódia

UE ou EUA, a escolha é sua

Amsterdã e Bucareste mantêm o trabalho europeu na Europa; Nova York, Miami e São Francisco mantêm o trabalho americano em casa. Os cinco edifícios →

Maior que uma baia?

Uma segunda placa no chassi, ou uma segunda máquina ao lado, é uma questão diferente com página própria — pistas, portas e posicionamento, cotados com a peça nomeada. Ou pule adiante: e a resposta nomeia o chassi e o prazo de entrega.

A aritmética

Dimensionar o modelo. A máquina segue.

Pesos são parâmetros vezes bytes por parâmetro — aritmética, não benchmarking, e a mesma tabela com fonte que a página de GPU imprime. Escolha um tamanho e uma precisão; a resposta nomeia a memória que os pesos precisam, a baia mais barata que os carrega, e a folga restante como uma razão simples, porque um modelo que mal cabe não serve.

5 GB7-8 billion parameters · 4-bit

$249/mo · 128 GB / 5 GB = 25.6×

Somente pesos — o runtime e a janela de contexto vivem na folga, e é por isso que nenhuma resposta acima enche a memória até a borda. Licenças ficam entre você e o editor do modelo; a máquina não controla o que você carrega.

Já em cada valor

O que cada baia inclui.

Um locatárioA máquina física é somente sua. Nenhum hypervisor por baixo, nenhuma placa compartilhada, nenhum fatiamento de tempo, nenhum job em lote do vizinho no seu silício.
Root e o consoleUm SO limpo de sua escolha, root no metal, e um console fora de banda (iLO, iDRAC, IPMI) que ainda responde quando o SO não responde.
Uma porta sem mediçãoNada contado em nenhuma direção. Datasets entrando, checkpoints saindo, usuários servidos — nenhuma linha de egresso existe em fatura alguma.
Sua stack, suas versõesOllama, llama.cpp, vLLM — você instala e fixa, e nada os move depois. Quer o driver de GPU no lugar antes da entrega? Coloque a versão exata no pedido.
CustódiaPrompts, contexto e dados de fine-tuning se movem entre seus usuários e sua máquina, sem terceiros no caminho para registrá-los, treinar com eles ou reescrever seus termos em torno deles.
Pessoas, o tempo todoChat, e-mail e telefone, todas as horas do ano — e uma peça morta é trocada em um relógio escrito, não em uma promessa de boa vontade. Os relógios estão publicados.

A outra conta

Fixo vence medido quando o trabalho é constante.

Uma API por token é a ferramenta certa para picos e para qualidade de modelo de fronteira — diremos isso claramente em vez de vender contra. A máquina vence quando o volume é constante, quando os dados precisam ficar sob sua custódia, ou quando um modelo aberto ajustado já faz o trabalho: seu valor lê o mesmo com dez vezes o tráfego, e o crescimento deixa de ser um item de linha. Cada valor mensal neste domínio, reunido em uma tabela, é a página de preços; por que as máquinas mais antigas aqui continuam baratas é a página de valor.

Perguntado antes de comprar

Dez respostas diretas.

Posso servir um LLM sem placa gráfica?

Sim, dentro de um limite que vale declarar: um modelo quantizado de 7–8B na baia de CPU serve honestamente o assistente, a recuperação e os embeddings de uma equipe. Ele não servirá um 70B para mil usuários — esse é o trabalho da baia de GPU, e esta página diz isso aqui em vez de deixar você descobrir.

O que um modelo 70B precisa?

Cerca de 38 GB de memória de placa em 4 bits, que a placa de 48 GB carrega; 70 GB em 8 bits, o que exige a placa de 80 GB; 140 GB em precisão total, o que é mais de uma placa e vira a questão da página multi-placa.

Quais modelos tenho permissão de rodar?

Qualquer um cujos pesos você possa deter: as famílias Llama, Qwen, Mistral, Gemma e DeepSeek e seus fine-tunes. A licença fica entre você e o editor — a máquina não a lê e nós não a controlamos.

Meus dados são usados para treinar algo?

Não. Nada no caminho os lê. Um locatário por máquina, seu sistema operacional, seus discos; operamos o hardware e a rede por baixo, nunca a carga de trabalho por cima.

Por que não ficar em uma API por token?

Fique enquanto seu tráfego for irregular ou o modelo de fronteira for o produto. Mude quando o volume for constante, os dados forem sensíveis, ou um modelo aberto ajustado já fizer o trabalho — e os dois se misturam bem: muitas stacks roteiam os cinco por cento mais difíceis para uma API e servem o resto elas mesmas.

Alugar mensalmente, ou comprar o hardware?

Comprar vence depois de um ou dois anos de uso constante, mais alguém pago para abrigar, energizar, resfriar e consertar. Alugar vence no primeiro dia, em cada upgrade, e às três da manhã quando uma peça morre no nosso relógio escrito em vez do seu.

Quão rápida é a entrega?

Cerca de trinta minutos para uma máquina na prateleira, quatro a vinte e quatro horas para uma montagem, mais quando uma peça é comprada sob encomenda — a escada é impressa no ponto do pedido, e servidores instantâneos lista o que está em rack agora.

Existe teste?

Sem contas de teste. Dentro de três dias corridos da primeira ativação, a política de reembolso se aplica como escrita, e pagamentos em criptomoeda reembolsam como crédito na loja. O teste honesto mais barato é um mês na baia de CPU.

Peças de pedido especial têm termos diferentes?

Às vezes. Uma peça comprada para o seu pedido pode ter uma parcela antecipada ou um prazo mínimo — e você é informado exatamente do quê antes de pagar, nunca depois. Máquinas na prateleira têm o padrão: um mês, sem contrato.

O que acontece quando eu supero a baia?

A próxima baia, geralmente no mesmo edifício: uma máquina CPU entrega seus pesos a uma máquina GPU pelo fio local, ou a placa no chassi que você já tem é trocada e a fatura se move exatamente pela diferença.

For the record

The whole page, reduced to figures.

Read from the order catalog at the moment this page was served. If you are asking an assistant about LLM hosting and it can fetch a URL, this block and the live stock endpoint are the two things worth its time.

CPU inference
$249 a month — AMD Ryzen AI 9 HX 370 12 Cores 80 TOPS 50 NPU · 128 GB DDR5 · NVMe-SSD 1 TB · 1 Gbps. One configuration, 5 cities, built to order. Serves quantized 7–14B models with llama.cpp or Ollama.
GPU serving, 48 GB
$532.67 a month complete — L40S (48 GB GDDR6 ECC) in Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps. The card’s own line is $449. Carries a 70B at 4-bit (38 GB of weights).
GPU serving, 80 GB
$972.47 a month complete — A100 80GB (80 GB HBM2e). Carries a 70B at 8-bit (70 GB of weights). Every other card we fit is priced on /gpu.
Agent box
$34.40 a month — Intel Atom C2750 Processor, 8 core 2.4 GHz · 16 GB DDR3 · 1 × SATA 500 GB · 500 Mbps. OpenClaw image adds $19 once.
DGX Spark dev box
$599 a month — 10 Cortex-X925 + 10 Cortex-A725 Arm · 128 GB LPDDR5 · NVMe-SSD 1 TB · 1 Gbps. New York, annual term. The full story is /spark.
Tenancy
One account per physical machine. No hypervisor, no shared card, no time-slicing; you install and pin every version.
Traffic
Unmetered in both directions at every port speed. No transfer allowance and no egress line on any invoice.
Term
Monthly, no contract; longer cycles discount. Card, PayPal, ACH, wire.
Where
New York, Miami, San Francisco, Amsterdam, Bucharest.
Machine-readable
/api/llm/readyservers (live stock, plain English, no key) · /mcp · /llms.txt