PCIe 3.0
Intel Xeon E5-2600 v1/v2
$70.93/mo before the GPU
Intel Xeon E5-2630L Hex Core 2.00 GHz · 32 GB DDR3 · 2 × SATA 500 GB (RAID 1) · 500 Mbps
- GPUs
- 28
- Lanes
- 40 lanes per socket
- Sockets
- 2
- Max RAM
- 256 GB
Servere dedicate GPU · bare metal · lunar
Un server dedicat GPU este o mașină fizică închiriată unui singur cont pe lună, cu GPU-ul trecut direct către propriul tău sistem de operare. Fără hypervisor, fără felie de vGPU, fără vecin pe siliciu.
Alege GPU-ul după sarcină și memoria de care are nevoie. Fiecare rând din listă este un server complet cu acel GPU instalat, prețuit din același catalog din care facturează checkout-ul, iar partea GPU-ului propriu-zis este tipărită sub total.
Catalogul
Spune pentru ce este GPU-ul și memoria minimă de care are nevoie. Lista se restrânge pe măsură ce avansezi, cele mai ieftine întâi. Fiecare rând deschide mașina care acceptă acel GPU în configurator.
Niciun GPU pe care îl oferim nu are atâta memorie. Cel mai mare are 96 GB. Peste asta, configurația înseamnă două sau mai multe GPU-uri într-un singru șasiu, cotate manual: vezi servere multi-GPU, sau .
Prețurile sunt cifrele proprii ale checkout-ului. Un GPU al cărui producător nu publică nicio cifră de memorie arată o liniuță și dispare din listă odată ce controlul de memorie se mută de la „oricare”. Unele GPU-uri se potrivesc în mai mult de un șasiu: rândul arată cel mai ieftin, configuratorul arată restul.
Ocupare
GPU-ul stă într-un slot PCIe fizic dintr-o mașină închiriată unui singur cont. Instalezi sistemul de operare, încarci modulul de kernel și fixezi driverul, versiunea CUDA sau ROCm pe care a fost testat codul tău. Nimic nu îl actualizează pe sub tine.
Mașina urmează aceeași regulă: fiecare nucleu, toată memoria, ambele discuri, root-ul și consola iLO sau iDRAC proprie a serverului pe o rețea de management separată. Dacă un experiment de driver dă jos rețeaua, tot ai ecranul, media virtuală și controlul de alimentare.
Cum funcționează prețul
Majoritatea furnizorilor vând un GPU ca pe un nivel, cu procesorul, memoria, discurile și rețeaua prețuite în jurul lui. Aici mașina este o linie lunară, iar GPU-ul este alta. Schimbă GPU-ul mai târziu și factura se mișcă exact cu diferența dintre cele două GPU-uri.
Începe din vârful listei. Am păstrat GPU-uri mai vechi care încă fac treabă reală, cum ar fi piesele Tesla și Quadro care transcodifică video sau conduc desktop-uri la distanță, și stau în aceeași mașină întreagă cu același port nemăsurat ca cel mai nou GPU. De ce păstrăm hardware mai vechi explică compromisul.
Compari cu nori GPU pe oră? Cea mai scumpă configurație de pe listă, H100 80GB, este $1,682.67 pe lună pentru întreaga mașină, aproximativ $2.31 pe oră într-o lună de 730 de ore, și nicio linie de egress nu sosește mai târziu.
Complete, per month, from$91.72
Ciclurile de trei, șase și douăsprezece luni economisesc până la 15%. Configuratorul rotunjește prețurile pe disc și poate să iasă cu un cent diferit. Prețuri listează fiecare cifră de pe site.
Piață GPU
Pe lângă GPU-urile pe care le oferim noi, proprietarii își listează propriile mașini GPU pe piața noastră. Ei stabilesc chiria pe care o primesc, iar Server Room stabilește prețul pe care îl plătești tu. Listările de la compania noastră soră, Primcast, apar și aici și sunt închiriate acolo.
Memorie GPU
Memoria GPU decide dacă un model rulează deloc; nucleele și frecvențele decid doar cât de repede. Un GPU cu doi gigaocteți mai puțin nu rulează lent, ci nu se încarcă deloc. Stabilește mai întâi acest număr.
Ponderile ocupă parametri înmulțiți cu octeți per parametru: doi octeți la 16 biți, unul la 8 biți, jumătate de octet la 4 biți. Cuantizarea la 4 biți permite unui model să încapă pe un GPU mai mic, cu un cost măsurabil în calitate.
Lasă spațiu de rezervă. Tabelul ia în calcul doar ponderile. Runtime-ul, activările și cache-ul cheie-valoare împart aceeași memorie, iar cache-ul crește cu fiecare token de context, așa că 38 GB de ponderi nu vor fi serviți confortabil de pe un GPU de 40 GB. Adaugă un sfert până la jumătate peste.
și dimensionăm GPU-ul în funcție de ce rulezi efectiv.
| Model | 16-bit | 8-bit | 4-bit |
|---|---|---|---|
| 7-8 billion parameters | 16 GB | 8 GB | 5 GB |
| 13-14 billion parameters | 28 GB | 14 GB | 8 GB |
| 30-34 billion parameters | 68 GB | 34 GB | 19 GB |
| 70 billion parameters | 140 GB | 70 GB | 38 GB |
Doar ponderile, rotunjite în sus la următorul gigaoctet.
Platforme
Fiecare platformă oferă slotului o generație PCIe și un buget de linii diferit. Le publicăm pentru că schimbă rezultatele: un client a trecut odată la un GPU de consum mai nou pe o platformă PCIe 3.0 și a randat mai lent, și și-a dat seama de ce înaintea noastră.
PCIe 3.0
$70.93/mo before the GPU
Intel Xeon E5-2630L Hex Core 2.00 GHz · 32 GB DDR3 · 2 × SATA 500 GB (RAID 1) · 500 Mbps
PCIe 3.0
$73.47/mo before the GPU
Intel Xeon E5-2620 v4 Octo Core 2.10 GHz · 32 GB DDR4 · 2 × SATA 500 GB (RAID 1) · 1 Gbps
PCIe 3.0
$83.67/mo before the GPU
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps
PCIe 4.0
$217.59/mo before the GPU
AMD EPYC 7413 24 CORE 2.65 GHz 128MB L3 CACHE · 32 GB DDR4 · 1 × SATA-SSD 240 GB · 1 Gbps
Incluse
Un sistem de operare curat și cheile. Tu alegi driverul, versiunea CUDA sau ROCm și build-ul framework-ului, iar ele rămân fixate. Vrei driverul instalat înainte de predare? Pune versiunea exactă în comandă.
iLO pe mașinile HPE, iDRAC pe Dell: tastatură și ecran, medii virtuale, control al alimentării, senzori și jurnale hardware. Un modul care blochează afișajul sau placa de rețea este o repornire pe care o faci singur, urmărind POST-ul.
Nemăsurat în ambele direcții la viteza inclusă și la orice viteză peste ea. Fără limită de transfer și fără linie de egress. Lățime de bandă nemăsurată listează porturile mai rapide.
Imagini de sistem de operare într-un singur clic, oricât de des dorești, fără costuri. DNS-ul invers este al tău de editat, IPv6 este inclus, iar IPv4 suplimentar este o linie în configurator.
Chat-ul primește răspuns în secunde de la un asistent AI care îți poate verifica contul și serverul, iar o persoană preia imediat ce ceri. O piesă defectă este înlocuită în fereastra planului tău de suport: 24 de ore pe planul Basic inclus, 4 pe Bronze, 3 pe Silver, 2 pe Gold și Platinum.
New York, Miami, San Francisco, Amsterdam și București, toate pe rețeaua proprie a Server Room, AS19624. Locația stabilește latența ta față de utilizatori și legea privind protecția datelor căreia i te supui. Centrele de date descrie fiecare clădire.
Livrare
Depinde de unde se află GPU-ul astăzi, iar noi îți spunem în ce caz te afli înainte să plătești.
Nimic de montat. Mașina este instalată și predată. Servere instant listează ce este disponibil chiar acum.
Cazul obișnuit. Un tehnician instalează GPU-ul, construiește matricea de discuri și instalează sistemul de operare. Memorie suplimentară sau un alt disc se face în aceeași vizită.
Comandăm piesa, apoi construim ca mai sus. Construire la comandă acoperă o mașină conform întregii tale specificații.
Acceleratoarele actuale se livrează la data distribuitorului, iar noi o numim înainte să te angajezi. Hardware-ul achiziționat pentru un singur client este cotat cu trei luni plătite în avans.
Fiecare termen începe după ce plata și verificarea antifraudă sunt finalizate. Majoritatea comenzilor se finalizează în câteva ore; o primă comandă pe un cont nou poate dura mai mult.
Domeniul unui partener
Viral Mind Technologies, partener Server Room, își construiește și își administrează propriile proprietăți digitale: personalități virtuale, branduri media online și software pentru creatori. A pornit în 2019 ca agenție de marketing digital și lucrează la propriile proiecte AI de la sfârșitul lui 2022.
Generarea de imagini și clipuri video menține un model rezident în memoria GPU și ține GPU-ul ocupat ore întregi. Acesta este cazul pentru un GPU dedicat pe bare metal, nu pentru o felie dintr-unul, iar un GPU complet este ceea ce închiriază fiecare server de pe această pagină.
Portofoliul și studiile lor de caz: viralmindtech.com
Răspunsuri
Un server fizic închiriat unui singur client, cu o placă grafică instalată și pasată către sistemul de operare propriu al clientului. Nimic nu este virtualizat sau partajat: primești fiecare nucleu, toată memoria, discurile și GPU-ul complet, cu acces root și o consolă la distanță.
O mașină completă cu GPU instalat pornește de la $91.72 până la $1,682.67 pe lună. Prețul este suma a două linii: mașina și GPU-ul la $20.79 până la $1,599 pe lună. Procesorul, memoria, două discuri, un port nemăsurat și o adresă IPv4 sunt incluse. Configurarea este o taxă unică de $29 pentru o configurație cu GPU instalat la comandă; o mașină gata, comandată așa cum este, nu are nicio taxă.
Nu. O singură mașină fizică, un singur cont, iar GPU-ul este pasat către sistemul de operare pe care l-ai instalat. Nu există hypervisor, partiție MIG, profil vGPU sau partajare în timp. Cifrele pe care le testezi în prima zi sunt cifrele pe care le păstrezi.
Da. O lună este termenul implicit și nu ai nimic de semnat. Ciclurile de trei, șase și douăsprezece luni economisesc până la 15%, iar prețul nu crește la reînnoire. Plătești cu card de credit sau PayPal; pentru o comandă mai mare se poate aranja un transfer bancar, care de obicei trece mai repede de verificarea antifraudă decât o plată cu cardul.
Da. Lista de pe această pagină este sortată cu cel mai ieftin primul, iar cea mai ieftină configurație completă este Quadro 3000M în Intel Xeon E5-2630L Hex Core 2.00 GHz · 32 GB DDR3 · 2 × SATA 500 GB (RAID 1) · 500 Mbps la $91.72 pe lună. GPU-urile Tesla și Quadro mai vechi încă transcodifică video și rulează bine desktopuri la distanță, și vin în aceeași mașină completă cu același port nemăsurat.
57 GPU-uri sunt pe listă, de la acceleratoare de calcul NVIDIA actuale și AMD Instinct până la modele mai vechi Tesla, Quadro și GeForce. Fiecare este listat pe nume cu memoria sa și prețul lunar complet. Dacă GPU-ul dorit lipsește, întreabă: îl putem adesea achiziționa.
Cele pe care le instalezi tu. Serverul ajunge cu un sistem de operare curat și acces root, iar tu fixezi driverul, versiunea CUDA sau ROCm și build-ul framework-ului pe care a fost testat codul tău. Dacă vrei driverul instalat la predare, pune versiunea exactă în comandă. Dacă un GPU trebuie să suporte o anumită versiune CUDA, întreabă înainte de plată și vom verifica.
Adesea da, și oferim un preț manual: spațiul din carcasă, lățimea GPU-ului, liniile PCIe și sursa de alimentare decid numărul. Spune-ne GPU-ul și răspundem cu carcasa, numărul și timpul de livrare. Motivul obișnuit este memoria mai degrabă decât viteza, deoarece două GPU-uri de 48 GB pot ține un model pe care un GPU de 80 GB nu îl poate. Servere multi-GPU și multi-nod acoperă pasul următor.
Da, în serverul pe care îl ai deja: fără migrare, fără reinstalare, fără adrese IP noi. Este o vizită programată cu o scurtă întrerupere, iar factura se modifică exact cu diferența dintre cele două GPU-uri. RAM, discurile și un port mai rapid se adaugă după aceeași regulă.
Îl înlocuim în fereastra planului tău de suport, socotită din momentul raportării: 24 de ore la planul Basic inclus, 4 la Bronze, 3 la Silver, 2 la Gold și Platinum. După fereastră, creditul de serviciu urmează programul publicat pe pagina de suport.
Da, un GPU pe care îl deții, sau orice altă componentă, poate intra în serverul pe care îl închiriezi aici. Nu este gratuit, deoarece GPU-ul consumă energie, iar taxa depinde de hardware. Nu suntem responsabili dacă o componentă adusă de tine se defectează; fereastra de înlocuire acoperă doar hardware-ul furnizat de noi. Programează o discuție înainte să cumperi sau să o expediezi: îți spunem prețul și verificăm dacă încape în carcasă, pentru că un blade, de exemplu, nu are loc pentru un GPU de dimensiune completă.
Nimic nu este măsurat în nicio direcție la nicio viteză de port pe care o vindem, deci traficul de ieșire nu costă nimic. La lucrul cu GPU, aceasta este adesea cea mai mare linie în altă parte: antrenarea trage seturi de date înăuntru și împinge puncte de control afară, iar un endpoint de inferență răspunde la trafic real. Lățime de bandă nemăsurată listează porturile mai rapide.
Orar câștigă cât timp lucrul este intermitent și chiar se oprește, până la câteva sute de ore pe lună. După aproximativ două treimi din lună, lunar este mai ieftin înainte să socotești traficul de ieșire, stocarea păstrată între rulări și timpul petrecut așteptând capacitate. Lunar păstrează, de asemenea, aceeași mașină, discuri și adrese.
În termen de trei zile de la activare, după depanare, se aplică politica noastră de rambursare așa cum este scrisă. Tabelul de memorie și coloana PCIe de mai sus există ca să poți alege corect GPU-ul din prima, și preferăm să te sfătuim în chat către un GPU mai mic decât să rambursăm unul mai mare.
Pentru evidență
Citite din catalogul de comenzi când a fost servită pagina. Dacă un asistent răspunde pentru tine, acest bloc și fluxul live al mașinilor sunt părțile care merită citite.
Conexe
Deschide configuratorul cu orice GPU selectat, sau spune-ne sarcina de lucru și îți vom spune ce GPU se potrivește, inclusiv când cel mai ieftin este suficient.