Serwery GPU AMD Instinct

Wdróż AMD Instinct MI210 na infrastrukturze bare metal

Akcelerator AMD Instinct MI210 z 64 GB pamięci HBM2e do uczenia maszynowego i obliczeń wysokiej wydajności, w serwerze bare metal na platformie Intel Xeon Scalable lub AMD EPYC. Dobór sprzętu pod model językowy to inne zagadnienie: zacznij od hostingu LLM.

64 GB HBM2e z przepustowością pamięci 1638 GB/s. Architektura CDNA™ drugiej generacji na karcie PCIe 4.0. Trzy linie serwerów: dwie na Intel Xeon Scalable, jedna na AMD EPYC.

Serwery bare metal AMD Instinct MI210

Zaprojektowane do uczenia maszynowego i obliczeń wysokiej wydajności. MI210 łączy architekturę obliczeniową CDNA™ drugiej generacji z 64 GB pamięci HBM2e do intensywnego trenowania, inferencji i zastosowań HPC.

Maksymalna przepustowość obliczeniowa

Architektura CDNA™ drugiej generacji zapewnia przełomową wydajność obliczeniową w trenowaniu głębokiego uczenia i naukowych obciążeniach obliczeniowych wymagających maksymalnej przepustowości.

Standardowy format PCIe

MI210 przenosi krzem z serii MI200 na standardową kartę PCIe 4.0, dzięki czemu mieści się w zwykłym serwerze Xeon Scalable lub EPYC, a nie w wyspecjalizowanej platformie akceleratorów.

Ogromna pojemność pamięci

64 GB HBM2e z ECC umożliwia trenowanie i inferencję modeli wielkoskalowych oraz obciążenia HPC ograniczone pamięcią, a przepustowość 1638 GB/s stale zasila jednostki obliczeniowe.

Członek serii MI200 w formacie PCIe

MI250 i MI250X to moduły OAM przeznaczone do wyspecjalizowanych platform eksaskalowych. MI210 przenosi tę samą architekturę CDNA™ drugiej generacji na standardową kartę PCIe 4.0 — dlatego to właśnie ten akcelerator Instinct mamy na półce.

Architektura CDNA™ drugiej generacji

Celowo zaprojektowany krzem obliczeniowy zapewniający wyjątkową gęstość i efektywność energetyczną w obciążeniach przetwarzania równoległego na dużą skalę.

Akceleracja AI

Zoptymalizowane operacje macierzowe i obliczenia mieszanej precyzji do przyspieszonego trenowania głębokiego uczenia, dostrajania modeli i wdrażania inferencji.

Architektura spójności pamięci

Architektura AMD Infinity trzeciej generacji umożliwia komunikację o wysokiej przepustowości i niskich opóźnieniach między jednostkami obliczeniowymi GPU a pamięcią systemową, maksymalizując przepływ danych.

Interkonekt GPU

Łącza AMD Infinity Fabric™ umożliwiają szybką komunikację peer-to-peer między kartami MI210 w trenowaniu wielo-GPU i rozproszonych obciążeniach obliczeniowych.

Serwery Intel Xeon Scalable i AMD EPYC do obciążeń AMD Instinct™

Trzy platformy hosta

MI210 trafia na linię Intel Xeon Scalable Silver i Gold, na dwie linie enterprise budowane na zamówienie (Xeon Gold 6330 do 6354 na DDR4, Gold 6438Y na DDR5) oraz na linię AMD EPYC, aż do 64-rdzeniowego EPYC 7763. EPYC daje karcie gniazdo PCIe 4.0, czyli jej własną generację; Silver i Gold dają jej PCIe 3.0, połowę łącza hosta, co spowalnia pętlę treningową przesyłającą partie przez magistralę i nic nie zmienia w serwerze inferencyjnym, którego wagi już znajdują się w HBM.

Elastyczna rozbudowa

Skaluj infrastrukturę GPU na żądanie dzięki szybkiemu udostępnianiu sprzętu. Standardowe modernizacje i dodatkowa pojemność są zwykle wdrażane w ciągu 24 godzin.

Wsparcie eksperckie

Specjaliści od infrastruktury GPU dostępni całodobowo przez czat na żywo i e-mail, aby pomóc we wdrożeniu, optymalizacji i rozwiązywaniu problemów.

MI210 L40S A100 H100
Architektura GPU CDNA 2.0 Ada Lovelace NVIDIA Ampere Hopper
Pamięć GPU 64 GB HBM2e 48 GB GDDR6 80 GB HBM2e 80 GB HBM2e
Przepustowość pamięci GPU 1638 GB/s 864 GB/s 1935 GB/s 2039 GB/s
FP32 22,63 TFLOPS 91,6 TFLOPS 19,5 TFLOPS 51 TFLOPS
TF32 Tensor Core — 366 TFLOPS 312 TFLOPS 756 TFLOPS
FP16/BF16 Tensor Core 181 TFLOPS 733 TFLOPS 624 TFLOPS 1513 TFLOPS
Pobór mocy Do 300 W Do 350 W Do 300 W Do 350 W
Sama karta, miesięcznie Ładowanie... Ładowanie... Ładowanie... Ładowanie...

NVIDIA podaje wartości rdzeni tensorowych L40S, A100 i H100 ze strukturalną rzadkością, więc przy gęstych obliczeniach macierzowych podziel te komórki na pół. AMD podaje 181 TFLOPS dla MI210 bez współczynnika rzadkości, co sprawia, że wiersz FP16/BF16 to jedna wartość gęsta obok trzech rzadkich. MI210 nie ma trybu TF32, stąd myślnik w tym wierszu.

Często zadawane pytania o serwery AMD Instinct MI210

Poznaj odpowiedzi na częste pytania dotyczące wdrażania i obsługi serwerów bare metal z akceleracją GPU MI210 do trenowania, inferencji i zastosowań obliczeń wysokiej wydajności.

Czym jest AMD Instinct MI210 i które obciążenia zyskują najwięcej?

AMD Instinct MI210 to enterprise'owy procesor graficzny obliczeniowy zbudowany na architekturze CDNA™ drugiej generacji, zoptymalizowany pod kątem obliczeń, a nie grafiki. Sprawdza się doskonale w trenowaniu i inferencji głębokiego uczenia, symulacjach naukowych, obliczeniowej dynamice płynów, modelowaniu molekularnym i analityce danych wymagającej masowego przetwarzania równoległego. Jeśli wybierasz sprzęt pod model językowy, to zagadnienie ma własną stronę — zobacz hosting LLM.

Czym MI210 różni się od MI250 i MI250X?

MI250 i MI250X to moduły OAM zbudowane pod wyspecjalizowane platformy eksaskalowe i nie ma ich w naszym katalogu. MI210 przenosi tę samą architekturę CDNA™ drugiej generacji na standardową kartę PCIe 4.0 z 64 GB HBM2e, dlatego trafia do tych samych serwerów Xeon Scalable i EPYC, co nasze pozostałe opcje GPU.

Jaki jest typowy czas wdrożenia serwerów AMD Instinct?

Maszyna już zamontowana w szafie z MI210 jest dostarczana w ciągu około 30 minut od weryfikacji płatności. Gdy montujemy kartę, którą mamy na stanie, zajmuje to od 4 do 24 godzin; kartę, którą musimy dokupić, zajmuje od pięciu do dziesięciu dni roboczych, a przed płatnością dowiadujesz się, która opcja Cię dotyczy. Wszystkie serwery AMD Instinct obsługują natychmiastowe przeładowanie systemu operacyjnego bez zgłoszeń do pomocy technicznej, co umożliwia szybkie iteracje. Infrastruktura sieciowa jest zoptymalizowana pod kątem trwałych obciążeń o wysokiej przepustowości i łączności o niskich opóźnieniach.

Które frameworki i narzędzia programistyczne obsługują GPU AMD Instinct?

Akceleratory AMD Instinct działają na ROCm (Radeon Open Compute), otwartej platformie obliczeniowej GPU obsługującej PyTorch, TensorFlow, JAX, ONNX Runtime i inne wiodące frameworki ML. ROCm zawiera HIP (Heterogeneous-Compute Interface for Portability), umożliwiający proste przenoszenie kodu CUDA, a także zoptymalizowane biblioteki do algebry liniowej, FFT, generowania liczb losowych i głębokich sieci neuronowych. Pełne wsparcie kontenerów przez Docker i Kubernetes umożliwia wdrażanie AI/ML na skalę produkcyjną.

Jaką pamięć zapewnia MI210?

MI210 ma 64 GB HBM2e (High Bandwidth Memory) z ECC, zapewniając przepustowość pamięci 1638 GB/s. Ta pojemność obsługuje duże zbiory danych i obciążenia HPC ograniczone pamięcią bez ciągłego przerzucania pamięci między hostem a akceleratorem. Pamięć RAM systemu i pamięć NVMe konfiguruje się osobno w formularzu zamówienia, więc skalują się niezależnie od akceleratora.