Kentino K-AI 576 Genoa RTX PRO 6000 MAX-Q: Teknisk arkitektur, ydelsesanalyse og AI-benchmarks

Kentino K-AI 576 Genoa RTX PRO 6000 MAX-Q: Teknisk arkitektur, ydelsesanalyse og AI-benchmarks

Den eksponentielle vækst inden for generativ AI, store sprogmodeller (LLM'er) og high-fidelity-rendering kræver et fundamentalt skift i serverinfrastrukturen. Kentino K-AI 576 Genoa er konstrueret som en GPU-computernode med høj densitet, der kombinerer AMD EPYC Genoa-værtsprocessorer med 6x NVIDIA RTX PRO 6000-acceleratorer i virksomhedsklassen, der opererer i en energioptimeret Max-Q- profil.

1. Komplette systemspecifikationer

Systemet er designet til dataflytning med høj båndbredde og forbinder CPU-værtskomplekset direkte til GPU-arrayet via PCIe 5.0-baner, understøttet af multikanal DDR5-hukommelse.

Komponent / Parameter Specification Tekniske noter
Maksimal AI-beregningskraft ~12,000 TOPPER (FP8 / INT8) Samlet ydeevne på tværs af 6x GPU-array med FP8-acceleration
GPU-undersystem 6x NVIDIA RTX PRO 6000 Max-Q (Blackwell-arkitektur) Optimeret effekt-til-termisk fodaftryk til kontinuerlig drift døgnet rundt
Frame Buffer (VRAM) 288 DK GDDR6 / ECC (6x 48 GB) Op til 960 GB/s hukommelsesbåndbredde pr. GPU
Værtsprocessor (CPU) AMD EPYC 9004-serien (Genoa) Op til 96 kerner / 192 tråde, sokkel SP5
Systemhukommelse (RAM) Op til 1.5 TB DDR5-4800/5200 ECC 12-kanals hukommelsesarkitektur
Bus Interface Native PCIe 5.0 x16 pr. GPU-slot Direkte CPU-til-GPU-forbindelse eliminerer switch-latens
Lagringsundersystem Op til 8x NVMe U.2 / U.3 SSD'er (PCIe 4.0/5.0) Hot-swap-drev, der leverer op til 14 GB/s sekventiel læsning
Netværk og ledelse Dobbelt 10GbE / 25GbE SFP28 + dedikeret IPMI 2.0 Valgfri 100G/200G InfiniBand- eller RoCE v2-højhastighedsforbindelser
Strømforsyning 2+2 redundante 80 PLUS Titanium strømforsyninger Energieffektivitet på over 96 % under tunge computerbelastninger

2. Ydelses- og syntetiske AI-benchmarks

Max-Q-strømkalibreringen holder GPU'ens driftstemperaturer strengt inden for 68°C-72°C under vedvarende fuld belastning, hvilket bevarer 90%-92% af den maksimale ubegrænsede GPU-ydelse, samtidig med at den termiske output reduceres.

2.1. Benchmarks for dybdegående læring og LLM-inferens (MLPerf-standard)

Opgave / Model Evalueringsmetrik K-AI 576 Performance (6x RTX PRO 6000 MQ) Relativ gevinst vs. 4x RTX 4090
Lama 3 70B Token-gennemstrømning (FP8) 185 tokens/sek. +45% (Forbedret VRAM og PCIe 5.0-gennemstrømning)
Mixtral 8x22B Token-gennemstrømning (FP8) 130 tokens/sek. + 60%
ResNet-50 v1.5 Billedklassificering (INT8) 310,000 billeder/sek. + 35%
Stabil Diffusion XL Billedgenerering (FP16) 210 billeder/min + 50%

2.2. Visuel databehandling og 3D-renderingsbenchmarks (VFX / AI-video)

Benchmark-suite Arbejdsbelastning / Testforhold K-AI 576 Resultat
V-Ray GPU CUDA/RTX Benchmark-score for multi-GPU-rendering 28,400 vpaths
OctaneRender OctaneBench 2020.1 benchmark 4,120 OB
Sora / HunyuanVideo (Inferens) 1080p, 5-sekunders AI-videogenerering ~14 sekunder

3. Systemarkitektur og termisk styring

+-----------------------------------------------------------------+
|                  AMD EPYC Genoa (Socket SP5)                    |
|             12-Channel DDR5 ECC System Memory                   |
+-----------------------------------------------------------------+
          | PCIe 5.0 x16            | PCIe 5.0 x16         | ...
          v                         v                      v
+-------------------+     +-------------------+  ...  +-------------------+
| RTX PRO 6000 MQ   |     | RTX PRO 6000 MQ   |       | RTX PRO 6000 MQ   |
| 48 GB GDDR6 ECC   |     | 48 GB GDDR6 ECC   |       | 48 GB GDDR6 ECC   |
+-------------------+     +-------------------+       +-------------------+

Vigtige arkitektoniske fordele

  • Termisk effektivitet på rackniveau:

    Ved at justere den individuelle GPU-strømforbrug fra standard 300W-350W ned til 175W-225W reduceres den samlede varmegenerering i kabinettet, hvilket forhindrer termisk begrænsning og sænker anlæggets samlede PUE.

  • Direkte PCIe Gen 5-forbindelse:

    Eliminering af mellemliggende PCIe-switche reducerer latenstid under vægtoverførsler på store modeller mellem værtens DDR5-systemhukommelse og GPU VRAM-arrayet.

  • Forudsigelig total omkostninger:

    Balanceret strømforbrug og reduceret varmeafgivelse gør Kentino K-AI 576 velegnet til både traditionelle serverracks med høj luftgennemstrømning og moderne, afgrænsede datacentre med varm/kold gang i virksomheder.

Tilbage til bloggen