Vi byggede en 576 GB AI-server, der kører GLM 5.2 i din egen bygning

Kentinos lokale AI-server har seks NVIDIA RTX PRO 6000 Blackwell Max-Q-kort, to EPYC CPU'er og nok redundans til at overleve en strømafbrydelse – så frontlinjemodeller kører på din etage, ikke i en andens cloud.

Alle kender One Miners. Mød Kentino nu.

Hvis du har været i vores verden et stykke tid, kender du One Miners. Kentino er søsterselskabet, og Kentino bygger maskiner: AI-servere, arbejdsstationer, gaming-pc'er – mere eller mindre hvad end specifikationsarket i dit hoved ser ud.

Denne artikel handler om et af disse builds. Det er et system, vi har samlet for en kunde, så vi nævner ikke, hvem det skal bruges til. Det, vi kan gøre, er at åbne låget og vise dig præcis, hvad der skal ind i en on-premise AI-server, når du holder op med at gå på kompromis.

Pitchen: AI i Claude-klassen, der aldrig forlader bygningen

Hele pointen med denne maskine er simpel. Du får en assistent i samme klasse som Claude Opus eller GPT – og den kører i dine lokaler. Dit kontor, dit rackrum, dit hjem, hvis det er der, du arbejder. Hver prompt, hvert dokument, hver linje kode, du indsætter i den, forbliver på dit eget netværk.

Det er den aftale, der tilbydes: ingen regning pr. token, der skaleres med hvor nyttig tingen bliver, ingen kø bag andre lejere, og ingen tredjepart, der holder dit kontekstvindue. Du ejer hardwaren, så du ejer arbejdsbyrden.

Indvendigt: seks professionelle GPU'er, 96 GB hver

Åbn kabinettet, og det første du ser er GPU-væggen – tre kort på den ene side, tre mere på den anden. Hvert kort er et NVIDIA RTX PRO 6000 Blackwell Max-Q med 96 GB VRAM. Seks kort, cirka 576 GB videohukommelse i en enkelt kasse.

Denne konfiguration er seks, men kabinettet er ikke fuldt. Det tager op til otte kort, hvilket giver plads til at tilføje GPU'er senere eller bruge slotsene på noget helt andet, som f.eks. fibernetværk. Bag GPU-pladen sidder to AMD EPYC 7643-processorer, der forsyner dem.

De uglamourøse dele er dem, der betyder noget

En maskine som denne lever eller dør på de kedelige specifikationer. Hukommelse: 512 GB DDR4 installeret som 8x 64 GB LRDIMM'er, der kan udvides til 1.5 TB, når arbejdsbyrden kræver det. Lagerplads: et 2 TB systemdrev plus 4 TB NVMe, fordi modelvægte skal af disken hurtigt.

Strømmen kommer fra fem redundante 2000 W strømforsyninger. Træk én ud midt i kørsel, og serveren fortsætter med at køre – den vil give udtryk for sin utilfredshed, men den fortsætter med at køre. Kølingen sker med tolv højtryksblæsere på 15,000 o/min, der kan udskiftes direkte, og som er arrangeret i rækker på tværs af kabinettet. Du kan hive en død blæser ud, mens maskinen er under belastning, sætte en ny i, lukke den og gå væk. Den skriger ad dig i et par sekunder. Det er hele vedligeholdelsesproceduren.

Bundkortet har dedikeret fjernstyring, dobbelt 10 Gigabit LAN, indbygget VGA til en terminal, USB 3.2 og både en primær og en sekundær tænd/sluk-knap, så du ikke behøver at pakke noget ud for at tænde og slukke den.

Kørsel af GLM 5.2 lokalt

Den primære arbejdsbyrde er GLM 5.2 i 4. kvartal — omkring 341 GB modelvægte, fordelt på de seks GPU'er. Det er en virkelig stor model, og den er placeret i din bygning. Andre åbne modeller kører også her; der er mere end nok VRAM til at holde flere indlæst eller til at skifte mellem dem.

En koldstart er ikke øjeblikkelig, og det vil vi hellere fortælle dig end at du opdager det. Med BIOS, der opregner så meget hardware, Linux, der åbner et meget stort enhedstræ, og derefter streamer 341 GB fra SSD til VRAM, venter du i størrelsesordenen minutter på den første token. Når den er varm, er der ikke et enkelt gennemløbstal, og alle, der citerer dig et, springer spørgsmålet over. Det afhænger af tre ting: hvor mange anmodninger der er i gang, om spekulativ dekodning er aktiveret, og om modellen passer på ét kort.

For GLM 5.2 sharded på tværs af alle seks GPU'er: ren single-concurrency-dekodning uden spekulativ dekodning er cirka 25-40 tokens/sek - det er aritmetikken, og det er tallet på vores offentlige produktside. Slå spekulativ dekodning til, stadig én anmodning ad gangen, og du er på 40-60. Det er regimet i videoen, hvilket er grunden til, at kørslen på kameraet lander på omkring 42 tokens/sek. Tilføj concurrency oveni spekulativ dekodning, og den samme boks gør 60-120.

Det er alle store modelnumre, med 341 GB fordelt på seks kort. Gå til en model, der passer ind i en enkelt 96 GB GPU, og du er oppe i tusindvis af tokens per sekund samlet set, fordi du kører seks uafhængige instanser i stedet for én sharded. Samme hardware, en størrelsesorden fra hinanden - hvilket er hele grunden til, at et enkelt overskriftstal er meningsløst.

Ud over chat og kodning er den samme silicium-enhed en seriøs billedgenereringsboks, og den kan også udføre videoarbejde. Den praktiske forskel fra et cloud-endpoint er ikke kun hastigheden - det er, at der ikke er nogen foran dig i køen.

Hvorfor Max-Q, og hvad den handel rent faktisk koster

En detalje, der er værd at være ærlig om: disse er Max-Q-varianterne af RTX PRO 6000. Max-Q kører med en bundkorteffekt på 300 W. Kortet uden Max-Q er en 600 W del, som du kan begrænse til omkring 400 W i driveren.

Max-Q bytter lidt on-chip cache for det meget lavere strømforbrug. I et kabinet med seks kort er denne byttehandel grunden til, at det termiske og strømforbrugende budget overhovedet fungerer. Det er den slags beslutning, man træffer én gang, under byggefasen, og derefter lever med tilfredshed – så længe man vidste, at man traf den.

Kommer næste gang – og hvordan du får en

Der var et par andre ting på bænken under denne optagelse, som ikke hører til denne server. En RTX 4090 og et NVIDIA CMP 170HX - et miningkort fra Ethereum-æraen, der er udbudt til €1,600 på vores hjemmeside. Det kort får en ordentlig anmeldelse og ordentlig testning i den næste video, så vi vil ikke halvforklare det her.

Vi sammensætter også en rigtig benchmark-tabel på tværs af flere åbne modeller. Tal, metodologi, ingen håndviften. Det er også den næste.

Hvis du ønsker en maskine som denne – eller en mindre version af den, eller en arbejdsstation eller et gaming-system – så er det, hvad Kentino gør. Gennemse AI-serverkollektionen , eller fortæl os, hvad du har brug for, så specificerer vi det.

Вернуться к блогу