Byg Wiki

Byg Wiki

En referenceserie om opbygning, netværk, drift og drift af AI-beregning – for købere og integratorer, der dimensionerer deres næste 4-GPU-boks, 8-GPU-server eller robotlaboratorium.

Hver artikel er skrevet ud fra ægte Kentino-projekter. Intet fyld. Med meninger, hvor ingeniørkunsten kræver det. Ærlig omkring grænser.

49artikler live 9emnespor 2nyt om ugen · tirs + tors

Grundlæggende AI-server W-serien

Hvis du specificerer en multi-GPU-boks, så læs disse først. Hukommelse, PCIe, strøm, temperatur, lagerplads og GPU-listen.

W01RAM og VRAM: Hvordan de relaterer sig i en AI-serverEn 4-GPU-boks med 192 GB VRAM og 32 GB RAM er i stykker. Det rigtige forhold afhænger af, hvad du rent faktisk kører.
W02PCIe-baner og topologi i en AI-server med flere GPU'er"PCIe x8 vs x16 spiller ingen rolle for inferens" er for det meste korrekt - og de folk, der gentager det, ved normalt ikke hvorfor.
W03GPU-risers: Hvornår du har brug for dem, og hvad der går i stykkerHvor signalintegriteten stille og roligt dør, links stille og roligt omskoles til Gen3, og bænke, der består, begynder at miste en GPU om dagen.
W04PSU-størrelse og dobbelt-PSU-konfigurationerMatematikken, formfaktor-virkeligheden og den ærlige framing for 4-GPU og 8-GPU strømforsyning.
W05Termiske egenskaber og luftstrøm i AI-server-builds med flere GPU'erFire GPU'er på 450 W hver er 1.8 kW varme i en boks. Luftstrøm fra front til bag, statisk tryk og hvorfor "den har blæsere" er ikke en køleplan.
W06Lagringslag i en AI-serverModel, datasæt, scratch, checkpoint – fire arbejdsbelastninger med fire adgangsmønstre. Én NVMe-niveau tjener ingen af ​​dem godt.
W07GPU-valg: 5090, 4090, RTX Pro 6000, L40, L4Ærlig direkte sammenligning med reelle præstationstal, afvejninger og et beslutningsflow, vi rent faktisk bruger i kundeopkald.

Tokenøkonomi T-serie

Pengeberegningen. Tokens pr. euro, on-prem vs. cloud-pris pr. million tokens, og hvornår hver model rent faktisk vinder.

T01Tokens pr. sekund pr. euroDen eneste GPU-værdimåling, der er vigtig for inferens. Reelle tokens/sek. pr. euro på tværs af 5090, 4090, RTX Pro 6000, L40, L4.
T02Pris pr. million tokens: On-prem vs. CloudOn-prem vs. cloud, udregnet i euro. Hvor fordelingen er, og hvorfor cloud-regningen vinder, indtil den pludselig ikke gør det.
T03Vedvarende vs. burst-inferensøkonomiStabil 24/7 inferens og ustabile batchjobs har modsatrettede økonomiske fordele. Når on-prem vinder, og når skyen redder dig.

Linux / OS / Software L-serie

Softwarestakken under GPU'erne. Driver-pinning, CUDA-opsætning, kernejustering, filsystemer og overvågning.

L01Ubuntu Pinning og NVIDIA Driver ManagementFastgør kernen, fastgør driveren, eller se en apt-opgradering tage dine GPU'er offline. Driverhåndtering, der overlever genstart.
L02CUDA, cuDNN og NVIDIA Container ToolkitDen fornuftige opsætningssti. CUDA vs. driver vs. toolkit-versionsstyring, og containerruten der stopper afhængighedshelvede.
L03Linux Kernel Tuning til AI-servereHvad er det egentlig, der sætter skub i AI-arbejdsbelastninger – hugepages, NUMA, IRQ-affinitet – og hvad er cargo-cult?
L04Valg af filsystem til AI-servereXFS, ZFS, ext4 — og hvorfor Btrfs ikke er på listen for AI-servere. Match filsystemet med adgangsmønsteret.
L05Overvågningsstak: Prometheus, Grafana, DCGM, LokiSe GPU-temperaturer, VRAM, ECC-fejl og jobfejl, før de koster dig en træningskørsel.

netværk N-serien

NVLink-virkelighed, klyngetopologier (blad-ryg, fedt-træ, guldsmed, switchless), latenstidsdissektion, routing og RDMA-opsætning i praksis.

N03NVLink og NVSwitch: Når det gælderDGX marketing praler af NVLink-båndbredde på terabyte pr. sekund. Til de fleste Kentino-arbejdsbelastninger behøver du ikke noget af det.
N04Skiftede topologier: Fedttræ, bladryg, guldsmed, tesseractHvert klyngediagram starter på samme måde. Det virkelige valg er hvilken topologi, hvor meget overabonnement, hvilken hastighed pr. port.
N05Switchless topologier: Mesh, Ring, Direct-ConnectEn 32-ports 400 GbE-switch lander på mellem 40 og 80 euro i midten af ​​2026. For 2 til 4 noder behøver du ikke en.
N06Latenstidsdissektion: Hvor hvert mikrosekund går henFolk måler netværk med båndbreddediagrammer. Så viser deres allreduce-benchmark et tal, der slet ikke er i nærheden af ​​linjehastighed.
N07Routing: ECMP, adaptiv routing, DCQCNHvad sker der over kabler, NIC'er, switche: hvordan pakker finder en sti, og hvad forhindrer stoffet i at kollapse under total reduktion.
N08RDMA-opsætning i praksis + Cluster Uplink DesignPraktisk: installer drivere, bevis stien, aktivér GPUDirect, valider NCCL, og tag derefter skridtet videre og design uplinket til hele klyngen.

klyngedannelse K-serien

Når én node ikke er nok. Beslutning om enkelt- vs. flere noder, distribueret træning, inferensklynger, delt lagring, planlægning og fejlhåndtering.

K01Single-Node Multi-GPU vs. Multi-Node: Hvornår skal man skalere udDen dyreste fejl er at opdele et GPU-budget på tværs af to noder, når én større node ville have gjort jobbet.
K02Distribueret træning i 2026: DDP, FSDP2, DeepSpeed, MegatronFire open source-stakke, fem parallelitetsakser, og hvilken en man rent faktisk skal vælge til hvilket job.
K03Inferensklynger: vLLM Tensor Parallel, Pipeline ParallelEn 70B-model passer ikke på én GPU med den nyttige KV-cache. En 405B passer ikke på én node. Hvordan du skærer modellen til, bestemmer, hvad den koster.
K04Klyngelagring: NFS, BeeGFS, Luster, objektlagreDelt lagring er den del af en distribueret klynge, som ingen tænker på, før GPU'erne udnytter den med 40 %.
K05Jobplanlægning: SLURM, Kubernetes, RaySLURM, Kubernetes, Ray – og vide, hvornår du ikke har brug for nogen af ​​dem. Match planlæggeren med teamets størrelse.
K06Fejlhåndtering i AI-klyngerHvad går der egentlig galt i en GPU-klynge, og hvordan man gendanner det — checkpointing, sundhedstjek og dræning af dårlige noder.

Integration I-serien

Det hele samlet – opsætning af inferensserver, laboratorienetværk og strømbudgetter, en referenceopbygning og flådeimplementering.

I01Edge AI-arkitektur: Robot ↔ On-Prem Inference ServerGuldstandardartiklen. En humanoid, du har købt, er kun halvdelen af ​​systemet; dette er den anden halvdel, og hvordan de to halvdele er forbundet.
I02Opsætning af en inferensserver: vLLM, llama.cpp, SGLangInstaller, server og benchmark. Hvilken motor til hvilken model og latenstidsmål.
I03Netværkstopologi til et robot- + AI-beregningslaboratoriumLedningsføring af et robot- + AI-laboratorium — robotlinks, inferens-server-uplinks, og hvor latens gemmer sig.
I04Strøm- og kølebudget for et robot- + AI-laboratoriumDimensionering af effekt og køling til et laboratorium med blandet robotteknologi og AI, inden du underskriver lejekontrakten.
I05Referencebyggeri: Et robot- + AI-laboratorium i ét rackEt komplet robot- + AI-laboratorium i ét rack — styklisten, layoutet og de afvejninger, vi rent faktisk ville sende.
I06Flådeimplementering: Flere robotter, delt beregningFlere robotter, delt beregning. Sådan dimensionerer og planlægger du inferens for en flåde, ikke en demo.

Power Delivery P-serien

Ren strømforsyning til racket. Faser, PDU'er, balancering, afbrydere, UPS og generatorer til AI-beregning.

P01Enfaset vs. trefaset strømNår en 4-GPU-boks vokser ud af et enkelt 16 A kredsløb, og hvilken trefaset køber dig rent faktisk i et AI-rack?
P02PDU-typer: Basis, målt, switchet, ATSHvad hver især gør, og hvad du rent faktisk har brug for til et GPU-rack.
P03Fasebalancering på tværs af AI-racksBelast tre faser jævnt, eller udløs en afbryder på det værst tænkelige tidspunkt. Sådan fungerer afbalancering på tværs af AI-racks.
P04Bryderdimensionering og indkoblingsstrømKontinuerlig belastning, indkoblingsstrøm og 80%-reglen. Størrelsesafbrydere til GPU-servere, der ikke udløses på grund af gener.
P05UPS-dimensionering til AI-beregningTopologi, batterikemi, driftstid og kVA-vs-kW-fælden, der underdimensionerer halvdelen af ​​AI-laboratoriernes UPS-køb.
P06Generator og omskifterNår batteriets driftstid ikke er nok. Generatorstørrelse og grundlæggende transfer-switch-principper til AI-laboratorier.

Robotics R-serien · blog

En moderne humanoid er seks eller syv ingeniørdiscipliner, der er skruet sammen. Anatomi, sensorer, placering af computere, SDK'er, netværk, indkøb og den banebrydende VLM-verdensmodelstak.

R01Anatomi af en moderne humanoidSeks eller syv ingeniørdiscipliner sat sammen. Hvad er der egentlig indeni en moderne menneskelignende krop?
R02Anatomi af en firbenet robotFirbenede dyr bytter rækkevidde for stabilitet og batterilevetid. Den mekaniske og computermæssige anatomi af arbejdshestens formfaktor.
R03RobotsensorstakkenKameraer, dybde, LiDAR, IMU, kraft-moment — hvad hver sensor køber, og hvad den koster i beregning.
R04On-device vs. off-device computing for robotterHvad kører på robotten vs. på serveren. Den afvejning mellem latenstid og kapacitet, som enhver implementering skal foretage.
R05Robot SDK'er, ROS 2 og simuleringROS 2, leverandørens SDK'er og simuleringsmiljøer – den software, du udvikler imod, før hardwaren ankommer.
R06Robotnetværk: Wi-Fi, Tethers, 5GWi-Fi, tethers, 5G – og hvorfor latenstid, ikke båndbredde, afgør, hvad du kan aflaste uden for robotten.
R07Køb af robot: Leveringstider, told, supportAt købe robothardware i EU er ikke som at købe en arbejdsstation. Sådan ser leveringstider, told og eftersalgssupport rent faktisk ud.
R08Hvorfor robotter har brug for dedikeret Edge ComputeLatensargumentet. Hvorfor det at placere din model bag en cloud-API ødelægger den use case, kunden rent faktisk ønsker.
R09Automatisk mærkning med VLM-drevne verdensmodellerDen banebrydende perceptionsstak — Qwen2.5-VL, Grounded-SAM 2, Florence-2, NVIDIA Cosmos — anvendt til robotteknologisk ground truth.

Casestudier C-serien · blog

Ægte Kentino-byggerier med ægte opmålte tal. Fotografier, styklister, benchmarks og ærlige obduktioner.

C01Casestudie: 4× RTX 4090 AI-arbejdsstationEPYC 7542, 512 GB DDR4 ECC, 4× RTX 4090. 651.6 TFLOPS målt. 179.3 tok/s vedvarende på vLLM. 73°C peak. Reelle tal fra en leveret build.

Nye artikler hver tirsdag og torsdag

Denne wiki er et voksende bibliotek — artikler om nye byggeprojekter, netværk, klyngedannelse, energi og robotteknologi udgives frem til 2026, hver især hentet fra et rigtigt Kentino-byggeprojekt. Hvis du ønsker et specifikt emne prioriteret, kan du skrive til info@kentino.com.