PDU-typer til AI-serverracks: Basic, Metered, Switched, ATS
Strømfordelingsenheden er den kedeligste ting i racket, og den del, man først fortryder. En 4-GPU AI-server trækker 1.8-2.4 kW vedvarende; en 8-GPU-node er 3.5-4.5 kW. Ved disse tal er PDU'en ikke længere "den ting, serveren tilsluttes" - den er måleren, afbryderkortet, fjernnulstillingsknappen og på en dårlig dag den eneste ting, der fortæller dig, hvilken stikkontakt der smelter.
Denne artikel guider dig op ad PDU-stigen fra den dumme strømskinne op til den intelligente dual-source-enhed, med ærlig prissætning, hvad hvert niveau giver dig, og hvor omkostnings-vs-smerte-kurven bryder for AI-beregning. Brand-agnostisk.
Niveauerne, i én tabel
| dyr | Hvad gør den | Synlighed pr. udsalgssted | Remote control | EU-pris, 24-udtag 0U |
|---|---|---|---|---|
| Grundlæggende | Stikdåse i rackform | Ingen | Ingen | €80-150 |
| Målt (input) | Visning af samlet strøm/spænding | Ingen | Ingen | €350-500 |
| Stikkontaktmåler | Strøm/spænding/effekt pr. udgang | Ja | Ingen | €700-1200 |
| Switched | Aggregatmåler + fjernudtag til/fra | Ingen | Ja | €900-1400 |
| Afbryder + stikkontaktmåler | Det fulde billede | Ja | Ja | €1500-3000 |
| ATS-variant (dobbeltindgang) | Failover mellem to kilder | Pr. niveau ovenfor | Pr. niveau ovenfor | +400–800 € oveni |
Det rigtige svar for ethvert AI-rack med to eller flere computernoder er switched + outlet-metered. Det vil vi forsvare nedenfor.
Grundlæggende PDU — den dumme strimmel
En rackmonterbar strømskinne. Fase, neutral, jord, en række stikkontakter, nogle gange en afbryder pr. bank. Intet display, ingen netværksport, ingen logik. Enkelt indgang (C20-indgang eller et fast tilsluttet stik), seks til fireogtyve stikkontakter i en blanding af C13 og C19, en strøm-LED, hvis du er heldig.
Hvad du ikke får: ingen indsigt i, hvor meget strøm en enkelt stikkontakt – eller selve enheden – bruger. Ingen fjernbetjening til at tænde og slukke. Ingen overvågningsintegration. Hvis serveren hænger, og du er 200 km væk, ringer du til en person med en nøgle til racket.
Basic er fint til en laboratoriebænk under dit skrivebord eller én udviklingsnode på et lille kontor, hvor du kan se lysene og nå stikket. Det er det forkerte svar til enhver AI-produktionsserver, ethvert rack, du ikke kan nå på 30 minutter, og ethvert rack med mere end to computernoder. Forskellen fra basic (€100) til målt (€400) er lille i forhold til én GPU; køb som minimum målt.
Målt PDU — samlet synlighed, ingen detaljer pr. stikkontakt
En målt PDU tilføjer et lokalt display, der viser indgangsstrøm, spænding og normalt effekt (kW) og energi (kWh). På 3-fasede enheder viser den værdier pr. fase. Bedre enheder eksponerer de samme data via SNMP, Modbus TCP eller HTTP.
Hvad du stadig ikke får: strømstyrken pr. udgang. Du ser, at racket trækker 18 A. Du kan ikke se, om udgang 4 er 9 A og udgang 5 er 0.5 A, eller om begge er 4.75 A. For et heterogent AI-rack er det vigtigt. Du får heller ingen stikkontaktkontrol - udgangene er altid tændt, mens enheden har strøm.
Dette niveau er ærlig værdi for et single-tenant rack med en eller to GPU-servere og en switch, hvor belastningen er forudsigelig, og du kun behøver at vide "er vi tæt på at udløse afbryderen?". Spring det over og gå til stikkontaktmåling, hvis du har mere end to GPU-noder, eller en tilbagebetalingsforpligtelse, eller en belastningsprofil, der varierer kraftigt mellem træning og inferens på den samme stikkontakt.
Stikkontaktmålt PDU — måling pr. stikkontakt, AI-baseline
Strøm, spænding, effekt og energi pr. udgang. En lille CT eller shunt på hver udgang, pollet mange gange i sekundet. Samme SNMP/Modbus/HTTP-eksponering som målt, med OID'er pr. udgang.
For AI-beregning er dette det første niveau, der giver dig de data, du rent faktisk har brug for. Du kan se, hvilken GPU-server der bruger hvad – når teamet tilføjer en træningskørsel, og rack-inputtet kryber fra 24 A til 30 A, ved du med det samme, at det var 8× 5090-noden. Effektfaktoren pr. udgang afslører en aldrende eller underdimensioneret strømforsyning, før den fejler. kWh-akkumulatorer pr. udgang giver en ærlig tilbagebetaling. Alarmer pr. udgang (f.eks. 12 A på en C13, 80 % af klassificeringen) fanger krybningen, før den udløser den opstrøms afbryder.
Hvad du stadig ikke kan gøre: tænd/sluk en server, der har hængt, eksternt. Stikkontakten er målt, men altid strømførende.
Enheder med måler koster mellem 700 og 1200 euro – mellem målte enheder (400 euro) og afbrydermålte enheder (1500 euro+). Hvis du har besluttet, at du aldrig får brug for fjernbetjening af stikkontakter, er dette et forsvarligt valg. I praksis ønsker de fleste AI-racks begge dele.
Switched PDU — fjernbetjening af stikkontakt
En switched PDU tilføjer et relæ (mekanisk eller solid-state) bag hver stikkontakt. Du kan tænde, slukke eller cykle for en stikkontakt (slukke den i N sekunder, derefter tænde) via HTTP, SNMP-sæt eller leverandørapp. Aggregeret måling er den samme som en målt PDU; der er ingen måling pr. stikkontakt.
Den afgørende funktion er genstart uden truckroll. Antallet af gange et AI-træningsjob har kilt en server hårdt nok til, at IPMI heller ikke reagerer, er ikke nul. Den omskiftelige PDU er den sidste måde at tænde og slukke for boksen uden at sende et menneske. Sekundære anvendelser: programmerbar opstartssekvensering efter en UPS-hændelse (så alle servere ikke starter på samme tidspunkt) og planlagt tænd/sluk for laboratorieudstyr.
Hvad du ikke får uden den stikkontaktmålte opgradering: enhver måde at verificere, at stikkontakten rent faktisk er belastet, efter du har tændt den. PDU'en fortæller dig, at relæet er lukket; den fortæller dig ikke, at serveren bruger strøm. For en sikker fjerngenstart skal du virkelig have begge tilstande.
Switched + stikkontaktmåler — det perfekte valg til AI-drift
Måling pr. stikkontakt og fjernbetjening pr. stikkontakt i én enhed. Dette er det rigtige svar til ethvert produktions-AI-rack:
- Udtag pr. stikkontakt i din overvågningsstak sammen med GPU-strøm, stuetemperatur, PSU-skinner. Uregelmæssigheder dukker op på ét dashboard.
- Fjerngenstart i lukket kredsløb. Sluk relæet, se strømmen gå til nul, vent fem sekunder, tænd relæet, se strømmen vende tilbage til forventet tomgang.
- Tidlig termisk advarsel. Hvis udgang 4 begynder at trække 2.6 kW, når den normalt går i tomgang på 1.7 kW, udløses alarmen, før rumklimaanlægget giver op.
- Reel tilbageførsel med NTP-tidsstemplet kWh pr. udgang.
Pris: €1500-3000 for en 0U-vertikal med 24 udgange. Mindre end prisen på et enkelt RTX 5090. På et rack, der hoster GPU'er til over €30, er dette ikke den rigtige vare at spare på.
Hvis du ikke fysisk kan nå racket – colocation, fjernkontor, bygning med begrænset plads – så SKAL du skifte. Én undgået truckkrangel efter lukketid dækker forskellen.
ATS PDU — failover mellem to strømkilder
En ATS (Automatic Transfer Switch) PDU har to indgangskabler fra to forskellige kilder og forsyner en enkelt bank af udgange fra den indgang, der er i orden. Når primærspændingen hænger eller falder, skifter ATS'en til sekundærspændingen inden for 8-16 ms. Nedstrømsudstyr oplever kun en kortvarig forstyrrelse.
ATS PDU'er er til udstyr med enkelt ledning, der kræver redundans i kilder. Moderne servere med to strømforsyninger behøver ikke en ATS – du tilslutter hver strømforsyning til en separat PDU på en separat kilde, og serveren håndterer failover automatisk. ATS er det, du bruger, når racket har udstyr med enkelt ledning – de fleste netværksswitche, KVM'er, mindre lagringsenheder – og du ikke kan tolerere, at kilden går ned.
ATS køber dig ikke batteri-backup; hvis begge kilder svigter, svigter ATS'en også. Du skal stadig have en UPS opstrøms for mindst én kilde. Den beskytter heller ikke mod kortslutninger nedstrøms - en dårlig stikkontakt udløser alligevel afbryderen.
Det er det værd for et blandet rack med nogle servere med to strømforsyninger og nogle enheder med én strømforsyning. Overkill for et rack, hvor alt allerede har to strømforsyninger (brug blot to uafhængige strømforsyninger), eller for et laboratorium, hvor et kort strømafbrydelse er irriterende, men ikke katastrofalt.
3-faset PDU-distribution
Når en rack krydser omkring 5 kW vedvarende, er enfasede 16 A (3.7 kW) væk, og 32 A (7.4 kW) føles stram. Standardløsningen er en 3-faset PDU på et IEC 60309 32 A 3P+N+E stik (rød, 400 V linje-til-linje / 230 V linje-til-neutral).
P_max = √3 × V_LL × I × PF
= 1.732 × 400 V × 32 A × 1.0
≈ 22.2 kVA (about 22 kW at unity PF)
EU-koden reducerer den kontinuerlige belastning til 80 % af afbryderen, så den brugbare vedvarende effekt er tættere på 17-18 kW. Nok til fire 4-GPU-noder plus netværk, komfortabelt.
Internt er de tre faser (L1, L2, L3) opdelt på tværs af udgange på en af to måder. Fase-per-gruppe (udgange 1-8 på L1, 9-16 på L2, 17-24 på L3) er simpelt, men der er risiko for ubalance, hvis alt dit højbelastede udstyr lander på den samme gruppe. Fasestribet (udgange 1/4/7 på L1, 2/5/8 på L2, 3/6/9 på L3) placerer tilstødende udgange på forskellige faser, så sammenhængende servere naturligt fordeler sig på tværs af faser. De fleste moderne intelligente PDU'er striber som standard.
Et eksempel på en ledningsføring til en 3-faset 32 A PDU, der forsyner et 4-node AI-rack:
Input: IEC 60309 32A 3P+N+E (red, 400/230V)
L1 — 32A L2 — 32A L3 — 32A N PE
Internal: per-phase 32A hydraulic-magnetic breaker
per-outlet relay + CT (switched + outlet-metered)
phase-striped outlets
Outlets (24 total, 12× C19 + 12× C13, 0U vertical):
1 (L1, C19) Node A PSU-1 (8× 5090, ~4.0 kW)
2 (L2, C19) Node A PSU-2 (same node, split delivery)
3 (L3, C19) Node B PSU-1 (4× Pro 6000, ~2.2 kW)
4 (L1, C19) Node B PSU-2
5 (L2, C19) Node C PSU-1 (4× 5090, ~2.0 kW)
6 (L3, C19) Node C PSU-2
7 (L1, C19) Node D PSU-1 (4× 5090, ~2.0 kW)
8 (L2, C19) Node D PSU-2
9 (L3, C13) ToR switch (~80 W)
10 (L1, C13) Mgmt switch (~30 W)
11 (L2, C13) KVM-over-IP (~20 W)
12 (L3, C13) Head/jump host (~150 W)
13–24 Reserve / aux
Per-phase load (all nodes at ~80% sustained):
L1 ≈ 4.1 kW / 17.8 A
L2 ≈ 4.0 kW / 17.4 A
L3 ≈ 2.4 kW / 10.4 A
To ting er vigtige her. For det første udfører fasestribning det meste af balanceringen automatisk. For det andet lander noderne med dobbelt strømforsyning og split-levering bevidst deres to ledninger på forskellige faser. For enhver AI-server med dobbelt strømforsyning i split-leveringskonfiguration skal hver strømforsyning tilsluttes en anden fase - halv strøm pr. fase forbedres, hvilket forbedrer headroom. ("Split delivery" er vores produkttekstudtryk: to strømforsyninger, der hver bærer halvdelen af belastningen, ikke redundante 1+1. Se W04 for sondringen.)
L3-ubalancen i eksemplet (ca. 14 A delta) er på grænsen af, hvad forsyningsselskaberne accepterer uden problemer. P03 dækker fasebalancering på tværs af racks på bygningsniveau.
C13, C14, C19, C20 — stikkontakttyper
| Stik | Rating | Hvor du ser det |
|---|---|---|
| C13 | 10 A / 250 V | Servere ≤1.5 kW, switche, KVM'er |
| C14 | 10 A / 250 V | Indgang på enheden til et C13-stik |
| C19 | 16 A / 250 V | Højstrøms AI-noder, store strømforsyninger |
| C20 | 16 A / 250 V | Indgang på enheden til et C19-stik |
Lige nummererede ender er enhedsindgange, ulige nummererede ender er lednings-/PDU-stik.
Det relevante punkt: Alt over ca. 1.5 kW kontinuerligt kræver C19/C20, ikke C13/C14. En 4-GPU AI-node med en 2000-2400 W strømforsyning har overskredet C13-klassificeringen. At forsøge at forsyne den via C13 er at bede om et smeltet stik fire måneder inde i implementeringen, når kontaktmodstanden er sneget sig op fra varmecyklusser.
En korrekt specificeret AI rack PDU har masser af C19-udgange, ikke kun to eller tre. Et godt layout til en 0U vertikal 24-udgange er 12× C19 + 12× C13. Nogle leverandører leverer "kombinations"-udgange, der accepterer C14 eller C20 i den samme fysiske stikkontakt – fint, koster bare mere. Bestil matchende C19-til-C20-ledninger (0.9-1.2 m for 0U PDU'er monteret bag på racket). Køb tre eller fire ekstra – de forsvinder.
PDU-strømklassificering vs. kredsløbsklassificering
Utility / panel breaker: 32 A 3-phase (C-curve)
Continuous load (80% rule): 25.6 A per phase usable
PDU rating: 32 A per phase
Per-phase outlet sum target: ≤ 25 A
PDU'en kan sagtens føre 32 A pr. fase, hvis du tillader det. Den opstrøms afbryder vil til sidst udløse ved vedvarende 30 A - termomagnetiske afbrydere integrerer overbelastning over mange minutter. Planlæg til 80%, og du har margen for indkobling og korte pigge. PDU'ens egne afbrydere pr. fase er det andet lag.
SNMP, Modbus, HTTP — at få dataene ud
En omskiftelig + stikkontaktmålt PDU er værd, hvad din overvågning kan se af den.
-
SNMP v2c / v3 — det universelle svar. Enhver seriøs leverandør udgiver en MIB; Prometheus'
snmp_exporterskraber det. Brug v3 hvor det understøttes, v2c på et administrations-VLAN hvor det er nødvendigt. Poll normalt hvert 30. sekund, normalt hvert 10. sekund for hurtig anomalidetektering. - ModBus TCP — almindelig på industrielt orienterede mærker. Mindre standardiseret end SNMP (registerkort varierer), men pålidelig. Prometheus har Modbus-eksportører.
- HTTP / JSON REST — moderne intelligente PDU'er leveres med en REST API. Nemmere til brugerdefinerede integrationer; sjældnere end SNMP.
- Leverandør-cloud-apps — nyttig til et hurtigt overblik, ikke afhængig af til produktionsovervågning.
- Grafana-dashboards
- Alertmanager → Slack / PagerDuty
| metric | Threshold |
|---|---|
| Indgangsstrøm pr. fase | Advarsel 70% af afbryderen, side 85% |
| Aktiv effekt pr. udgang | Advarsel ved +30% afvigelse fra 1-times rullende gennemsnit |
| Samlet kWh | Ingen alarm, graf for tilbageførsel |
| Intern PDU-temperatur | Advarsel 50 °C, side 60 °C |
| Udgangsrelæets tilstand vs. kommanderet | Side ved uoverensstemmelse |
| SNMP-tilgængelighed | Side efter 3 minutters utilgængelighed |
Relætilstand vs. kommanderet er den undervurderede kontrol. Et tændt relæ kan fejle ved svejsning-lukket (mere almindeligt end svejsning-åbent). Du har kommanderet udgang 5 fra, der flyder stadig strøm, du har et fastlåst relæ og en server, du faktisk ikke kan nulstille. Du vil vide det.
Den ærlige holdning
For ethvert AI-serverrack med to eller flere computenoter skal der købes switched + output-metered. 3-faset, hvis den vedvarende belastning er over 5 kW, og bygningen har 3-faset service. ATS-variant kun, hvis du har ikke-redundant udstyr i et rack med to source feeds.
Årsagerne til at træde tilbage er snævre: en enkelt node på et laboratoriebord, hvor du kan nå stikket, er fint med det grundlæggende; en eller to noder i din egen bygning med et stramt budget kan stoppe med målt udstyr. Produktions-AI-beregning, som du ikke kan nå inden for 15 minutter: omkoblet + stikkontaktmålt, ingen undtagelser.
Fejlen er at købe basis- eller målte processorer for at spare €1000 på et rack, der indeholder GPU'er for €30+. Første gang du oplever et 4-timers udfald, fordi du ikke kan nulstille en hængende node eksternt, tjener PDU-opgraderingen sig selv hjem.
Hvad går i stykker
PDU-fejltilstande vi har set, i omtrentlig rækkefølge efter hyppighed:
- Svejset relæ på tændte enheder. Udgang kommanderet fra, strøm løber stadig. Alarm ved uoverensstemmelse mellem relætilstand og kommanderet, og udskift enheden — relæerne heler ikke.
- Drift af udløbsmåling. Billigere CT'er falder med 5-10% efter to eller tre år. Hvis tilbagebetalingen afhænger af dette, skal du kalibrere igen årligt eller købe enheder med den angivne levetidsnøjagtighed (gode enheder hævder at være ±1%).
- Controlleren hænger. Måling og styring låser sig; stikkontakterne fortsætter med at strømme, men SNMP slukkes. De fleste enheder har en watchdog, der genstarter controlleren uden at afbryde strømmen til stikkontakten – kontroller, at din gør det.
- Termisk fejl i enkeltudgang. Især C13 lider under krybning i kontaktmodstanden under vedvarende 8-10 A. Afhjælpning: brug C19 over 1.5 kW, IR-scan et tungt rack hvert kvartal.
- Faseubalancen sniger sig ind over tid. Racket er afbalanceret ved installationen; seks måneder senere har nogen tilføjet udstyr på én fase. Fasespecifikke alarmer fanger det, og kvartalsvise gennemgange fanger det også.
- Firmwareopdatering blokerer controlleren. Behandl firmwareopdateringer som enhver produktændring: vedligeholdelsesvindue, sekundær enhed først, rollback-plan klar.
Hvad skal jeg gøre næste
Hvis du specificerer et rack til AI-beregning:
- Beregn vedvarende belastning. Læg hver servers typiske belastningsforbrug sammen, ikke typeskiltet. Kentino AI 4-GPU-node, plan 2.0-2.4 kW; 8-GPU, 3.5-4.5 kW. Tilføj 10 % for netværk og BMC.
- Enfaset vs. 3-faset. Under 5 kW vedvarende er enfaset 32 A fint. Over det er 3-faset 32 A. Efter 17-18 kW er du i gang med 63 A 3-faset og en seriøs snak med elektrikeren.
- Vælg niveauet. Standardafbryder + stikkontaktmåler. Træd kun ned med en klar grund.
- Vælg stik. Tæl C19/C20-indgangene på de faktiske servere; køb en PDU med mindst lige så mange C19-udgange plus C13 til netværksudstyr plus reservedele.
- Planlæg overvågningen. SNMP v3 hvis understøttet; snmp_exporter ind i Prometheus; byg dashboardet, før du har brug for det.
- For feeds med to kilder: Bestem hvilket udstyr der er dobbelt-PSU (to separate PDU'er) vs. enkelt-PSU (ATS PDU forsynet fra begge). Bland ikke strategier på det samme udstyr.
- Bestil ekstra C19/C20-ledninger. Tre eller fire. Stol på os.
P03 dækker fasebalancering på tværs af flere racks. P04 dækker afbryderdimensionering og indkoblingsstrøm. P05 dimensionerer UPS'en upstream for PDU'en.
Dette er en del af Kentino Wiki, en referenceserie om AI-beregning, robotteknologi og de systemer, der forbinder dem. Kommentarer og rettelser er velkomne på info@kentino.com.