Ethernet til AI: 25/100/400 GbE-grundprincipper
Ethernet er standardstrukturen for enhver AI-klynge, der er bygget uden for en hyperscaler. Det er ikke altid den hurtigste løsning på papiret – N02 vil argumentere for InfiniBand, hvor den rent faktisk vinder – men det er den mulighed, der findes overalt, kører alle tilstødende værktøjer, koster mindst pr. gigabit og binder dig til ingenting.
For Kentino-niveau-klynger – inferensservere med én node, træningsplatforme med 2 til 8 noder, små forskningslaboratorier – er Ethernet stort set altid det rigtige svar. De interessante spørgsmål er: hvilket hastighedsniveau, hvilket NIC, kobber eller fiber, og hvad koster hvert trin op rent faktisk. Denne artikel besvarer disse spørgsmål ærligt med tal fra priserne i midten af 2026.
Hvis du implementerer en enkelt 4-GPU eller 8-GPU boks til inferens og intet andet, kan du skimme til omkostningstabellen nederst og stoppe. Resten af denne artikel er til planlæggere med flere noder.
Hvorfor Ethernet vinder som standard
Tre grunde, i rækkefølge efter hvor ofte de rent faktisk er afgørende for beslutningen:
- Økosystem. Hver server, switch, storageboks og orchestrator bruger Ethernet. Drivere leveres i kernen. Overvågningsværktøjer forudsætter det. Den første dag hos en nyansat er ikke "lad mig forklare InfiniBand".
- Pris pr. gigabit. En 100 GbE switchport koster cirka en fjerdedel af prisen for sammenlignelig HDR InfiniBand. DAC'er og transceivere er almindelige. NIC-leverandører leveres af flere leverandører - NVIDIA, Broadcom, Intel - hvilket holder priserne rimelige. InfiniBand leveres af én enkelt leverandør.
- Ingen stoflåsning. Ethernet er en transportmetode. Moderne switche håndterer TCP-, RoCE-, NVMe-oF- og management-trafik på samme ledning med fornuftig QoS. InfiniBand forbinder strukturen med NVIDIAs roadmap.
Handlen er, at Ethernet til AI kræver mere finjustering for at opnå den samme ledningshastighedsadfærd, som InfiniBand giver dig direkte fra starten. RoCEv2, PFC, ECN, DCQCN – alle konfigurerbare på Ethernet, alle prækonfigurerede på IB. N02 og N08 dækker den kamp.
Hastighedsniveauer og hvornår hver især giver mening
Den største enkeltstående fejl ved Kentino-tier-tilbud er overspecificering af linket. En 400 GbE-switch under en 8-GPU-inferensboks er spildte penge. Et 10 GbE-link mellem to træningsnoder er spildt GPU-tid. Kortet nedenfor er det, der betyder noget.
| dyr | Sweet spot | Omkostninger pr. port (medio 2026) | Noter |
|---|---|---|---|
| 1/10 GbE | Administration, IPMI/BMC, bootstrap, SSH | € 50- € 200 | Altid adskilt fra dataplanet |
| 25 GbE | Admin uplink, let lagring, datasætindtagelse under ~3 GB/s | € 300- € 600 | Billigste "rigtige" niveau; 2× SFP28 standard på de fleste servere |
| 100 GbE | Intra-cluster baseline for 2-8 node træning og RoCE-lagring | € 1200- € 2000 | Arbejdshesten – hvad 80% af Kentino multi-node specifikationer har brug for |
| 200 GbE | Grænsetræning, 70B+ klasse, tæt allreduce | € 2500- € 4000 | Underudnyttet mellemniveau; QSFP56 / QSFP-DD kompatibel |
| 400 GbE | Multi-rack træning, hyperscale-tilstødende, datasæt hot path | € 5500- € 9000 | Reelle omkostninger — kun når du kan bevise, at GPU'en kan absorbere dem |
| 800 GbE | Avanceret teknologi, B200/MI355 racks, primært hyperscaler i dag | € 11000 + | ConnectX-8 / Thor Ultra-territorium; sjældent uden for topklasse |
Tre ting at internalisere:
- 25 GbE er ikke til AI-strukturen. Det er til alt omkring det – administration, telemetri, forbindelsen til lagerserveren, når lageret ikke er på den samme RDMA-struktur. At kalde 25 GbE for "AI-niveauet" er et tegn på, at leverandøren ikke kender arbejdsbyrden.
- 100 GbE er den ærlige basislinje for multi-node. Nedenfor stopper gradientsynkroniseringen hver iteration. Over den er spørgsmålet, om dine GPU'er kan producere data hurtigt nok til at mætte ledningen. For 5090 / RTX Pro 6000 Blackwell single-node-systemer, der udfører finjusteringsarbejde, er 100 GbE normalt nok.
- 400 GbE betaler sig kun tilbage ved reel multi-rack-træning. To 8-GPU-noder, der udfører 70B finjusteringsarbejde, behøver det ikke. Seksten noder, der udfører prætræning på tokeniseret tekst, har brug for det.
800 GbE findes, siliciummet er under udsendelse (ConnectX-8, Thor Ultra), men det er i øjeblikket en hyperscaler og implementeringshistorie i B200-klassen. Nævnt for fuldstændighedens skyld; det er usandsynligt, at du vil specificere det på en Kentino-build i 2026.
NIC-familier, der rent faktisk sender
NIC-markedet i 2026 er domineret af NVIDIAs ConnectX-linje, mens Broadcom og Intel dækker resten. Marvell, AMD/Pensando og en håndfuld OEM-rebadged Broadcoms findes, men optræder sjældent på Kentino BOM'er.
| NIC | Max hastighed | PCIe | Noter / typisk rolle |
|---|---|---|---|
| Intel E810-CQDA2 | 2×100GbE | Gen 4 x16 | Billigste og mest troværdige 100 GbE; solid ice driver; RoCE v2 understøttes |
| Mellanox ConnectX-6 Dx | 2×100GbE | Gen 4 x16 | Arbejdshest til 100 GbE på Gen 4-værter; moden RoCE |
| Mellanox ConnectX-7 | 1–2 × 200/400 GbE eller NDR IB | Gen 5 x16 | Dual-mode IB/Ethernet; nuværende Kentino topspecifikation til seriøs multinode-forbindelse |
| Broadcom Thor 2 | 2 × 200/400 GbE | Gen 5 x16 | Virksomhedsklasse, RoCE v2, brugt i OEM rebrand SKU'er |
| NVIDIA BlueField-3 SuperNIC | 1–2 × 400 GbE | Gen 5 x32 | 16-kernet Arm DPU; RoCE, NVMe-oF, krypteringsoffload; dyr |
| NVIDIA ConnectX-8 | 1 × 800 / 2 × 400 GbE | Gen 6 x16 | Nyeste; parres med Spectrum-X 800; PCIe Gen 6 nødvendig for at forsyne den |
| Broadcom Thor Ultra | 1×800GbE | Gen 6 x16 | UEC-1.0-kompatibel; rent AI-netværkskort; skalerbart mål på 100+ XPU'er |
De ærlige valg til arbejde på Kentino-niveau:
- Intel E810-CQDA2 når kunden ønsker 100 GbE på et budget og accepterer, at RoCE-tuning er mere arbejde end på Mellanox. Omtrent €700-€900 på gaden.
- ConnectX-6 Dx for ethvert 100 GbE-link, der skal køre RoCE pålideligt. Tillæg på €1100–€1500. 90%-svaret.
- ConnectX-7 Når platformen er PCIe Gen 5 og 200 eller 400 GbE, er det berettiget af reel multi-node træning. OSFP NDR400-kortet med én port koster omkring €1650, og det skifter mellem IB og Ethernet i firmwaren – nyttigt, hvis du muligvis vil migrere fabrics senere.
- BlueField-3 og ConnectX-8 findes; hvis du specificerer dem, læser du ikke denne artikel.
PCIe er det stille loft. Et 100 GbE NIC i et Gen 3 x8-slot træner med linkhastighed og kører ved halv hastighed. Reglen:
| NIC-hastighed | Minimum PCIe | Komfortabel plads |
|---|---|---|
| 25 GbE | Gen 3 x4 | Gen 4 x4 eller Gen 3 x8 |
| 100 GbE | Gen 4 x8 eller Gen 3 x16 | Gen 4 x16 |
| 2×100 GbE | Gen 4 x16 | Gen 5 x8 eller Gen 4 x16 |
| 200 GbE | Gen 5 x8 eller Gen 4 x16 | Gen 5 x16 |
| 400 GbE | Gen 5 x16 | Kun Gen 5 x16 |
| 800 GbE | Gen 6 x16 eller 2× Gen 5 x16 | Kun Gen 6 x16 |
På Kentinos 8-GPU EPYC-platforme bruger GPU'erne de fleste Gen 4/5 x16-slots; netværkskortet ender i en Gen 4 x8 i nogle konfigurationer. Det er fint for én 100 GbE-port, marginalt for to. Bekræft før du citerer. W02 (PCIe-baner og topologi) er den dybe version af denne historie.
De metalliske og optiske muligheder — DAC, AOC, optik
Tre måder at gøre et link fysisk på, adskilt af en størrelsesorden i pris. Købere spilder rigtige penge på optik, hvor DAC ville have fungeret.
| Option | Rækkevidde (100 GbE) | Rækkevidde (400 GbE) | Pris pr. link (100 GbE) | Pris pr. link (400 GbE) | Strøm / latenstid |
|---|---|---|---|---|---|
| DAC (passiv kobber) | 1–3 m, ≤5 m med aktive varianter | ≤2 m praktisk, ≤3 m passiv | € 50- € 150 | € 200- € 400 | ~0 W, sub-ns/m |
| AOC (aktiv optisk) | Typisk 3-30 m, op til 100 m | 3–30 m, maks. 100 m | € 200- € 500 | € 600- € 1200 | 2–4 W pr. ende, ~5 ns/m |
| SR-optik + MMF | 70 m på OM3 / 100 m på OM4 / 150 m på OM5 | Typisk 30–100 m (SR4/SR8) | 400–800 € par + fiber | 1500–2500 € par + fiber | 3–4.5 W pr. ende |
| LR-optik + SMF | op til 10 km | op til 10 km | 800–1500 € par + fiber | 2500–4000 euro+ par + fiber | 3.5–5 W pr. ende |
Regler, der gælder på tværs af leverandører:
- DAC i et enkelt rack. Passiv kobber ved 100GBASE-CR4 er pålidelig op til 3 m, specificeret til 5 m med aktive varianter. Ved 400G (100G PAM4 pr. bane) er den praktiske grænse 2 m passiv — Der findes 3 m DAC'er, men signalintegriteten bliver skrøbelig med kabelbøjninger.
- AOC til 5-30 m løb, især på tværs af tilstødende stativer. Transceiveren er bundet til fiberen, så en dårlig ende betyder, at hele kablet skal kasseres.
- SR-optik + MMF Til ledningsføring i rum ud over 30 m eller hvor der allerede findes struktureret kabelføring. OM5 køber ~50 % mere rækkevidde i forhold til OM4 ved 100 GbE SR, og det er det, du bør bruge til nye installationer i dag.
- LR-optik + SMF til at krydse bygninger eller rum. Overkill inden for en enkelt 4-rack klynge.
Kabellængdeberegning for en klynge med 4 racks. En række med fire 42U-racks, hver ~600 mm bred med ~100 mm mellemrum mellem racks. Top-of-rack-switch øverst på rack 1 til et NIC i bunden af rack 4: ~2.1 m vandret + ~2 m lodret = ~4 m løb med slæk. Ved 100 GbE er du på kanten af DAC'en; ved 400 GbE er du forbi den. For enhver klynge, der er bredere end ~2 racks ved 400 GbE, skal du planlægge AOC eller optik. Dette er den mest almindelige specifikationsfejl på tilbud på multi-racks - forudsat at DAC'en vil række ud, fordi "rackene er lige ved siden af hinanden".
End-to-end 100 GbE link, 2 m intra-rack hop, medio 2026: ConnectX-6 Dx-par ~€2400 + to switchporte amortiseret ~€1500 + 2 m QSFP28 DAC ~€90 = ~€4000 pr. link . Det samme link ved 400 GbE (ConnectX-7-par, 400 GbE switchporte, 2 m QSFP-DD DAC) kører cirka €14 — 4 gange båndbredden til ~3.5 gange prisen. Økonomien er rimelig; spørgsmålet er, om arbejdsbyrden kræver det.
Skift landskab
Markedet for AI Ethernet-switche i 2026 kan opdeles i tre åbenlyse kategorier.
| Klasse | Eksempler | Latens pr. port | Noter |
|---|---|---|---|
| AI top-of-rack (gennemskæring, dyb buffer) | NVIDIA Spectrum-X SN5600 (64×800 GbE / 51.2 Tb/s), Arista 7060X4 (32×400 GbE, ~700 ns), Cisco Nexus 9300-serien | 400–700 ns | Tabsfri RoCE-skabeloner, PFC/ECN direkte fra æsken, AI-stoftestet |
| Modulær rygsøjle | Arista 7800R3 (op til 36×400 GbE pr. linjekort), Cisco Nexus 9500 | 1–3 µs afhængigt af linjekortet | For 16+ node-klynger; routet Clos-backbone |
| Generisk / hvidboks | Tomahawk-klasse med SONiC, Dell PowerSwitch, Mikrotik til low-end | varierer, 600 ns – 3 µs | Billigere, mere konfigurationsarbejde, RoCE-tuning er dit job |
To meningsfulde opfordringer:
- Til træningsklynger med 4 til 8 noder ved 100 eller 400 GbE er en enkelt Spectrum-X SN5600 eller Arista 7060X4 det rigtige svar. Én switch, ét fejldomæne, ingen Clos, leverandørleverede RoCE-skabeloner. SN5600 er 64×800 GbE i 2U med 51.2 Tb/s aggregat og AI-tunede dybe buffere; 7060X4 giver dig 32×400 GbE i 1U med ~700 ns cut-through latency til mærkbart færre penge, når du ikke har brug for 800 GbE.
- For 16+ noder, planlagt routing af L3 Clos med to torne, BGP unummereret mellem blade og torne, ECMP på tværs af torne. N08 dækker uplink-mekanikken; N04 dækker valget af topologi.
MTU- og jumbo-rammer
Standard Ethernet MTU er 1500 bytes. Ved 100 GbE er det ~8.3 millioner pakker pr. sekund pr. stream, hvor hver pakke betaler en kernepris pr. pakke. MTU 9000 reducerer pakkehastigheden med 6 gange, reducerer CPU-overhead tilsvarende og er i bund og grund obligatorisk for enhver AI-struktur.
Specifikt for RoCEv2 vælges IB-stil MTU'en fra den største størrelse, der passer inden i Ethernet MTU'en. 9000-byte Ethernet giver RoCE en 4096-byte MTU - den værdi, som alle NCCL- og RDMA-stak forventer. Hvis du bliver ved 1500, får du en 2048-byte RoCE MTU og et mærkbart ydeevnetab på alle kollektive enheder.
Tre ting at vide:
- Skal matche ende til ende. En enkelt 1500-MTU-enhed i stien fragmenterer lydløst og reducerer gennemløbshastigheden. Sæt den på hvert NIC, hver switchport, hvert routerhop på AI VLAN'et.
- Hold jumbo begrænset til AI VLAN'et. Dit virksomhedsnetværk vil ikke kunne køre MTU 9000 problemfrit. Administrationsplanet forbliver på 1500.
-
Bekræft med
ip linkogtracepath, ikke ved at stole på konfigurationen. Antallet af klynger, hvor nogen har sat 9000 på netkortene og glemt switchportene, er pinligt.
Tabsgivende vs. tabsfri Ethernet — en forhåndsvisning
Almindelig TCP/IP over Ethernet er tabsgivende : switche dropper pakker, når køerne er fyldte, TCP sender igen, og gennemløbet går tilbage. Fint til streaming af webtrafik, fatalt for RDMA — et enkelt pakketab i en RoCE allreduce dræber hele overførslen og tvinger NCCL til at få timeout.
Løsningen er tabsfri Ethernet , opnået med to mekanismer, der arbejder sammen:
- PFC (Prioritetsflowkontrol, 802.1Qbb) — pause pr. prioritet. Når switchens buffer for prioritet 3 (RDMA-prioriteten ifølge konventionen) er fyldt, sender den en pauseramme til upstream-porten. Kortvarig nødbremsning.
- ECN (Eksplicit Notifikation om Overbelastning) — switche markerer pakker i køer, der fyldes op, modtageren sender et CNP tilbage, afsenderen sænker farten. Langsigtet kontrol af overbelastning.
Sammen danner de DCQCN — Data Center Quantized Congestion Notification — som er standard RoCEv2-kontrolsløjfen på moderne Ethernet AI-strukturer. ECN udfører arbejdet det meste af tiden, mens PFC kun aktiveres, når ECN ikke kan reagere hurtigt nok.
Konklusionen fra denne artikel er: Hvis du kører RoCE, skal din switch understøtte PFC og ECN på RDMA-prioriteten, og dit NIC skal være konfigureret til at markere/respektere dem. At købe en switch fra en leverandør med dokumenterede RoCE-skabeloner (NVIDIA Spectrum, Arista, Cisco Nexus 9000) sparer dig en uges konfigurationsarbejde. N02 dækker sammenligningen med InfiniBand; N07 går i dybden med overbelastningskontrol.
Bufferdybde — lav vs. dyb
Den anden akse på AI-switche er bufferdybde. AllReduce er mange-til-en i hver iteration — hver node i ringen eller træet konvergerer på én node på samme tidspunkt. Det er incast , og det knuser switche med lav buffer.
- Lavt bufferede switche (ældre Tomahawk, generisk virksomhedsversion) har 4-32 MB buffer i alt. Billig, lav latenstid, fin til øst-vest-trafik på et virksomhedsnetværk. Drop pakker første gang incast-hits.
- Dybbufferede AI-switche (Jericho3-AI, Spectrum-X, nogle 7800R3-linjekort) har hundredvis af MB til adskillige GB buffer. Absorber den indkommende burst, hold pakkerne, mens DCQCN sænker antallet af afsendere.
For en klynge med 2 noder er bufferdybden irrelevant. For 8+ noder, der udfører tæt allreduce, er dybe buffere forskellen mellem en sund struktur og en, der dropper PFC-pauser og går i stå. Dette er en reel grund til at købe AI-klasse switche i stedet for generiske.
Ærlig mening – gælder dette for din konstruktion?
En Kentino K-AI-server med én node, der udfører inferens eller finjustering af én node, behøver ikke noget af dette . GPU'erne kommunikerer via PCIe og NVLink; Ethernet-linket er til prompts ind, tokens ud og datasætlæsninger. Et par 25 GbE SFP28-porte på værtens indbyggede NIC er tilstrækkeligt.
Du læser dette, fordi du planlægger to eller flere noder. Matricen:
- 1 node: 10 eller 25 GbE indbygget. Ingen opgradering.
- 2–4 noder, finjustering: 100 GbE via ConnectX-6 Dx, én switch, RoCE-konfigureret. ~€4 pr. link.
- 4–8 noder, 70B+ træning: 100 eller 200 GbE med ConnectX-7, hvis PCIe Gen 5 er tilgængelig. Spectrum-X SN5600 eller Arista 7060X4 single switch.
- 8–16 noder, tæt træning: 200 eller 400 GbE, routet L3 Clos med to spines, deep-buffer switches.
- 16+ noder: forbi Kentinos typiske sortiment. Brug NVIDIAs referencearkitektur (Spectrum-X, BlueField-3 eller ConnectX-8) og en konsulent.
Hvad skal jeg gøre næste
Før du underskriver netværksafsnittet i et tilbud, bedes du besvare følgende skriftligt:
- Hvor mange noder vil rent faktisk køre sammen? Ikke "senere", ikke "måske". Dette bestemmer niveauet.
- Hvad er den største træningsbelastning, du vil køre fra start til slut? Forudtræning af tokentekst-LLM kræver ikke meget båndbredde; diffusion af billede/video kræver meget båndbredde.
- Er RoCE på bordet? Hvis ja, så vælg Mellanox NIC'er og en leverandør med RoCE-skabeloner. Hvis nej, er Intel E810 fint og €500 billigere pr. vært.
- Hvad er den faktiske kabellængde fra server til switch? Mål med målebånd, ikke estimer. DAC-grænserne ved 100G/400G er stramme.
- Har I adskilt administration fra dataplan? Altid to strukturer — billig 1/10 GbE til SSH/IPMI/Prometheus, den dyre RDMA-struktur kun til NCCL. N08 har layoutet.
- Har værten PCIe-banerne? Et 400 GbE NIC i et Gen 4 x16-slot leverer ~200 GbE i praksis. Bekræft før du afgiver et tilbud.
Krydsreferencer i N-sporet for det næste detaljelag: N02 (InfiniBand vs. RoCE vs. almindeligt Ethernet — når alternativet til Ethernet rent faktisk vinder), N04 og N05 (switchede og switchløse topologier i multi-node-tilfældet), N06 (latenstidsdissektion — hvor mikrosekunderne rent faktisk går hen) og N08 (RDMA-opsætning i praksis og hvordan klyngen opretter forbindelse til resten af verden).
Ethernet til AI er et løst problem. De fejl, der gør sig gældende, handler næsten aldrig om kablet – de handler om at specificere det forkerte niveau til arbejdsbyrden, placere netværkskortet i det forkerte PCIe-slot eller behandle switchen som en handelsvare, når arbejdsbyrden faktisk har brug for dybe buffere og PFC. Får du de tre ting rigtigt, bliver netværket den kedelige del af byggeprocessen, hvilket er det, du ønsker.
Dette er en del af Kentino Wiki, en referenceserie om AI-beregning, robotteknologi og de systemer, der forbinder dem. Kommentarer og rettelser er velkomne på info@kentino.com.