Ethernet til AI: 25/100/400 GbE-grundprincipper

Ethernet er standardstrukturen for enhver AI-klynge, der er bygget uden for en hyperscaler. Det er ikke altid den hurtigste løsning på papiret – N02 vil argumentere for InfiniBand, hvor den rent faktisk vinder – men det er den mulighed, der findes overalt, kører alle tilstødende værktøjer, koster mindst pr. gigabit og binder dig til ingenting.

For Kentino-niveau-klynger – inferensservere med én node, træningsplatforme med 2 til 8 noder, små forskningslaboratorier – er Ethernet stort set altid det rigtige svar. De interessante spørgsmål er: hvilket hastighedsniveau, hvilket NIC, kobber eller fiber, og hvad koster hvert trin op rent faktisk. Denne artikel besvarer disse spørgsmål ærligt med tal fra priserne i midten af ​​2026.

Hvis du implementerer en enkelt 4-GPU eller 8-GPU boks til inferens og intet andet, kan du skimme til omkostningstabellen nederst og stoppe. Resten af ​​denne artikel er til planlæggere med flere noder.

Hvorfor Ethernet vinder som standard

Tre grunde, i rækkefølge efter hvor ofte de rent faktisk er afgørende for beslutningen:

  1. Økosystem. Hver server, switch, storageboks og orchestrator bruger Ethernet. Drivere leveres i kernen. Overvågningsværktøjer forudsætter det. Den første dag hos en nyansat er ikke "lad mig forklare InfiniBand".
  2. Pris pr. gigabit. En 100 GbE switchport koster cirka en fjerdedel af prisen for sammenlignelig HDR InfiniBand. DAC'er og transceivere er almindelige. NIC-leverandører leveres af flere leverandører - NVIDIA, Broadcom, Intel - hvilket holder priserne rimelige. InfiniBand leveres af én enkelt leverandør.
  3. Ingen stoflåsning. Ethernet er en transportmetode. Moderne switche håndterer TCP-, RoCE-, NVMe-oF- og management-trafik på samme ledning med fornuftig QoS. InfiniBand forbinder strukturen med NVIDIAs roadmap.

Handlen er, at Ethernet til AI kræver mere finjustering for at opnå den samme ledningshastighedsadfærd, som InfiniBand giver dig direkte fra starten. RoCEv2, PFC, ECN, DCQCN – alle konfigurerbare på Ethernet, alle prækonfigurerede på IB. N02 og N08 dækker den kamp.

Hastighedsniveauer og hvornår hver især giver mening

Den største enkeltstående fejl ved Kentino-tier-tilbud er overspecificering af linket. En 400 GbE-switch under en 8-GPU-inferensboks er spildte penge. Et 10 GbE-link mellem to træningsnoder er spildt GPU-tid. Kortet nedenfor er det, der betyder noget.

dyr Sweet spot Omkostninger pr. port (medio 2026) Noter
1/10 GbE Administration, IPMI/BMC, bootstrap, SSH € 50- € 200 Altid adskilt fra dataplanet
25 GbE Admin uplink, let lagring, datasætindtagelse under ~3 GB/s € 300- € 600 Billigste "rigtige" niveau; 2× SFP28 standard på de fleste servere
100 GbE Intra-cluster baseline for 2-8 node træning og RoCE-lagring € 1200- € 2000 Arbejdshesten – hvad 80% af Kentino multi-node specifikationer har brug for
200 GbE Grænsetræning, 70B+ klasse, tæt allreduce € 2500- € 4000 Underudnyttet mellemniveau; QSFP56 / QSFP-DD kompatibel
400 GbE Multi-rack træning, hyperscale-tilstødende, datasæt hot path € 5500- € 9000 Reelle omkostninger — kun når du kan bevise, at GPU'en kan absorbere dem
800 GbE Avanceret teknologi, B200/MI355 racks, primært hyperscaler i dag € 11000 + ConnectX-8 / Thor Ultra-territorium; sjældent uden for topklasse

Tre ting at internalisere:

  • 25 GbE er ikke til AI-strukturen. Det er til alt omkring det – administration, telemetri, forbindelsen til lagerserveren, når lageret ikke er på den samme RDMA-struktur. At kalde 25 GbE for "AI-niveauet" er et tegn på, at leverandøren ikke kender arbejdsbyrden.
  • 100 GbE er den ærlige basislinje for multi-node. Nedenfor stopper gradientsynkroniseringen hver iteration. Over den er spørgsmålet, om dine GPU'er kan producere data hurtigt nok til at mætte ledningen. For 5090 / RTX Pro 6000 Blackwell single-node-systemer, der udfører finjusteringsarbejde, er 100 GbE normalt nok.
  • 400 GbE betaler sig kun tilbage ved reel multi-rack-træning. To 8-GPU-noder, der udfører 70B finjusteringsarbejde, behøver det ikke. Seksten noder, der udfører prætræning på tokeniseret tekst, har brug for det.

800 GbE findes, siliciummet er under udsendelse (ConnectX-8, Thor Ultra), men det er i øjeblikket en hyperscaler og implementeringshistorie i B200-klassen. Nævnt for fuldstændighedens skyld; det er usandsynligt, at du vil specificere det på en Kentino-build i 2026.

NIC-familier, der rent faktisk sender

NIC-markedet i 2026 er domineret af NVIDIAs ConnectX-linje, mens Broadcom og Intel dækker resten. Marvell, AMD/Pensando og en håndfuld OEM-rebadged Broadcoms findes, men optræder sjældent på Kentino BOM'er.

NIC Max hastighed PCIe Noter / typisk rolle
Intel E810-CQDA2 2×100GbE Gen 4 x16 Billigste og mest troværdige 100 GbE; solid ice driver; RoCE v2 understøttes
Mellanox ConnectX-6 Dx 2×100GbE Gen 4 x16 Arbejdshest til 100 GbE på Gen 4-værter; moden RoCE
Mellanox ConnectX-7 1–2 × 200/400 GbE eller NDR IB Gen 5 x16 Dual-mode IB/Ethernet; nuværende Kentino topspecifikation til seriøs multinode-forbindelse
Broadcom Thor 2 2 × 200/400 GbE Gen 5 x16 Virksomhedsklasse, RoCE v2, brugt i OEM rebrand SKU'er
NVIDIA BlueField-3 SuperNIC 1–2 × 400 GbE Gen 5 x32 16-kernet Arm DPU; RoCE, NVMe-oF, krypteringsoffload; dyr
NVIDIA ConnectX-8 1 × 800 / 2 × 400 GbE Gen 6 x16 Nyeste; parres med Spectrum-X 800; PCIe Gen 6 nødvendig for at forsyne den
Broadcom Thor Ultra 1×800GbE Gen 6 x16 UEC-1.0-kompatibel; rent AI-netværkskort; skalerbart mål på 100+ XPU'er

De ærlige valg til arbejde på Kentino-niveau:

  • Intel E810-CQDA2 når kunden ønsker 100 GbE på et budget og accepterer, at RoCE-tuning er mere arbejde end på Mellanox. Omtrent €700-€900 på gaden.
  • ConnectX-6 Dx for ethvert 100 GbE-link, der skal køre RoCE pålideligt. Tillæg på €1100–€1500. 90%-svaret.
  • ConnectX-7 Når platformen er PCIe Gen 5 og 200 eller 400 GbE, er det berettiget af reel multi-node træning. OSFP NDR400-kortet med én port koster omkring €1650, og det skifter mellem IB og Ethernet i firmwaren – nyttigt, hvis du muligvis vil migrere fabrics senere.
  • BlueField-3 og ConnectX-8 findes; hvis du specificerer dem, læser du ikke denne artikel.

PCIe er det stille loft. Et 100 GbE NIC i et Gen 3 x8-slot træner med linkhastighed og kører ved halv hastighed. Reglen:

NIC-hastighed Minimum PCIe Komfortabel plads
25 GbE Gen 3 x4 Gen 4 x4 eller Gen 3 x8
100 GbE Gen 4 x8 eller Gen 3 x16 Gen 4 x16
2×100 GbE Gen 4 x16 Gen 5 x8 eller Gen 4 x16
200 GbE Gen 5 x8 eller Gen 4 x16 Gen 5 x16
400 GbE Gen 5 x16 Kun Gen 5 x16
800 GbE Gen 6 x16 eller 2× Gen 5 x16 Kun Gen 6 x16

På Kentinos 8-GPU EPYC-platforme bruger GPU'erne de fleste Gen 4/5 x16-slots; netværkskortet ender i en Gen 4 x8 i nogle konfigurationer. Det er fint for én 100 GbE-port, marginalt for to. Bekræft før du citerer. W02 (PCIe-baner og topologi) er den dybe version af denne historie.

De metalliske og optiske muligheder — DAC, AOC, optik

Tre måder at gøre et link fysisk på, adskilt af en størrelsesorden i pris. Købere spilder rigtige penge på optik, hvor DAC ville have fungeret.

Option Rækkevidde (100 GbE) Rækkevidde (400 GbE) Pris pr. link (100 GbE) Pris pr. link (400 GbE) Strøm / latenstid
DAC (passiv kobber) 1–3 m, ≤5 m med aktive varianter ≤2 m praktisk, ≤3 m passiv € 50- € 150 € 200- € 400 ~0 W, sub-ns/m
AOC (aktiv optisk) Typisk 3-30 m, op til 100 m 3–30 m, maks. 100 m € 200- € 500 € 600- € 1200 2–4 W pr. ende, ~5 ns/m
SR-optik + MMF 70 m på OM3 / 100 m på OM4 / 150 m på OM5 Typisk 30–100 m (SR4/SR8) 400–800 € par + fiber 1500–2500 € par + fiber 3–4.5 W pr. ende
LR-optik + SMF op til 10 km op til 10 km 800–1500 € par + fiber 2500–4000 euro+ par + fiber 3.5–5 W pr. ende

Regler, der gælder på tværs af leverandører:

  • DAC i et enkelt rack. Passiv kobber ved 100GBASE-CR4 er pålidelig op til 3 m, specificeret til 5 m med aktive varianter. Ved 400G (100G PAM4 pr. bane) er den praktiske grænse 2 m passiv — Der findes 3 m DAC'er, men signalintegriteten bliver skrøbelig med kabelbøjninger.
  • AOC til 5-30 m løb, især på tværs af tilstødende stativer. Transceiveren er bundet til fiberen, så en dårlig ende betyder, at hele kablet skal kasseres.
  • SR-optik + MMF Til ledningsføring i rum ud over 30 m eller hvor der allerede findes struktureret kabelføring. OM5 køber ~50 % mere rækkevidde i forhold til OM4 ved 100 GbE SR, og det er det, du bør bruge til nye installationer i dag.
  • LR-optik + SMF til at krydse bygninger eller rum. Overkill inden for en enkelt 4-rack klynge.

Kabellængdeberegning for en klynge med 4 racks. En række med fire 42U-racks, hver ~600 mm bred med ~100 mm mellemrum mellem racks. Top-of-rack-switch øverst på rack 1 til et NIC i bunden af ​​rack 4: ~2.1 m vandret + ~2 m lodret = ~4 m løb med slæk. Ved 100 GbE er du på kanten af ​​DAC'en; ved 400 GbE er du forbi den. For enhver klynge, der er bredere end ~2 racks ved 400 GbE, skal du planlægge AOC eller optik. Dette er den mest almindelige specifikationsfejl på tilbud på multi-racks - forudsat at DAC'en vil række ud, fordi "rackene er lige ved siden af ​​hinanden".

End-to-end 100 GbE link, 2 m intra-rack hop, medio 2026: ConnectX-6 Dx-par ~€2400 + to switchporte amortiseret ~€1500 + 2 m QSFP28 DAC ~€90 = ~€4000 pr. link . Det samme link ved 400 GbE (ConnectX-7-par, 400 GbE switchporte, 2 m QSFP-DD DAC) kører cirka €14 — 4 gange båndbredden til ~3.5 gange prisen. Økonomien er rimelig; spørgsmålet er, om arbejdsbyrden kræver det.

Skift landskab

Markedet for AI Ethernet-switche i 2026 kan opdeles i tre åbenlyse kategorier.

Klasse Eksempler Latens pr. port Noter
AI top-of-rack (gennemskæring, dyb buffer) NVIDIA Spectrum-X SN5600 (64×800 GbE / 51.2 Tb/s), Arista 7060X4 (32×400 GbE, ~700 ns), Cisco Nexus 9300-serien 400–700 ns Tabsfri RoCE-skabeloner, PFC/ECN direkte fra æsken, AI-stoftestet
Modulær rygsøjle Arista 7800R3 (op til 36×400 GbE pr. linjekort), Cisco Nexus 9500 1–3 µs afhængigt af linjekortet For 16+ node-klynger; routet Clos-backbone
Generisk / hvidboks Tomahawk-klasse med SONiC, Dell PowerSwitch, Mikrotik til low-end varierer, 600 ns – 3 µs Billigere, mere konfigurationsarbejde, RoCE-tuning er dit job

To meningsfulde opfordringer:

  • Til træningsklynger med 4 til 8 noder ved 100 eller 400 GbE er en enkelt Spectrum-X SN5600 eller Arista 7060X4 det rigtige svar. Én switch, ét fejldomæne, ingen Clos, leverandørleverede RoCE-skabeloner. SN5600 er 64×800 GbE i 2U med 51.2 Tb/s aggregat og AI-tunede dybe buffere; 7060X4 giver dig 32×400 GbE i 1U med ~700 ns cut-through latency til mærkbart færre penge, når du ikke har brug for 800 GbE.
  • For 16+ noder, planlagt routing af L3 Clos med to torne, BGP unummereret mellem blade og torne, ECMP på tværs af torne. N08 dækker uplink-mekanikken; N04 dækker valget af topologi.

MTU- og jumbo-rammer

Standard Ethernet MTU er 1500 bytes. Ved 100 GbE er det ~8.3 millioner pakker pr. sekund pr. stream, hvor hver pakke betaler en kernepris pr. pakke. MTU 9000 reducerer pakkehastigheden med 6 gange, reducerer CPU-overhead tilsvarende og er i bund og grund obligatorisk for enhver AI-struktur.

Specifikt for RoCEv2 vælges IB-stil MTU'en fra den største størrelse, der passer inden i Ethernet MTU'en. 9000-byte Ethernet giver RoCE en 4096-byte MTU - den værdi, som alle NCCL- og RDMA-stak forventer. Hvis du bliver ved 1500, får du en 2048-byte RoCE MTU og et mærkbart ydeevnetab på alle kollektive enheder.

Tre ting at vide:

  • Skal matche ende til ende. En enkelt 1500-MTU-enhed i stien fragmenterer lydløst og reducerer gennemløbshastigheden. Sæt den på hvert NIC, hver switchport, hvert routerhop på AI VLAN'et.
  • Hold jumbo begrænset til AI VLAN'et. Dit virksomhedsnetværk vil ikke kunne køre MTU 9000 problemfrit. Administrationsplanet forbliver på 1500.
  • Bekræft med ip link og tracepath, ikke ved at stole på konfigurationen. Antallet af klynger, hvor nogen har sat 9000 på netkortene og glemt switchportene, er pinligt.

Tabsgivende vs. tabsfri Ethernet — en forhåndsvisning

Almindelig TCP/IP over Ethernet er tabsgivende : switche dropper pakker, når køerne er fyldte, TCP sender igen, og gennemløbet går tilbage. Fint til streaming af webtrafik, fatalt for RDMA — et enkelt pakketab i en RoCE allreduce dræber hele overførslen og tvinger NCCL til at få timeout.

Løsningen er tabsfri Ethernet , opnået med to mekanismer, der arbejder sammen:

  • PFC (Prioritetsflowkontrol, 802.1Qbb) — pause pr. prioritet. Når switchens buffer for prioritet 3 (RDMA-prioriteten ifølge konventionen) er fyldt, sender den en pauseramme til upstream-porten. Kortvarig nødbremsning.
  • ECN (Eksplicit Notifikation om Overbelastning) — switche markerer pakker i køer, der fyldes op, modtageren sender et CNP tilbage, afsenderen sænker farten. Langsigtet kontrol af overbelastning.

Sammen danner de DCQCN — Data Center Quantized Congestion Notification — som er standard RoCEv2-kontrolsløjfen på moderne Ethernet AI-strukturer. ECN udfører arbejdet det meste af tiden, mens PFC kun aktiveres, når ECN ikke kan reagere hurtigt nok.

Konklusionen fra denne artikel er: Hvis du kører RoCE, skal din switch understøtte PFC og ECN på RDMA-prioriteten, og dit NIC skal være konfigureret til at markere/respektere dem. At købe en switch fra en leverandør med dokumenterede RoCE-skabeloner (NVIDIA Spectrum, Arista, Cisco Nexus 9000) sparer dig en uges konfigurationsarbejde. N02 dækker sammenligningen med InfiniBand; N07 går i dybden med overbelastningskontrol.

Bufferdybde — lav vs. dyb

Den anden akse på AI-switche er bufferdybde. AllReduce er mange-til-en i hver iteration — hver node i ringen eller træet konvergerer på én node på samme tidspunkt. Det er incast , og det knuser switche med lav buffer.

  • Lavt bufferede switche (ældre Tomahawk, generisk virksomhedsversion) har 4-32 MB buffer i alt. Billig, lav latenstid, fin til øst-vest-trafik på et virksomhedsnetværk. Drop pakker første gang incast-hits.
  • Dybbufferede AI-switche (Jericho3-AI, Spectrum-X, nogle 7800R3-linjekort) har hundredvis af MB til adskillige GB buffer. Absorber den indkommende burst, hold pakkerne, mens DCQCN sænker antallet af afsendere.

For en klynge med 2 noder er bufferdybden irrelevant. For 8+ noder, der udfører tæt allreduce, er dybe buffere forskellen mellem en sund struktur og en, der dropper PFC-pauser og går i stå. Dette er en reel grund til at købe AI-klasse switche i stedet for generiske.

Ærlig mening – gælder dette for din konstruktion?

En Kentino K-AI-server med én node, der udfører inferens eller finjustering af én node, behøver ikke noget af dette . GPU'erne kommunikerer via PCIe og NVLink; Ethernet-linket er til prompts ind, tokens ud og datasætlæsninger. Et par 25 GbE SFP28-porte på værtens indbyggede NIC er tilstrækkeligt.

Du læser dette, fordi du planlægger to eller flere noder. Matricen:

  • 1 node: 10 eller 25 GbE indbygget. Ingen opgradering.
  • 2–4 noder, finjustering: 100 GbE via ConnectX-6 Dx, én switch, RoCE-konfigureret. ~€4 pr. link.
  • 4–8 noder, 70B+ træning: 100 eller 200 GbE med ConnectX-7, hvis PCIe Gen 5 er tilgængelig. Spectrum-X SN5600 eller Arista 7060X4 single switch.
  • 8–16 noder, tæt træning: 200 eller 400 GbE, routet L3 Clos med to spines, deep-buffer switches.
  • 16+ noder: forbi Kentinos typiske sortiment. Brug NVIDIAs referencearkitektur (Spectrum-X, BlueField-3 eller ConnectX-8) og en konsulent.

Hvad skal jeg gøre næste

Før du underskriver netværksafsnittet i et tilbud, bedes du besvare følgende skriftligt:

  1. Hvor mange noder vil rent faktisk køre sammen? Ikke "senere", ikke "måske". Dette bestemmer niveauet.
  2. Hvad er den største træningsbelastning, du vil køre fra start til slut? Forudtræning af tokentekst-LLM kræver ikke meget båndbredde; diffusion af billede/video kræver meget båndbredde.
  3. Er RoCE på bordet? Hvis ja, så vælg Mellanox NIC'er og en leverandør med RoCE-skabeloner. Hvis nej, er Intel E810 fint og €500 billigere pr. vært.
  4. Hvad er den faktiske kabellængde fra server til switch? Mål med målebånd, ikke estimer. DAC-grænserne ved 100G/400G er stramme.
  5. Har I adskilt administration fra dataplan? Altid to strukturer — billig 1/10 GbE til SSH/IPMI/Prometheus, den dyre RDMA-struktur kun til NCCL. N08 har layoutet.
  6. Har værten PCIe-banerne? Et 400 GbE NIC i et Gen 4 x16-slot leverer ~200 GbE i praksis. Bekræft før du afgiver et tilbud.

Krydsreferencer i N-sporet for det næste detaljelag: N02 (InfiniBand vs. RoCE vs. almindeligt Ethernet — når alternativet til Ethernet rent faktisk vinder), N04 og N05 (switchede og switchløse topologier i multi-node-tilfældet), N06 (latenstidsdissektion — hvor mikrosekunderne rent faktisk går hen) og N08 (RDMA-opsætning i praksis og hvordan klyngen opretter forbindelse til resten af ​​verden).

Ethernet til AI er et løst problem. De fejl, der gør sig gældende, handler næsten aldrig om kablet – de handler om at specificere det forkerte niveau til arbejdsbyrden, placere netværkskortet i det forkerte PCIe-slot eller behandle switchen som en handelsvare, når arbejdsbyrden faktisk har brug for dybe buffere og PFC. Får du de tre ting rigtigt, bliver netværket den kedelige del af byggeprocessen, hvilket er det, du ønsker.


Dette er en del af Kentino Wiki, en referenceserie om AI-beregning, robotteknologi og de systemer, der forbinder dem. Kommentarer og rettelser er velkomne på info@kentino.com.