InfiniBand vs. RoCE vs. Plain Ethernet: Valg af stof i 2026

Tre transportvalg dukker op på hver RFQ for multi-node AI-klynger: InfiniBand, RoCE og almindelig TCP/IP Ethernet. De er ikke tre punkter på samme linje. De er tre forskellige ingeniørfilosofier - lossless-by-design HPC-struktur, lossless-tunet Ethernet og den almindelige netværksstak, som resten af ​​computerindustrien bruger - og de har forskellige omkostningskurver, forskellige driftsmæssige fodaftryk og meget forskellige rigtige svar afhængigt af, hvad du rent faktisk bygger.

Denne artikel gennemgår, hvad hver enkelt er, hvor latensen og pengene rent faktisk går hen i 2026, og hvor grænsen går mellem "vi har brug for RDMA" og "vi har brug for RDMA og InfiniBand specifikt". Vi slutter med en flad beslutningsmatrix.

Målgruppe: Folk, der vurderer størrelsen på en AI-klynge med 2 til 32 noder og forsøger at afgøre, om linjeposten for en InfiniBand-switch er ærlig eller teaterbaseret. Krydsreference N01 for 25/100 GbE-grundlæggende, N06 for det underliggende latensbudget, N07 for routing-knapperne og N08 for den praktiske RDMA-opbygning.

Tre stoffer, hvad hvert enkelt stof egentlig er

Native InfiniBand er en specialbygget HPC-struktur. Linklaget er tabsfrit per design — kreditbaseret flowkontrol betyder, at en afsender aldrig sender, medmindre modtageren har bufferplads, så pakker ikke mistes under overbelastning på samme måde som Ethernet mister dem. Routing er centraliseret: hver struktur har en subnet manager (en opensm proces eller en integreret SM på en administreret switch), der tildeler LID'er, beregner stier og omkonfigurerer ved topologiændring. Applikationsoverfladen er verbernes API — ibv_post_send, køpar, færdiggørelseskøer, hukommelsesregioner — den samme API, som resten af ​​RDMA-verdenen lånte.

I 2026 er den implementerede generation NDR (400 Gb/s pr. port, ConnectX-7, Quantum-2 switche). XDR (800 Gb/s, ConnectX-8, Quantum-X800) sendes i hyperscaler- og AI-lab-ordrer i år; IBTA offentliggjorde XDR-specifikationen i 2023, og silicium er nu i volumen. Switch hop latency er under 100 ns på NDR cut-through silicium - den laveste kommercielt tilgængelige, og den har været den laveste med omtrent en faktor fire i to årtier.

RoCEv2 (RDMA over Converged Ethernet, version 2) er den samme RDMA-verbs API, der kører på UDP/IP over Ethernet. NIC-siliciumet er, på en ConnectX-7 eller ConnectX-8, den præcis samme chip som InfiniBand-versionen — et firmwareflag (LINK_TYPE_P1 = 1 for IB, 2 (for Ethernet) skifter mellem tilstande. Hvad der ikke er gratis: Ethernet er som standard tabsgivende, og RDMA antager tabsfri transport. Så en RoCE-implementering kræver, at strukturen opfører sig som InfiniBand på linklaget, hvilket betyder Priority Flow Control (PFC) til den kortvarige nødbremse, ECN til det langsigtede overbelastningssignal og en kontrolløkke som DCQCN, der binder dem sammen. Det er konfigurationsarbejdet - og den operationelle risiko - der adskiller RoCE fra almindeligt Ethernet. Gørt rigtigt, ligger RoCEv2 inden for rækkevidde af InfiniBand-latens: 1.5-2.5 µs RDMA RTT med samme switch versus IB's ~1 µs.

Almindelig TCP/IP Ethernet er resten af ​​planeten. Sockets API, kernel netværksstak, ingen RDMA, ingen tabsfri garanti. Ydeevnen ligger i latensbåndet på 10-30 µs/vej pr. N06 , gennemløbshastigheden er fin i forhold til NIC-linjehastigheden for bulkoverførsel, og CPU'en er på datastien. Dette er den rigtige fabric til administrationstrafik, modeldownloads, telemetri og gigabitten mellem din robot og din inferensserver. Det er den forkerte fabric til synkron gradient AllReduces på tværs af 16 GPU'er.

Sammenligningen af ​​overskrifterne

Ejendom InfiniBand NDR RoCEv2 (100 GbE) Almindelig TCP 100 GbE
Hastighed pr. port (mainstream 2026) 400 Gb / s 100–400 Gb/s 100 Gb / s
Samme-switch RDMA RTT, 64 B ~1 µs 1.5–2.5 µs n/a (ingen RDMA)
Switch hop latency <100 ns 400–600 ns 400 ns – 3 µs
Sockets RTT (kernel stak) n / a n / a 20–60 µs
Tabsfrit linklag Ja, efter hensigten Tunet (PFC + ECN) Ingen
Routing SM, deterministisk ECMP + adaptiv ECMP / standard L2/L3
NIC silicium ConnectX-7/8 ConnectX-7/8 (samme chip) Enhver
Relativ omkostning pr. port ~$$$ ~$$ ~$
Operationel kompleksitet Mellem (SM, men få knapper) Høj (PFC/ECN/DCQCN-tuning) Lav
Leverandørkoncentration Kun NVIDIA NVIDIA, Broadcom, AMD/Pensando, Cisco, Arista Enhver

Læs omkostningsrækken som relativ, ikke absolut. Den reelle forskel på switche er omtrent 2-3 gange pr. port for en InfiniBand NDR-switch versus en tilsvarende AI-grade Ethernet-switch (Spectrum-X, Tomahawk 5/6). Selve netværkskortet er stort set den samme hardware i begge tilstande; forskellen ligger i licensen og i supportkontrakten.

Hvor latensen går hen

N06 tager en enkelt RDMA-tur mikrosekund for mikrosekund. Den kondenserede version, relevant for denne sammenligning:

Hoppe InfiniBand NDR RoCEv2 100 GbE Almindelig TCP 100 GbE
NIC TX (udsagnsord) 0.3–0.5 µs 0.3–0.5 µs n / a
Skift hop (single) <0.1 µs 0.4–0.6 µs 0.4–3 µs
Ledning (10 m) 50 ns 50 ns 50 ns
NIC-modtagelse 0.3–0.5 µs 0.3–0.5 µs n / a
Kernel TCP/IP envejs n / a n / a 10–30 µs
Applikation (memcpy, serialisere) 0.1–1 µs 0.1–1 µs 1–10 µs
Total envejs, enkelt afbryder ~1 µs ~1.2–2 µs ~15–40 µs

InfiniBand vinder på ASIC-latens i switche – det er det hul, der ikke er lukket. Moderne AI Ethernet-switche (Spectrum-X SN5600 / Tomahawk 5) får antallet per hop i området 400-600 ns, hvilket er konkurrencedygtigt nok til, at den absolutte forskel på tværs af en to-hop leaf-spine er i størrelsesordenen 1 µs. Det betyder noget for tætte tensor-parallelle kollektiver. Det betyder ikke noget for storage-læsninger eller batch-inferens.

Den almindelige TCP-kolonne er den, der skræmmer folk, der kun kender latensen fra sockets. Kerneomkostningerne på 10-30 µs/vej er pr. pakke; på et lille meddelelseskollektiv med mange rundture akkumuleres det hurtigt. NCCL over TCP er funktionelt, men det er den sidste udvej.

Båndbredde og NIC-virkeligheden

I 2026 dækker den samme kortfamilie både InfiniBand og RoCE:

NIC tilstand Per-port PCIe
ConnectX-6 Dx IB HDR / RoCE 100 GbE 200 / 100 Gb/s Gen4
ConnectX-7 IB NDR / RoCE 400 GbE 400 Gb / s Gen5
ConnectX-8 SuperNIC IB XDR / RoCE 800 GbE 800 Gb / s Gen6
BlueField-3 DPU IB NDR / RoCE 400 GbE + offload 400 Gb / s Gen5
Broadcom Thor 2 / Thor 3 Kun RoCE Ethernet op til 800 Gb/s Gen5/6
AMD Pensando Pollara 400 RoCE / Ultra Ethernet 400 Gb / s Gen5

Overskriften: Et ConnectX-7-kort, du køber til IB, er det samme kort, du ville købe til RoCE. Listeprisen i starten af ​​2026 ligger omkring €1,500-€2,200 for single-port NDR; variant-SKU'en forudkonfigurerer blot firmwaren. Derfor er "skift fra IB til RoCE" ikke et NIC-genkøb i de fleste klynger - det er et firmwareflag, et transceiver-swap og et switch fabric-skift.

På AMD-siden er Pensando Pollara 400 (nu tilgængelig med MI300X/MI325-platformene) det første troværdige ikke-NVIDIA RDMA NIC med produktionsbaseret AI-implementering. Broadcom annoncerede et 800G AI NIC i 2025 (Thor Ultra / Thor 3. generation). For første gang i et årti er RDMA NIC-markedet ikke en by med én leverandør.

Skifter: hvor pengene rent faktisk er

Netværkskortet koster stort set det samme på tværs af tilstande. Det er switchen ikke.

Skift klasse Kapacitet Omtrentlig liste, pr. port, 2026
NVIDIA Quantum-2 QM9700 (64× 400G NDR IB) 51.2 Tb/s $$$$ (~3× Ethernet-ækvivalent)
NVIDIA Quantum-X800 (XDR IB) 115.2 Tb/s $$$$$
NVIDIA Spectrum-X SN5600 (64× 800G Eth) 51.2 Tb/s $ $ $
Broadcom Tomahawk 5-reference (51.2 Tb/s) 51.2 Tb/s $$
Broadcom Tomahawk 6 (102.4 Tb/s) 102.4 Tb/s $$$ (nyere, premium)
Generisk 100 GbE-blad (datacenterklasse) 6.4–12.8 Tb/s $

Præmien på 2-3 gange pr. port for InfiniBand har været stabil i årevis. Det er en reel pris: en Quantum-2 NDR-switch med 64 porte ligger i båndet €120-€180 afhængigt af optik og support; en Spectrum-X SN5600 med 64 porte og et lignende antal porte ligger omkring €60-€90; en generisk Tomahawk 5 whitebox fra en taiwansk OEM kan være halvdelen af ​​det. Tilføj optik - OSFP NDR-transceivere koster €600-€1,200 pr. stk. i volumen - og "all in"-deltaet pr. port udvides yderligere.

Hvor den ikke breder sig så meget, som folk forventer: AOC (aktive optiske kabler) og DAC (direkte kobber) til in-rack-kabler. En 3 m DAC koster ~€100-€200 i begge økosystemer. Den store optikregning viser sig først, når man går over ~5 m og har brug for SR/LR-transceivere i begge ender.

Spectrum-X-vinkelen: NVIDIAs "AI Ethernet"-pitch

NVIDIAs strategiske svar på Ethernet-skiftet er Spectrum-X — en pakke af Spectrum-4 (og nu Spectrum-5) switch-silicium, BlueField/ConnectX NIC'er og en end-to-end-løsning til kontrol af overbelastning, som de kalder "adaptiv routing + telemetri-baseret load balancing". Markedsføringspåstanden er, at Spectrum-X leverer AllReduce-ydeevne i InfiniBand-klassen på Ethernet, valideret på reelle AI-træningsbelastninger.

Den målte virkelighed, fra NVIDIAs egne benchmarks og fra tredjeparter:

  • Spectrum-X lukker cirka 80-90% af AllReduce-ydeevnegabet med InfiniBand NDR på NCCL-arbejdsbelastninger. Det resterende gab er små beskeder og worst-case haleadfærd.
  • Den adaptive routing pr. pakke (sprøjter pakker på tværs af flere stier og genordner dem hos modtageren) er den hemmelige ingrediens. Standard ECMP hasher hele flows, hvilket på en AI-arbejdsbelastning med et lille antal flows producerer hotspots. Spectrum-X bryder flow-hash-antagelsen.
  • Det fungerer kun som en stak. Bland et ikke-NVIDIA NIC med en Spectrum-switch, og den adaptive routing-telemetri-sti brydes. Dette er lock-in-afvejningen — du undslipper InfiniBand-økosystemet for kun at vende tilbage til det via Ethernet.

Ærlig læsning: Spectrum-X er et reelt teknisk svar på et reelt problem. Det holder også NVIDIA opdateret på alle lag i en AI-klynge, hvilket er præcis, hvad hyperscalere valgte Ethernet for at undgå. Om det er den rigtige beslutning, afhænger af, om det resterende ydelsesgab på 10-20 % er den ekstra integrationsfrihed værd, som du går på kompromis med.

Det ikke-NVIDIA-svar er Ultra Ethernet — UEC 1.0-specifikationen udgivet i 2025, bakket op af AMD, Broadcom, Cisco, HPE, Intel, Meta og Microsoft. Flervejslevering, load balancing på pakkeniveau, kontrol af overbelastning i netværket, åben API. Pensando Pollara og Broadcom Thor 3 er de første NIC'er, der leverer UEC. Fra midten af ​​2026 er dette den troværdige cross-vendor Ethernet-for-AI-sti, der ikke kræver NVIDIA-stakken end-to-end.

Hyperscaler-kontekst (og hvad det betyder for resten af ​​os)

Overskriften fra de sidste to år: hyperscalerne har stort set forladt InfiniBand. Meta-trænede Llama 3 frem for RoCE. AWS' AI-struktur er Ethernet end-to-end. Googles TPU-pods har altid været brugerdefinerede, men deres GPU-flåder sidder på Ethernet. Microsoft Azure kører en mix og investerer kraftigt i Ethernet på de nye builds. Omkring 70% af nye AI-infrastrukturimplementeringer i begyndelsen af ​​2026 valgte Ethernet frem for InfiniBand, ifølge Broadcoms indtjeningsoplysninger, en vending fra InfiniBand-andelen på ~80% i 2023.

Metas offentliggjorte konklusion var utvetydig: korrekt afstemt RoCEv2 og InfiniBand leverer tilsvarende træningsydelse på deres arbejdsbyrder. Skiftet handler ikke om rå ydeevne – det handler om, hvem der ejer siliciummet, hvem der bemander SRE'erne, hvordan delene indkøbes, og om driftsmodellen integreres med resten af ​​datacentret.

Tre ting er vigtige for resten af ​​os, der ikke kører træningsstrukturer med 10,000 GPU'er:

  1. Spørgsmålet om, hvorvidt ethernet kan udføre kunstig intelligens, er afgjort. Det kan det. RoCEv2 med moderne AI-switch-silicium og korrekt overbelastningskontrol er produktionsdygtig. Hyperscalerne beviste det. Du behøver ikke længere at forsvare valget i en RFQ.
  2. Operationel ekspertise har ændret sig med siliciummet. For fem år siden var der tre personer i dit land, der kunne lave en InfiniBand-struktur, og én, der kunne finjustere PFC/DCQCN korrekt på RoCE. I dag er RoCE-færdighederne langt mere udbredte, og InfiniBand-færdighederne er koncentreret i HPC-laboratorier og hos NVIDIA-partnere. Planlæg bemandingen i overensstemmelse hermed.
  3. Historien om leverandørfastlåsning er vendt på hovedet. InfiniBand har altid været solgt af én leverandør (NVIDIA, tidligere Mellanox). Ethernet var det åbne alternativ – indtil Spectrum-X også lancerede NVIDIAs end-to-end-tilbud på Ethernet. Det virkelig leverandørneutrale svar i 2026 er UEC-klasse RoCE med Broadcom- eller AMD-silicium.

Når InfiniBand er det rigtige valg

InfiniBand er det rigtige svar, når de fleste af disse er sande:

  • Dedikeret træningsklynge, 16+ noder, kører synkron gradient AllReduces ved vedvarende hastigheder. Latensfordelen på den lille kollektive ende kombineres på tværs af tusindvis af iterationer.
  • Du køber NVIDIA HGX- eller DGX-systemer alligevel. Disse baseboards er designet omkring NDR/XDR. Det er operationelt akavet at blande Ethernet på en DGX-node.
  • Du har ekspertise inden for personalet der kender subnet manageren, kan læse ibtracert output og er fortrolig med NVIDIAs UFM-styring.
  • Budgettet understøtter en 2-3× switch-præmie pr. port uden at bryde klyngeøkonomien.
  • Klyngen er hele formålet med bygningen. En ren HPC/AI-implementering uden delte lagerlejere og ingen applikationstrafik — InfiniBand forenkler driftsmodellen, fordi der ikke er noget QoS-argument at have.

Hvis tre af disse fem beskriver din opbygning, fortjener InfiniBand sin pris. Hvis kun én gør det, betaler du for et stof, der er optimeret til en andens problem.

Når RoCEv2 er det pragmatiske valg

RoCE er det rigtige svar på den største del af Kentinos kundetilstedeværelse:

  • 4 til 16 noder, blandet arbejdsbyrde, træning og inferens og lagring på samme struktur.
  • Budgetbevidst, men RDMA-påkrævet. Klyngen udfører nok multi-node-træning eller distribueret inferens til, at kernel-stak-skatten på almindelig TCP er uacceptabel, men InfiniBand-switch-præmien er.
  • Delt struktur med ikke-AI-trafik. Drift, lagring og udvikleradgang kører alle på det samme Ethernet-anlæg. RoCE sameksisterer med det; InfiniBand har brug for sit eget fysiske lag.
  • Du ønsker leverandørvalgfrihed. Bland Broadcom-switche med NVIDIA NIC'er med AMD MI300-noder. Ethernet-økosystemet tillader det, men det gør InfiniBand-økosystemet ikke.
  • Holdet har allerede operationel dybde inden for Ethernet. PFC/ECN-tuning er rigtigt arbejde, men det er arbejde på et substrat, som alle allerede kender. SM'en i dit hoved er L2/L3-kontrolplanet, du har kørt i årevis.

Fælden at markere: Forkert konfigureret RoCEv2 er værre end almindelig TCP. PFC-pausestorme på tværs af en usegmenteret fabric kan nedbryde administrationsplanet. Forkert indstillede ECN-tærskler producerer en fabric, der ser sund ud på en perftest, men kollapser under reel AllReduce-incast. Ifølge N08 er dette advarslen "rullende PFC-konfiguration manuelt på en generisk whitebox er et projekt". Køb fra en leverandør med godkendte RoCE-skabeloner (NVIDIA Spectrum-X, Arista, Cisco Nexus 9000 med AI-fabric-serviceprofilen), eller hyr en person, der har gjort dette før.

Når almindelig TCP/IP Ethernet er nok

Almindelig Ethernet — ingen RDMA, ingen PFC, ingen DCQCN-tuning, kun sockets og kernelstakken — er det rigtige svar oftere end folk indrømmer:

  • Enkeltnode 4× eller 8× GPU-server. Inter-GPU-trafik forbliver på PCIe eller NVLink inde i kabinettet. Netværkets eneste rolle er at sende træningsdata ind, modelvægte ud og telemetri rundt. 25 GbE eller ét link på 100 GbE er fint.
  • Inferensklynger med let koordinering mellem noder. Latens pr. anmodning domineres af GPU-beregning; 10 µs af netværket er støj.
  • Blandet laboratorium, Robotics workbench, udviklingsmiljø. Klyngen kører ikke vedvarende synkron træning. RDMA er overkill.
  • Robotiske edge-AI-opsætninger som beskrevet i I01 — robotten taler med én inferensserver, latensbudgettet er i hundredvis af millisekunder, stoffet er usynligt.

Den ærlige opfordring til størstedelen af ​​Kentinos kundebase: Hvis du køber et enkelt K-AI 256 Turin Dual med 8× RTX 5090, behøver du ikke InfiniBand, og du behøver ikke engang RoCE. Et par 100 GbE-kort forbindes til en standard datacenterswitch, jumbo frames aktiveret, standard kernel-tuning – det er det rigtige svar, og det koster femcifret mindre end alternativet.

Ærlig Kentino-opfattelse

Vi sælger til kunder, der bygger klynger med 1 til 8 noder med forbruger- og arbejdsstations-GPU'er (5090, 4090, RTX Pro 6000 Blackwell). Ikke hyperscale-markedet, ikke HPC-markedet. For det fodaftryk:

  • Enkeltnode 8-GPU-boks: almindelig 25/100 GbE. Færdig. Ingen RDMA, ingen fabric-skat. Den interessante båndbredde er inde i kabinettet på PCIe Gen5; det eksterne link er til dataindtagelse og -administration.
  • Klynge med 2 til 4 noder og lejlighedsvis distribueret træning: RoCEv2 på 100 GbE med en leverandørunderstøttet AI-switchskabelon. Spectrum-X, hvis du ønsker den NVIDIA-validerede sti; Tomahawk 5 / Arista, hvis du ønsker multi-vendor-stien. Planlæg to uger til korrekt PFC/ECN-opstart og nccl-tests validering.
  • 4- til 8-noders vedvarende træningsklynge: RoCEv2 på 200 eller 400 GbE, med administrationsplanet fuldt adskilt. Dette er det optimale punkt for omkostningskurven per port; forskellen i forhold til IB på denne skala er ikke nok til at retfærdiggøre switch-præmien, medmindre arbejdsbyrden er usædvanligt latenstidsfølsom.
  • Over 8 noder, vedvarende AllReduce-tung træning: InfiniBand begynder at fortjene overvejelse. Ikke automatisk – mål det. Men i denne størrelse er den operationelle enkelhed ved "stoffet er tabsfrit, SM håndterer routing, NCCL fungerer bare" virkelige penge værd.
  • Alt der er ægte DGX-skala: ikke os. Køb HGX, accepter InfiniBand-pakken.

Hvad skal jeg gøre næste

En beslutningsmatrix, der afslutter de fleste af disse samtaler:

Spørgsmål Hvis ja Hvis nej
Er dette en server med én node, eller to noder, der udfører uafhængigt arbejde? Almindelig TCP, 25/100 GbE. Stop her. Fortsæt.
Kører I synkron distribueret træning (DDP / FSDP / Megatron)? Fortsæt. Almindelig TCP/100 GbE er nok. Stop.
Er klyngen ≤ 4 noder i alt? RoCEv2 på 100 GbE. Fortsæt.
Er klyngen 4-16 noder, blandet arbejdsbyrde og delt struktur? RoCEv2 på 100/200/400 GbE med Spectrum-X eller Tomahawk 5/6. Fortsæt.
Har klyngen 16+ noder, dedikeret AI-træning og et NVIDIA-budget? InfiniBand NDR/XDR. RoCEv2 kan stadig forsvares.
Har I InfiniBand-ekspertise blandt jeres medarbejdere? IB er driftsmæssigt billigere. Lean RoCEv2; markedet for Ethernet-færdigheder er langt dybere.
Vil den samme struktur bære ikke-AI-trafik (lagring, administration, udvikling)? RoCEv2; IB kræver separat fysisk anlæg. IB er renere, hvis budgettet tillader det.

Hvis du evaluerer et build og er usikker, er rækkefølgen af ​​handlingerne:

  1. Profilér arbejdsbyrden. Hvor meget af den samlede runtime er i internnode-kollektiver versus beregning med én node? Hvis den er under 10 % af runtime, er det valget af fabric, der knap nok ændrer sig.
  2. Størrelsesinddelingen af ​​klyngen er ærlig. 2 noder er ikke det samme problem som 16 noder. Bestem antallet før stoffet.
  3. Tal med to switch-leverandører. Få et reelt tilbud pr. port inklusive optik. 2-3× InfiniBand-præmien er ikke teoretisk, og den fremgår ikke af markedsføringsmaterialet.
  4. Planlæg styringsplanet separat, per N08Debatten om dataplanstrukturen distraherer fra det faktum, at man også har brug for et 10 GbE-administrationsnetværk, der ikke er afhængig af AI-strukturen for at fungere.
  5. Hvis RoCE: budgetter to ugers klyngeopbygning til PFC/ECN/DCQCN-tuning. Per N08, det er her, RoCE-klynger lever eller dør.

De opfølgende artikler dækker de grundlæggende principper for wire-løsninger ( N01 ), latensbudgettet, som valget udspringer af ( N06 ), kompleksiteten af ​​routing og overbelastningskontrol ( N07 ) og den praktiske RDMA-opbygning uanset fabric ( N08 ). K-sporet behandler emner på klyngeskala - distribueret træning (K02), inferensklynger (K03) - der antager, at denne beslutning allerede er truffet.

InfiniBand er fremragende til det, det gør. RoCEv2 har indhentet nok til at vinde de fleste nye builds på pris og økosystem. Almindeligt Ethernet er det uglamourøse rigtige svar til den største gruppe af købere. Vælg den, din arbejdsbyrde rent faktisk har brug for, ikke den, som leverandørens bud anbefaler.


Dette er en del af Kentino Wiki, en referenceserie om AI-beregning og de systemer, der forbinder den. Rettelser er velkomne til info@kentino.com.