Tokens pr. sekund pr. euro: GPU-økonomi til inferens
De fleste købere stiller det forkerte spørgsmål. De vil vide, hvilken GPU der er "hurtigst". Det rigtige spørgsmål til en produktionsbaseret inferensbelastning er "hvilken GPU producerer flest tokens pr. euro brugt over de næste tre år til den model, jeg rent faktisk betjener". Disse to spørgsmål har forskellige svar, og forskellen er stor nok til, at det rutinemæssigt koster Kentino-kunder 30-60% af deres budget at satse på rå hastighed.
Denne artikel udregner matematikken. Målgruppen er en person, der vurderer størrelsen på en inferensbuild, har læst W01 og N03 , og nu skal beslutte sig for mellem et RTX 5090, et RTX Pro 6000 Blackwell, et L40 eller et L4 – og hvor mange af dem.
Metrikken: hvorfor tok/s pr. euro, ikke tok/s
To præstationsregimer er vigtige, og at sammenblande dem er den mest almindelige størrelsesfejl.
Single-stream tok/s er, hvad en bruger ser, mens de venter på ét svar. Det er båndbreddebundet ved tokengenerering og næsten udelukkende en funktion af VRAM-båndbredde divideret med modellens vægtfodaftryk (se W01 ). Vedvarende gennemløbs-tok/s er, hvad en server pumper ud på tværs af mange samtidige brugere med kontinuerlig batching aktiveret. På Blackwell-klasse hardware er dette beregningsbundet, når batcherne vokser over 16. Det er, hvad produktionen bekymrer sig om.
De to afviger med 10-25× på det samme kort. Single-stream Llama 70B INT4 på et RTX Pro 6000 Blackwell lander omkring 32 tok/s. Det samme kort ved batch 32 med kontinuerlig vLLM batching skubber 600+ tok/s aggregeret. At vælge single-stream-installationer med for lidt gennemløb øger gennemløbshastigheden med en størrelsesorden; at vælge dem med for stort gennemløb øger latenstidsfølsomme implementeringer. TCO-beregningen her bruger vedvarende gennemløb, fordi det er det, der dominerer regningen.
Nuværende EU-detailpriser (maj 2026)
Priserne nedenfor er EU-detailpriser, ekskl. moms, på den åbne kanal — ikke OEM-volumenkontrakter og ikke cloud-leje. Indhentet fra EU-pristrackere og distributørliste i maj 2026. Betragtes som intervaller; kvartalsvise udsving på 10-20 % er normale.
| GPU | VRAM | TDP | EU-gadepris ekskl. moms |
|---|---|---|---|
| RTX 5090 | 32 GB GDDR7 | 575 W | € 2,500- € 3,000 |
| RTX Pro 6000 Blackwell-arbejdsstation | 96 GB ECC | 600 W | € 8,000- € 9,500 |
| RTX Pro 6000 Blackwell Server Edition | 96 GB ECC | 600 W | € 8,500- € 10,000 |
| L40 | 48 GB ECC | 300 W | € 7,500- € 9,500 |
| L4 | 24 DK | 72 W | € 2,500- € 3,500 |
| H100 SXM (reference, sælges ikke af Kentino) | 80 GB HBM3 | 700 W | € 27,000- € 35,000 |
To observationer alene fra denne tabel. Pro 6000 Server Edition koster cirka 3 gange så meget som et 5090 for 3 gange så meget VRAM og tilsvarende båndbredde — prisen handler om hukommelseskapacitet, ikke råhastighed. L4 er det eneste kort her under 100 W. Alene den kendsgerning ændrer den samlede ejeromkostninger, når elektricitet kommer i betragtning.
Benchmark-tal for enkelt-GPU
Tallene nedenfor er fra offentlige benchmarks (vLLM, llama.cpp, SGLang) indsamlet fra Spheron, CloudRift, RunPod og vLLM-projektets egne publicerede kørsler, maj 2025 til maj 2026. De er ikke Kentinos benchmark - vi har krydstjekket med vores interne 4×5090 og 4×Pro 6000 bokse for de celler, vi betjener regelmæssigt; de offentlige tal ligger inden for ±15%.
Llama 3.3 70B FP8 — enkeltstrømsafkodning
| GPU | tok/s | Noter |
|---|---|---|
| RTX 5090 | n / a | 75 GB FP8-vægte passer ikke på 32 GB |
| RTX Pro 6000 BW-arbejdsstation | 28-34 | Passer til ét kort med KV headroom |
| RTX Pro 6000 BW Server Ed. | 28-34 | Samme silikone, servertermiske |
| L40 | n / a | 48 GB for lille til FP8 70B; kun INT4 |
| L4 | n / a | Uden for klassen |
| H100 SXM (reference) | 55-65 | HBM3 båndbreddeledning |
Llama 3.3 70B INT4 (AWQ) — enkeltstrømsafkodning
| GPU | tok/s | Noter |
|---|---|---|
| RTX 5090 | n/a enkelt | 40 GB INT4 spilder 32 GB; kræver 2× |
| 2× RTX 5090 (TP=2) | 24-30 | PCIe TP-skat synlig |
| RTX Pro 6000 BW | 30-36 | Passer komfortabelt, 50+ GB gratis til KV |
| L40 | 14-18 | GDDR6 ECC, lavere båndbredde |
| L4 | 4-6 | 24 GB kan næsten ikke holde til vægte, langsom |
Qwen 2.5 32B INT4 (AWQ) — enkeltstrøm
| GPU | tok/s | Noter |
|---|---|---|
| RTX 5090 | 55-65 | 18-20 GB vægte, kV i de resterende 12 GB |
| RTX Pro 6000 BW | 55-65 | Båndbredde-bundet med 5090; vægtplads tilovers |
| L40 | 28-34 | Begrænset båndbredde |
| L4 | 9-12 | Hukommelsesbegrænset, gennemløbsbegrænset |
Llama 3 8B FP16 — enkeltstrøm og aggregat
| GPU | Enkelt tok/s | Aggregat ved batch 32 |
|---|---|---|
| RTX 5090 | 90-110 | 3,200-3,800 |
| RTX Pro 6000 BW | 90-110 | 3,400-4,000 |
| L40 | 45-55 | 1,400-1,800 |
| L4 | 20-28 | 380-550 |
Et par ærlige læsninger fra disse tabeller. 5090 og Pro 6000 Blackwell har identisk båndbredde (1.79 TB/s) og identiske dekodningshastigheder pr. token - forskellene er VRAM-kapacitet og ECC, ikke hastighed. L40 ligger omtrent på halv hastighed på inferens i forhold til Blackwell-parret, fordi GDDR6 ECC er 860 GB/s versus 1,790 GB/s. L4 er et kort med kvart båndbredde; det kompenserer for det med tæthed og pris.
Til single-stream-arbejde i 70B-klassen er Pro 6000 Blackwell det eneste kort, der kører modellen ved FP8 i ét slot. 5090 tvinger dig ind i INT4 og 2-vejs tensor parallel — og TP=2 på PCIe mister 30-35% til all-reduce (se N03 ).
Multi-GPU-skalering: PCIe-skatten
PCIe-only tensor parallel skalerer ikke lineært. Vi dækkede mekanismen i N03 ; her er de empiriske multiplikatorer, du bør indsætte i en TCO-model.
| GPU'er | Konfiguration | Realistisk gennemløbsskalering vs. 1× |
|---|---|---|
| 1 × | baseline | 1.00 |
| 2 × | TP=2 PCIe Gen5 | 1.50-1.70 |
| 4 × | TP=4 PCIe Gen5 | 2.5-3.0 |
| 8 × | TP=4 × PP=2 (foretrukket) | 5.0-6.0 |
| 8 × | TP=8 PCIe (undgå) | 4.0-4.8 |
Pipeline-parallelle og data-parallelle stier skalerer næsten lineært; tensor-parallel betaler en skat, der vokser med GPU-antallet. For en 70B-klasse model er den rigtige konfiguration på 8× 5090 to uafhængige replikaer (DP=2 × TP=4) eller TP=4 × PP=2 — ikke TP=8. Se K03 for konfigurationsreglerne.
Dette har betydning for omkostningerne, fordi en fordobling af GPU-antallet aldrig fordobler gennemløbshastigheden. En naiv budgetprognose med "dobbelt så mange GPU'er, dobbelt så mange tok/s" overdriver løfterne med 30-50%.
3-årig TCO-model
Prisen på GPU-mærket er omtrent halvdelen af de reelle omkostninger ved at køre et inferencekort over tre år. Den anden halvdel går til elektricitet, chassis-andel og gulvplads. Modellen nedenfor er den, vi bruger internt til Kentino AI-dimensionering.
Per-GPU 3-year TCO =
GPU cost
+ Chassis share (chassis + CPU + RAM + PSU + NIC) / GPU count
+ Electricity: TDP × utilization × 8,760 h × 3 × €0.20/kWh
+ Colo/rack space share
+ Maintenance & spares (~5% of GPU cost / year)
Antagelser anvendt nedenfor:
- Elektricitet: 0.20 €/kWh blandet (typisk EU-industriel kolofon eller ejet DC). Tjekkisk detailhandel er ofte 0.18-0.22 €; Tyskland højere.
- Udnyttelse: 60 % vedvarende (en realistisk produktionsbelastning — ikke benchmarktallet på 100 %, ikke laboratorietallet på 5 %).
- PUE: 1.4. Datacenteroverhead (køling, distributionstab). Dette øger det effektive elektricitetsforbrug til 0.28 €/kWh GPU-forbrug.
- Chassisdeling: €4,000 amortiseret over 4 GPU'er (€1,000/GPU) for en Kentino 4-GPU 5090 build; €8,000 over 8 (€1,000/GPU) for 8-GPU Pro 6000-kabinettet.
- Vedligeholdelse: 5 %/år af GPU-omkostninger (reservekortsafdragsfond + chauffør-/driftstid).
TCO-tabel pr. GPU
| GPU | Kort € | Chassis € | Elektricitet € (3 år) | Vedligeholdelse € (3 år) | TCO 3 år € |
|---|---|---|---|---|---|
| RTX 5090 | 2,800 | 1,000 | 2,540 | 420 | 6,760 |
| RTX Pro 6000 BW WS | 8,800 | 1,000 | 2,650 | 1,320 | 13,770 |
| RTX Pro 6000 BW SE | 9,400 | 1,000 | 2,650 | 1,410 | 14,460 |
| L40 | 8,500 | 1,000 | 1,325 | 1,275 | 12,100 |
| L4 | 3,000 | 800 | 318 | 450 | 4,568 |
| H100 SXM (ref.) | 30,000 | 3,500 | 3,090 | 4,500 | 41,090 |
Elrækker: TDP × 0.60 × 8,760 × 3 × 0.20 × 1.4 (PUE) / 1,000. L4-linjen er slående – dens vedvarende 3-årige elregning er €318. 5090'eren er €2,540. Otte gange strømforbruget, otte gange regningen.
Pris pr. million tokens
Kombiner nu den samlede ejerandel (TCO) med den målte vedvarende gennemløbshastighed på en repræsentativ arbejdsbelastning — Llama 3.3 70B INT4 ved batch 32, eller Qwen 32B ved batch 32, eller Llama 8B ved batch 64. Tag et korts vedvarende tok/s, gang med 0.60 udnyttelse × 3 × 8,760 × 3,600 for at få det samlede antal serverede tokens, divider den samlede ejerandel (TCO) med det. Tallene nedenfor er illustrative; juster til din faktiske model og batch.
| GPU | arbejdsbyrde | Vedvarende tok/s | Poletter/3 år (B) | € / Mtok |
|---|---|---|---|---|
| RTX 5090 | Llama 8B FP16 hold 64 | 3,500 | 199 | 0.034 |
| RTX 5090 | Qwen 32B INT4 hold 32 | 600 | 34 | 0.20 |
| Pro 6000 BW | Llama 70B FP8 hold 32 | 480 | 27 | 0.51 |
| Pro 6000 BW | Qwen 32B INT4 hold 32 | 650 | 37 | 0.37 |
| L40 | Llama 8B FP16 hold 64 | 1,600 | 91 | 0.13 |
| L40 | Qwen 32B INT4 hold 32 | 320 | 18 | 0.67 |
| L4 | Llama 8B FP16 hold 64 | 450 | 26 | 0.18 |
| L4 | Llama 8B FP8 hold 128 | 650 | 37 | 0.12 |
Læs den tredje kolonne som omkostninger pr. million serverede tokens, fuldt indlæste TCO. Open-router og cloud-API'er for de samme modeller opkræver €0.10-€2.00 pr. million tokens afhængigt af niveau; dette placerer on-prem på samme niveau eller billigere ved vedvarende belastning. Regnestykket falder fra hinanden under 30% udnyttelse - TCO er domineret af capex, du betalte for, uanset om du brugte det eller ej.
Sagen fra 5090
På papiret har 5090 de bedste rå tok/s pr. euro af alle kort i Kentino-serien for inferens under 72B. €2,800 for 1.79 TB/s båndbredde og 32 GB GDDR7 er meget kort. Til enkeltbrugerbrug af en 32B-klassemodel er intet andet i samme forhold.
5090 falder fra hinanden på to steder:
- Modeller der ikke har plads til 32 GB med den ønskede mængde. En 70B FP8 (~75 GB) skal bruge 3-4 kort; en 70B INT4 (~40 GB) skal bruge 2. Når du har tensor-parallelt på tværs af PCIe, betaler du 30-50% totalreduktionsskat, og dine tok/s-per-kort kollapser.
- Multi-GPU-skalering ud over parallel pipeline. 8× 5090 er et rigtigt produkt (vi bygger det), men gennemløbshastigheden pr. kort på en tensor-parallel 70B er omtrent 0.55 gange tallet for et enkelt kort. Du købte otte kort og fik 4.4 gange gennemløbshastigheden. Ikke 8×.
5090'erens styrke er at kunne hoste flere replikaer af mindre modeller. En 4× 5090, der kører fire uafhængige Qwen 32B-replikaer bag en load balancer, slår en 4× 5090 tensor-parallel enkelt Llama 70B på både gennemløb og latenstid — og undgår PCIe-straffen helt.
Pro 6000 Blackwell-kabinettet
96 GB ECC GDDR7 ved 1.79 TB/s er, hvad du køber, når 70B FP8 skal være på ét kort, og du ikke vil diskutere det med PCIe. Workstation- og Server-udgaverne deler den samme silicium, samme hukommelse, samme båndbredde - forskellen er formfaktoren (aktiv vs. passiv køling), BIOS med maksimal effekt og validering til OEM-serverchassis. Server-udgaven koster €700-€1,500 mere og er det rigtige valg til enhver rackmonteret version, der kører 24/7.
Hvor Pro 6000 vinder på tok/s pr. euro:
- 70B FP8-hosting med ét kort. Ingen tensor parallel, ingen PCIe-afgift. Single-stream ved 30+ tok/s, batch-aggregat ved 480+ tok/s.
- Skalér ud via replikaer. 4× Pro 6000 = fire uafhængige 70B-replikaer bag en router. Lineær gennemløbsskalering, elegant fejlisolering.
- ECC til træning. Hvis arbejdsbyrden omfatter finjustering af LoRA/QLoRA eller fuld omskoling, tjener ECC sin løn (se W01).
Hvor Pro 6000 er overkill: enhver implementering, der ikke kræver >32 GB pr. kort. Hvis alle dine modeller passer på en 5090, betaler du 3 gange prisen for VRAM, du ikke bruger. Vi ser dette regelmæssigt - køberen specificerer Pro 6000, fordi det er det "professionelle" kort, og kører derefter en 13B-model på det.
L40-sagen
L40 sidder i en akavet position. 48 GB ECC, GDDR6 (ikke GDDR7), 860 GB/s båndbredde — cirka halvdelen af Pro 6000 Blackwell på inferens, til 75-90% af prisen. Rent tok/s pr. euro på inferens vinder Pro 6000.
L40's kabinet er bygget på tre andre akser:
- TDP. 300 W versus 600 W. Halvdelen af strømmen over tre år (1,325 € vs. 2,650 € i vores model). I termisk begrænsede racks eller enfasede kredsløb er dette forskellen mellem fire kort eller to.
- Validering af datacenter. L40 leveres med passiv køling, OEM-validering på tværs af Supermicro/Dell/HPE og den standard 5-årige datacentergaranti. Pro 6000 Workstation er ikke valideret til 24/7 chassis-drift; Server Edition er, men den er nyere i kanalen.
- Pålidelighedsloft. L40 er specialbygget til vedvarende serverbelastning. Den gennemsnitlige tid mellem fejl på en 24/7 inferensarbejdsbelastning er målbart bedre end den forbrugerafledte 5090.
Ærlig læsning: Hvis din kunde er mere optaget af oppetid end rå tok/s – regulerede brancher, SLA-kontrakter på vagt, alt, der taber penge, når et kort dør midt om natten – så er L40 værd at have tok/s pr. euro i forhold til prisen. Ikke sandt?
L4-sagen
L4 er den, ingen spørger om, og den de fleste kunder bør købe. 24 GB, 72 W single-slot, intet strømstik nødvendigt, passivt kølet. Otte af dem passer i en 1U-server. Seksten passer i en 2U.
Hvad L4 gør godt:
- 8B-klasse model, der betjener i skala. Llama 3 8B FP8 lander ved batch 64 omkring 650 tok/s pr. kort. Otte L4'er i ét kabinet = 5,000 tok/s samlet for et Llama 8B-slutpunkt. Det samme kabinet trækker 600 W GPU.
- Multi-replikatæthed. Hvert L4 er vært for en uafhængig 8B-model. Otte replikaer bag en load balancer uden nogen kommunikation mellem GPU'erne overhovedet. Fejl på ét kort fjerner 1/8 af kapaciteten, ikke hele tjenesten.
- Strømbegrænsede steder. Et 16 A kredsløb kan køre tolv L4'ere plus værtsoverhead. Det samme kredsløb kører knap nok tre 5090'ere.
- Pris pr. million tokens. Med en pris på €0.12/Mtok for 8B FP8 er L4 billigere end alle cloud-API'er i samme modelklasse.
Hvad L4 gør dårligt: alt over 13B, alt der kræver reel båndbredde, træning af enhver art. L4 er et inferenskort med fast funktion til små til mellemklassemodeller. Hvis din arbejdsbyrde ikke passer til det, så spring det over.
Ærlig sammenligning vs. cloud
Cloud-matematikken for et sammenligneligt build. AWS p5.48xlarge (8× H100 SXM) koster $98.32/time on-demand, normaliseret til $12.29 pr. GPU-time. Specialiserede AI-clouds (Lambda, RunPod, CoreWeave) koster $2.00-$4.00 pr. H100-time on-demand og derunder ved 1-årige commits.
Treårig on-demand cloud-pris for én H100-ækvivalent inferensplads:
- AWS on-demand: 12.29 USD × 8,760 × 3 = $323,000
- Spot/rabat AI-cloud: $2.50 × 8,760 × 3 = $65,700
- 1 års reserveret AI-cloud: ~$1.80 × 8,760 × 3 = $47,300
Kentino on-prem 8× Pro 6000 Server Edition: TCO ~€115,000 over tre år for otte kort. Pr. kort €14,400. Det er omtrent en fjerdedel af den billigste cloud-H100, der er reserveret til inferenssammenlignelig gennemløbshastighed (Pro 6000 BW lander på ~60-70% af H100 SXM på ikke-NVLink-afhængige inferensarbejdsbelastninger).
Break-even versus AI-cloud-reserveret H100: on-prem 8× Pro 6000-boksen tjener sig selv hjem med cirka 50 % vedvarende udnyttelse over tre år. Derunder, husleje. Derover, eje. Dette er den samme matematik, som alle seriøse on-prem-købere når frem til, og grunden til, at on-prem-inferens ikke er død i 2026 på trods af cloud-omkostningsbesparelserne.
Arbejdsbelastning til GPU-anbefalingsmatrix
| arbejdsbyrde | Førstevalgs GPU | Hvorfor |
|---|---|---|
| Lama 8B / Qwen 7B / Mistral 7B i skala | L4 (multi) | Bedste tok/s/€ på små modeller, laveste effekt |
| Enkeltbruger, 32B-klasse, latenstidsfølsom | RTX 5090 | Bedste båndbredde/€, passer til INT4 |
| Flerbruger 32B-klasse, gennemløbsfølsom | 2× RTX 5090 eller 1× Pro 6000 | Replika-skala eller enkeltkort, hvis budgettet tillader det |
| 70B inferens, enkeltbruger, FP8-kvalitet | RTX Pro 6000 Blackwell | Det eneste kort, der passer til 70B FP8 på ét slot |
| 70B inferens, flerbruger, gennemløb | 4× Pro 6000 BW (DP-replikaer) | Lineær skalering uden PCIe TP-skat |
| 70B finjustering (LoRA / QLoRA) | RTX Pro 6000 Blackwell SE | ECC, 24/7 validering, passer til trænings-KV i 96 GB |
| 70B træning fra bunden | ikke Kentino-opstillingen | Lej NVLink H100/B200, og medbring derefter vægte på stedet |
| Blandet inferens + let træning, reguleret sted | L40 | ECC, vedvarende pålidelighed, valideret datacenter |
| Stramt rack-strømforbrug, 1U-densitet | L4 (8× pr. 1U) | 72 W enkeltslot, ECC ikke nødvendig til inferens |
| 405B tæt inferens | 3× Pro 6000 BW (PP) | Eneste sti på Kentino-hardware; se K03 |
Den ærlige holdning
De fleste Kentino-kunder kommer ind og spørger, hvilket kort der er hurtigst. Til den arbejdsbyrde, de fleste af dem faktisk har – en 7B eller 8B chatmodel, måske en 32B ræsonnementmodel, måske en visionmodel i 7B-13B-klassen – er det rigtige svar L4 eller 5090, ikke flagskibet. Pro 6000 Blackwell-pristillægget til vores pris er €5,000-€7,000 pr. kort. Med fire kort pr. build er det €20,000-€28,000 i VRAM, som kunden betaler for og ikke bruger.
Opgaven er at spørge, hvilke modeller der skal bruges, ved hvilken samtidighed, ved hvilket kontekstvindue – og dimensionere dem derefter. Mindre aftaler, kunden vender tilbage, når de skalerer.
Hvad skal jeg gøre næste
Hvis du dimensionerer en bygning, skal du arbejde dig igennem disse i rækkefølge:
- Angiv alle de modeller, du skal betjene, med kvantisering og kontekst. Skriv dem ned. Llama 3.3 70B INT4 @ 8K. Qwen 32B INT4 @ 32K. Llama 8B FP8 @ 16K. Uden denne liste er hvert efterfølgende trin et gæt.
- Beregn det største VRAM-fodaftryk for én enkelt instans (vægte + KV ved målkonkurrence). Dette er din bundgrænse på VRAM pr. kort.
- Beregn det vedvarende tok/s-mål. Samtidige brugere × tokens pr. sekund pr. bruger × duty cycle. Dette angiver størrelsen på antallet af kort.
- Kort til GPU'en. Hvis fodaftryk < 32 GB → 5090 eller L4. Hvis < 48 GB → L40 eller 5090 multikort. Hvis 48–96 GB → Pro 6000 Blackwell. Hvis > 96 GB → multikort PP, ikke TP.
- Beregn 3-årige samlede ejeromkostninger (TCO) ved dit faktiske forbrug. Hvis din duty cycle er < 30%, så genovervej cloud-løsninger. Hvis de er > 50%, vinder on-prem-løsninger klart.
- Tilføj en margen på 30% uanset hvad GPU-antallet matematikken siger. Reelle arbejdsbelastninger vokser, modelstørrelser vokser, og undervurderinger af KV-cache er universelle.
Opfølgende artikler i dette spor arbejder med de samme tal fra forskellige vinkler: omkostninger pr. million tokens med on-prem versus cloud-nedbrydninger ( T02 ) og vedvarende versus burst-inferensøkonomi ( T03 ). GPU-valggrundlaget findes i W07 , og parallelismevalgene, der former TCO for flere GPU'er, findes i K03.
Den eneste sætning, man skal huske: De fleste kunder spørger, hvilket kort der er hurtigst, når de burde spørge, hvilket der er billigst til min arbejdsbyrde. Det hurtigste kort er sjældent det billigste svar.
Dette er en del af Kentino Wiki, en referenceserie om AI-beregning, robotteknologi og de systemer, der forbinder dem. Kommentarer og rettelser er velkomne på info@kentino.com.