Pris pr. million tokens: On-prem vs. Cloud

Der er tre ærlige måder at købe LLM-inferens på i 2026: ring til en andens hostede endpoint og betal pr. token (cloud LLM API), lej en GPU pr. time og kør din egen model (cloud GPU-udlejning), eller køb en server og kør den i dit eget rack (on-prem). Prisen på en million tokens ser dramatisk forskellig ud på tværs af de tre, og ikke i den rækkefølge, som de fleste købere antager.

Denne artikel beregner i EUR ekskl. moms. Målgruppe: En person, der beslutter, om de vil fortsætte med at betale OpenAI månedligt, skifte til en hosted open-model-udbyder, leje en H100 eller købe en 4-/8-GPU-boks. Vi citerer priser for maj 2026 og afslutter med et fem minutters beslutningsforløb. Krydsreferencer: T01 pr. GPU TCO, W07 kortvalg, I04 vægsidetal.

De tre platforme

Cloud LLM API. OpenAI, Anthropic, Google, Together, Fireworks. Betal pr. token ind og pr. token ud. Ingen inaktive omkostninger, ingen capex, ingen driftsomkostninger. Heller ikke noget modelvalg ud over deres katalog, ingen LoRA, ingen kvantitativ kontrol.

Leje af cloud-GPU'er. AWS p5/p5e/p6, Azure ND H200/B200, GCP A3 Ultra, plus specialiserede clouds (Lambda, CoreWeave, Nebius, RunPod). Lej en GPU-instans pr. time, og kør hvad som helst. Du medbringer modellen, serveringsstakken og operationerne. Du betaler, uanset om du serverer én token eller én milliard i den time.

On-prem. Køb en 4-GPU eller 8-GPU boks. Opbevar den i rack, din bygning eller et kompleks. Du medbringer strøm, køling, netværk og drift. Afskriv over tre år. Marginalomkostningerne ved en token er elektricitet. Faste omkostninger er alt, hvad du allerede har betalt.

Tre forskellige omkostningsformer — rent variable, rent faste med afgrund, capex plus marginale — der nulstiller hinanden på forskellige punkter langs gennemløbsaksen.

Cloud LLM API-priser

USD pr. million tokens, offentlige prissider, maj 2026. EUR på EUR/USD ≈ 1.08.

Provider Model Input $/Mtok Output $/Mtok Input €/Mtok Produktion €/Mtok
OpenAI GPT-5 1.25 10.00 1.16 9.26
OpenAI GPT-5 mini 0.25 2.00 0.23 1.85
OpenAI GPT-5 nano 0.05 0.40 0.05 0.37
OpenAI GPT-4.1 / o3 2.00 8.00 1.85 7.41
Antropisk Claude Opus 4.7 15.00 75.00 13.89 69.44
Antropisk Claude Sonnet 4.6 3.00 15.00 2.78 13.89
Antropisk Claude Haiku 4.5 1.00 5.00 0.93 4.63
Google Gemini 2.5 Pro 1.25 10.00 1.16 9.26
Google Gemini 2.5 Flash 0.30 2.50 0.28 2.31
Google Gemini 2.5 Flash-Lite 0.10 0.40 0.09 0.37
Sammen Lama 3.3 70B 0.88 0.88 0.81 0.81
Sammen Qwen 2.5 72B 1.20 1.20 1.11 1.11
Sammen DeepSeek-V3 1.25 1.25 1.16 1.16
Sammen Lama 3.1 405B 3.50 3.50 3.24 3.24
AWS-grundfjeld Lama 3.3 70B 0.72 0.72 0.67 0.67
Azure Lama 3.3 70B 0.59 0.79 0.55 0.73

To ærlige læsninger. Lukkede Frontier-modeller (Claude Opus 4.7, GPT-5, Gemini 2.5 Pro) er en størrelsesorden dyrere end hostede åbne model-API'er, der betjener Llama 70B eller DeepSeek-V3 - prisen for "smartest nu" versus "bedste åbne vægte nu". For de fleste produktionsbelastninger (RAG, agenttrin, kode, klassificering) er Sonnet 4.6 eller GPT-5 mini driftspunktet, ikke flagskibet. Output-tokens koster tre til syv gange input på lukkede udbydere og nogenlunde det samme på åbne model-hosts. Hyperscaler åbne model-SKU'er (Bedrock, Azure) opkræver en præmie på 30-80% i forhold til Together eller Fireworks for den samme model - du betaler for IAM-integration og en enkelt regning, ikke billigere tokens.

Omkostninger pr. Mtok på stedet

Omkostninger pr. Mtok er de samlede omkostninger over tre år divideret med antallet af tokens, der betjenes over tre år. Nævneren afhænger af udnyttelsen; tælleren er nogenlunde fast.

On-prem €/Mtok =
    (capex + 3y electricity + 3y maintenance + 3y ops) /
    (sustained tok/s × utilization × 3 × 8,760 × 3,600 / 1e6)

Tilslutning af TCO pr. GPU fra T01 ved 60% udnyttelse, €0.20/kWh, PUE 1.4:

Byg 3 års samlede ejeromkostninger € Vedvarende tok/s Tokens/3 år (Mtok) € / Mtok
4× RTX 5090 (Llama 70B INT4 TP=4) 27,000 1,800 102,000 0.26
4× Pro 6000 BW SE (Llama 70B FP8 DP) 58,000 1,920 109,000 0.53
4× Pro 6000 BW SE (Qwen 32B INT4) 58,000 2,400 136,000 0.43
8× Pro 6000 BW SE (Llama 70B FP8 DP) 115,000 3,800 215,000 0.53
8× L4 (Llama 8B FP8) 36,000 5,200 295,000 0.12

Sænk udnyttelsen til 30 %, og hvert tal fordobles. Hvis du skubber til 80 %, lander L4-serverede 8B på €0.09/Mtok, hvilket er billigere end alle cloud-API'er i den klasse. Matematikken kollapser til under 25 % udnyttelse, fordi den samlede ejerandel (TCO) domineres af de anlægsomkostninger, du betalte, uanset om du brugte den eller ej.

Nulpunktet

Læg skylinjen oven på hinanden. Llama 70B ved 100 millioner tokens/måned , balanceret 50/50, på Together: 100 × €0.81 = €81/måned → €2,916 over tre år. Mod en 4× 5090 on-prem ved €27,000 vinder Together med €24,000. Ved 100 millioner tokens/måned er on-prem fuldstændig forkert.

Skub til 1 milliard tokens/måned : 1,000 × €0.81 = €810/måned → €29,160 over tre år. Tilsammen er 4 × 5090 inden for €2,000. Med 1.5 milliarder/måned vinder on-prem betydeligt.

Break-even for 70B-klasse inferens vs. den billigste open-model hostede API lander omkring 1.0-1.5 B tokens pr. måned, opretholdt på en 4× 5090. For closed frontier API'er (Claude Sonnet 4.6 til €8.34/Mtok blandet, GPT-5 til €5.21/Mtok blandet) bevæger break-even sig til 80-150 M tokens/måned - cloud-linjen er en størrelsesorden stejlere.

Det er det vigtigste tal i denne artikel: break-even er ikke "100 millioner tokens/måned for alting." Det er arbejdsbelastningsspecifikt og afhænger helt af, hvilken cloud-linje du konkurrerer med. Købere, der siger "vi når 50 millioner, vi skal gå on-prem", sammenligner normalt med Claude Opus, hvor de har ret – og ignorerer, at en arbejdsbelastningsflytning fra Opus til Sonnet 4.6 sparer dem fem gange mere end en flytning fra Sonnet til on-prem med den mængde.

Cloud GPU-udlejning — den midterste mulighed

Timepriser pr. GPU, maj 2026 on-demand:

Provider Instans GPU'er $/time-forekomst $/GPU-time
AWS p5.48xlarge 8× H100 SXM 55.18 6.90
AWS p5e.48xlarge 8× H200 SXM 30.00 3.75
AWS p6-b200 8× B200 74.88 9.36
Azure ND H200 v5 8× H200 31.00 3.88
GCP a3-ultraglutamat-8g 8× H200 28.00 3.50
Lambda 8× H100 8× H100 16.00 2.00
CoreWeave 8× H100 8× H100 19.20 2.40

Reserverede 1-årige commits giver 25-35% rabat. AWS p5 on-demand er cirka 3× Lambda for den samme H100 silicium. Oversæt til pr. token: 8× H100 ved Lambda, der kører Llama 3.3 70B FP8 ved ~3,500 tok/s vedvarende → $16/time × 8,760 × 3 = €389,000 over 3 år → €1.96/Mtok ved 60% udnyttelse. Det er 4× en 8× Pro 6000 SE on-prem build (€0.53/Mtok) og 2.5× bare calling Together (€0.81/Mtok).

At leje H100 til at levere inferens til åbne modeller er det værste fra begge verdener: lejepriser for boksen og driften til at køre den. Matematikken fungerer kun, når du har brug for en specifik model, som ingen hoster, og mangler volumen til on-prem. Cloud GPU-udlejning har et ærligt eksempel: burst-træning . En LoRA-finjustering på 8× H100 i 8 timer koster ~$130 hos Lambda. Ingen on-prem TCO slår det for en engangsforeteelse. Logikken overføres ikke til inferens, som er vedvarende og kører 24/7. "Spot"-fælden: spot/preemptible/community-niveauer tilbyder 50-80% rabat, men er afbrydelige. Fint for statsløse inferensreplikaer. For et 18-timers træningsjob, der kontrollerer hvert trin, fordobler to afbrydelser din pris pr. fuldført trin, og du er ikke længere billigere end on-demand.

Skjulte omkostninger, ingen citerer

Cloud: Udgående hastighed på $0.05-0.09/GB rammer, når du sender billeder, lyd eller video tilbage. Logføring tilføjer 5-10% i skala. Genfaktureret kontekst er det værste - alle API'er opkræver fuld prompt for hvert kald, så en agentkontekst på 50 tokens koster 50 inputtokens pr. trin i en 20-trins løkke. Prompt-caching (Anthropic, OpenAI, Google understøtter det alle) reducerer dette med 50-90% på cachelagrede præfikser, men kun hvis du har en arkitektur til det. Produktionshastighedsgrænser starter ved 30-500 TPM og kræver brugshistorik; nye kunder kan ikke køre i skala fra dag ét. SKU'er i EU-regionen er 10-20% flere end i det østlige USA med lavere tilgængelighed.

On-prem: Driftstid ved 0.1-0.3 FTE pr. server er €8-€24/år, ikke medregnet per-Mtok-matematikken. Nedetid kræver en redundant boks eller et elegant cloud-fallback. Elektricitet koster ikke €0.20/kWh overalt — EU's industri i 2026 varierer fra €0.09/kWh (Sverige, Norge vandkraft) til €0.35/kWh (Italien, Irland), Tyskland på €0.18-€0.22/kWh på subsidieret industri, Tjekkiet på €0.18-€0.25/kWh åben kommerciel. For Italien eller Irland stiger hver elektricitetsrække i T01 med 50%. Colo rack koster €100-€300/måned for 4U — €3,600-€10,800 over tre år oven i hardware.

Den offentliggjorte cloudpris er cirka 1.2-1.5 gange den faktiske regning; den offentliggjorte on-prem TCO er cirka 1.2-1.5 gange den samlede ejerandel. Multiplikatorerne udligner sammenligningen.

Ikke-omkostningsfaktorer

Tre ting tilsidesætter prisen pr. Mtok for rigtige købere.

Datasuverænitet. Den største grund til, at europæiske købere går on-prem i 2026, er GDPR plus sektorregler (DORA, NIS2, AI-loven, MDR). At sende produktionsprompter med personoplysninger, lægejournaler eller industrielle hemmeligheder til et amerikansk-hostet endpoint er et kontraktmæssigt problem uanset prisen. SKU'er i EU-regionen betyder ikke EU-kontrolleret. For en reguleret køber er on-prem-præmien ikke en omkostning, det er prisen for at have lov til at implementere.

Latensgrænse. WAN til det nærmeste hostede slutpunkt tilføjer 15-40 ms RTT inden for EU og 80-120 ms transatlantisk. On-prem på et 10 GbE LAN er under et millisekund. For interaktiv chat er WAN-deltaet usynligt mod 800 ms TTFT. For en robotstyringsløkke ( I01 ) eller en stemmeagent på under 300 ms er WAN fatalt.

Tilpasningsmuligheder. Cloud-API'er leverer den model og kvantitet, som udbyderen har valgt. On-prem vælger du model, kvantitet, serveringstakk (vLLM, SGLang, llama.cpp), LoRA-adaptere og spekulativ dekoder. For forskningslaboratorier eller specialiserede produkter er det dette, du køber – prisen pr. Mtok er sekundær.

Hvis ingen af ​​dem gælder, hører køberen hjemme i skyen under break-even. Ikke alle potentielle kunder bør købe en server.

Udarbejdet beslutning: 70B-klasse arbejdsbyrde på to bind

Kundeprofil: SaaS, der udfører dokumentklassificering og opsummering, 70/30 input/output, åben 70B-klassemodel.

Option Ved 100 millioner tok/md. (3 år) Ved 2 B tok/md. (3 år)
Sammen (Llama 3.3 70B) €2,916 €58,320
AWS Bedrock (Llama 3.3 70B) €2,412 €48,240
Claude Sonnet 4.6 (grænsereference) €21,996 €439,920
On-prem 4× 5090 (amortiseret) €27,000 €27,000
Lambda 8× H100 selvhostet €389,000 €389,000

Ved 100 millioner tokens/måned vinder Bedrock med en størrelsesorden i forhold til on-prem; kunden har ikke fortjent boksen. Ved 2 milliarder tokens/måned vinder on-prem afgørende med 1.8-2.2 gange lige så meget som det billigste hostede alternativ. Break-even for denne arbejdsbyrde landede omkring 800 millioner – 1.2 milliarder tokens/måned. Derunder, leje. Derover, eje.

Beslutningsmatrix

Volumen / måned 8B–13B-modellen 32B model 70B model Frontier (Claude / GPT-5)
< 100 millioner tok Cloud API Cloud API Cloud API Cloud API
100–500 millioner tok Cloud API eller 4× L4 Cloud API Cloud API Cloud API
500 M – 1 B 4–8× L4 on-prem 4× 5090 eller Cloud Sky (grundfjeld/sammen) Cloud API
1–5 B tok 8× L4 on-premise 4 × 5090 4× 5090 eller 4× Pro 6000 SE Cloud + on-prem hybrid
5–50 B tok 8× L4-klynge 4× Pro 6000 BW SE 4–8× Pro 6000 BW SE Frontier Cloud + hvile på stedet
> 50 B tok Multinode L4 8× Pro 6000 BW SE 8× Pro 6000 SE × N Virksomhedstakster + hybrid

Konservativ — en reguleret køber rykker on-prem-kolonnen én række tidligere; en eksperimentel køber én række senere. Frontier-kolonnen er speciel: ingen on-prem-build erstatter Claude Opus 4.7 eller GPT-5. Det er kvalitets-SKU'er, du kalder, når det er nødvendigt, ikke arbejdsbelastninger, du hoster.

Den ærlige holdning

De fleste potentielle kunder, der kommer ind og tror, ​​de har brug for en server, har ikke. Ved typiske volumener – 5-50 millioner tokens/måned for et tidligt produkt, 50-500 millioner for mellemfasen – vinder cloud-API'er i yderligere tolv til fireogtyve måneder. Det rigtige svar er "brug Together eller Bedrock, hold øje med dit månedlige forbrug, ring til os, når det overstiger €1,500/måned vedvarende."

Købere, for hvem on-prem-løsninger giver mening i 2026, falder i tre former. Reguleret : data må ikke forlade bygningen. Vedvarende i stor skala : 1 B+ tokens/måned på en 70B-klasse model, hvor matematikken vinder med 2-3 gange. Robotteknologi eller lav latenstid : WAN-gulvet ødelægger applikationen. Omkring 30-40 % af vores potentielle kunder passer til en. For de andre 60-70 % er cloud-API'er i 2026 et bemærkelsesværdigt produkt, og de bør fortsætte med at bruge en, indtil matematikken ændrer sig.

Træning er en anden snak. Næsten alle arbejdsopgaver på Kentino AI-skala (LoRA, QLoRA, finjustering af 7B-32B) er billigere on-prem end cloud-GPU-udlejning - boksen kører 100% under kørslen. Undtagelsen er hyperskala-træning (fuld prætræning på 70B+, RLHF i skala), hvor du har brug for 8× H100 med NVLink, som vi ikke sælger ( W07 dækker hvorfor). Lej det, kør det, tag vægtene med hjem.

Hvad skal jeg gøre næste

Kør denne sekvens, før du taler med en leverandør:

  1. Mål den nuværende månedlige tokenvolumen, opdelt efter modelniveau. Hvis du ikke kan, så instrumentér den i to uger. Uden dette tal er hvert efterfølgende trin et gæt.
  2. Projekt seks måneder ude i fremtiden, konservativt — gang med 1.5–2. LLM-regninger vokser hurtigere end produktet, fordi kontekster udvides, og agenter tilføjer trin.
  3. Identificér niveauerne ærligt. Fraktion der kræver grænsekvalitet? Fraktionsfin på Sonnet 4.6 / GPT-5 mini? Fraktionsfin på Llama 3.3 70B? Typisk fordeling: 5% / 25% / 70%.
  4. Beregn cloud-regningen ved forventet volumen efter niveau fra tabellen ovenfor. Det er din konkurrent.
  5. Beregning på stedet for en 4× 5090 eller 4× Pro 6000 SE boks ved projekteret volumen med T01.
  6. Hvis skyen overstiger on-prem med mindre end 1.5 gange, skal du forblive i skyen. Drift, nedetid og kapitaludgifter æder den lille gevinst.
  7. Hvis skyen overstiger on-prem med 2 gange eller mere, er on-prem-tilfældet reelt. Suverænitet, latenstid og tilpasning bliver afgørende faktorer – de forstærker næsten altid on-prem-funktioner i den skala.
  8. Hvis det er reguleret eller latenstidsbundet, så spring matematikken over. Du køber på stedet uanset hvad. Størrelse med T01 og W07.

Opfølgningen T03 fungerer vedvarende vs. burst — når hybrid giver mening, hvordan man dimensionerer baseline on-prem med cloud overflow. Krydsreferencer: T01 (TCO og tok/s pr. GPU), W07 (GPU-valg), I04 (den elektriske matematik på vægsiden bag €/kWh-antagelsen).

En enkelt sætning at huske: Spørgsmålet om prisen pr. million tokens har intet generelt svar – det har et specifikt svar for din arbejdsbyrde, din volumen, dit modelniveau og dit lands elpris. Undersøg tallene, før du underskriver noget.