Pris pr. million tokens: On-prem vs. Cloud
Der er tre ærlige måder at købe LLM-inferens på i 2026: ring til en andens hostede endpoint og betal pr. token (cloud LLM API), lej en GPU pr. time og kør din egen model (cloud GPU-udlejning), eller køb en server og kør den i dit eget rack (on-prem). Prisen på en million tokens ser dramatisk forskellig ud på tværs af de tre, og ikke i den rækkefølge, som de fleste købere antager.
Denne artikel beregner i EUR ekskl. moms. Målgruppe: En person, der beslutter, om de vil fortsætte med at betale OpenAI månedligt, skifte til en hosted open-model-udbyder, leje en H100 eller købe en 4-/8-GPU-boks. Vi citerer priser for maj 2026 og afslutter med et fem minutters beslutningsforløb. Krydsreferencer: T01 pr. GPU TCO, W07 kortvalg, I04 vægsidetal.
De tre platforme
Cloud LLM API. OpenAI, Anthropic, Google, Together, Fireworks. Betal pr. token ind og pr. token ud. Ingen inaktive omkostninger, ingen capex, ingen driftsomkostninger. Heller ikke noget modelvalg ud over deres katalog, ingen LoRA, ingen kvantitativ kontrol.
Leje af cloud-GPU'er. AWS p5/p5e/p6, Azure ND H200/B200, GCP A3 Ultra, plus specialiserede clouds (Lambda, CoreWeave, Nebius, RunPod). Lej en GPU-instans pr. time, og kør hvad som helst. Du medbringer modellen, serveringsstakken og operationerne. Du betaler, uanset om du serverer én token eller én milliard i den time.
On-prem. Køb en 4-GPU eller 8-GPU boks. Opbevar den i rack, din bygning eller et kompleks. Du medbringer strøm, køling, netværk og drift. Afskriv over tre år. Marginalomkostningerne ved en token er elektricitet. Faste omkostninger er alt, hvad du allerede har betalt.
Tre forskellige omkostningsformer — rent variable, rent faste med afgrund, capex plus marginale — der nulstiller hinanden på forskellige punkter langs gennemløbsaksen.
Cloud LLM API-priser
USD pr. million tokens, offentlige prissider, maj 2026. EUR på EUR/USD ≈ 1.08.
| Provider | Model | Input $/Mtok | Output $/Mtok | Input €/Mtok | Produktion €/Mtok |
|---|---|---|---|---|---|
| OpenAI | GPT-5 | 1.25 | 10.00 | 1.16 | 9.26 |
| OpenAI | GPT-5 mini | 0.25 | 2.00 | 0.23 | 1.85 |
| OpenAI | GPT-5 nano | 0.05 | 0.40 | 0.05 | 0.37 |
| OpenAI | GPT-4.1 / o3 | 2.00 | 8.00 | 1.85 | 7.41 |
| Antropisk | Claude Opus 4.7 | 15.00 | 75.00 | 13.89 | 69.44 |
| Antropisk | Claude Sonnet 4.6 | 3.00 | 15.00 | 2.78 | 13.89 |
| Antropisk | Claude Haiku 4.5 | 1.00 | 5.00 | 0.93 | 4.63 |
| Gemini 2.5 Pro | 1.25 | 10.00 | 1.16 | 9.26 | |
| Gemini 2.5 Flash | 0.30 | 2.50 | 0.28 | 2.31 | |
| Gemini 2.5 Flash-Lite | 0.10 | 0.40 | 0.09 | 0.37 | |
| Sammen | Lama 3.3 70B | 0.88 | 0.88 | 0.81 | 0.81 |
| Sammen | Qwen 2.5 72B | 1.20 | 1.20 | 1.11 | 1.11 |
| Sammen | DeepSeek-V3 | 1.25 | 1.25 | 1.16 | 1.16 |
| Sammen | Lama 3.1 405B | 3.50 | 3.50 | 3.24 | 3.24 |
| AWS-grundfjeld | Lama 3.3 70B | 0.72 | 0.72 | 0.67 | 0.67 |
| Azure | Lama 3.3 70B | 0.59 | 0.79 | 0.55 | 0.73 |
To ærlige læsninger. Lukkede Frontier-modeller (Claude Opus 4.7, GPT-5, Gemini 2.5 Pro) er en størrelsesorden dyrere end hostede åbne model-API'er, der betjener Llama 70B eller DeepSeek-V3 - prisen for "smartest nu" versus "bedste åbne vægte nu". For de fleste produktionsbelastninger (RAG, agenttrin, kode, klassificering) er Sonnet 4.6 eller GPT-5 mini driftspunktet, ikke flagskibet. Output-tokens koster tre til syv gange input på lukkede udbydere og nogenlunde det samme på åbne model-hosts. Hyperscaler åbne model-SKU'er (Bedrock, Azure) opkræver en præmie på 30-80% i forhold til Together eller Fireworks for den samme model - du betaler for IAM-integration og en enkelt regning, ikke billigere tokens.
Omkostninger pr. Mtok på stedet
Omkostninger pr. Mtok er de samlede omkostninger over tre år divideret med antallet af tokens, der betjenes over tre år. Nævneren afhænger af udnyttelsen; tælleren er nogenlunde fast.
On-prem €/Mtok =
(capex + 3y electricity + 3y maintenance + 3y ops) /
(sustained tok/s × utilization × 3 × 8,760 × 3,600 / 1e6)
Tilslutning af TCO pr. GPU fra T01 ved 60% udnyttelse, €0.20/kWh, PUE 1.4:
| Byg | 3 års samlede ejeromkostninger € | Vedvarende tok/s | Tokens/3 år (Mtok) | € / Mtok |
|---|---|---|---|---|
| 4× RTX 5090 (Llama 70B INT4 TP=4) | 27,000 | 1,800 | 102,000 | 0.26 |
| 4× Pro 6000 BW SE (Llama 70B FP8 DP) | 58,000 | 1,920 | 109,000 | 0.53 |
| 4× Pro 6000 BW SE (Qwen 32B INT4) | 58,000 | 2,400 | 136,000 | 0.43 |
| 8× Pro 6000 BW SE (Llama 70B FP8 DP) | 115,000 | 3,800 | 215,000 | 0.53 |
| 8× L4 (Llama 8B FP8) | 36,000 | 5,200 | 295,000 | 0.12 |
Sænk udnyttelsen til 30 %, og hvert tal fordobles. Hvis du skubber til 80 %, lander L4-serverede 8B på €0.09/Mtok, hvilket er billigere end alle cloud-API'er i den klasse. Matematikken kollapser til under 25 % udnyttelse, fordi den samlede ejerandel (TCO) domineres af de anlægsomkostninger, du betalte, uanset om du brugte den eller ej.
Nulpunktet
Læg skylinjen oven på hinanden. Llama 70B ved 100 millioner tokens/måned , balanceret 50/50, på Together: 100 × €0.81 = €81/måned → €2,916 over tre år. Mod en 4× 5090 on-prem ved €27,000 vinder Together med €24,000. Ved 100 millioner tokens/måned er on-prem fuldstændig forkert.
Skub til 1 milliard tokens/måned : 1,000 × €0.81 = €810/måned → €29,160 over tre år. Tilsammen er 4 × 5090 inden for €2,000. Med 1.5 milliarder/måned vinder on-prem betydeligt.
Break-even for 70B-klasse inferens vs. den billigste open-model hostede API lander omkring 1.0-1.5 B tokens pr. måned, opretholdt på en 4× 5090. For closed frontier API'er (Claude Sonnet 4.6 til €8.34/Mtok blandet, GPT-5 til €5.21/Mtok blandet) bevæger break-even sig til 80-150 M tokens/måned - cloud-linjen er en størrelsesorden stejlere.
Det er det vigtigste tal i denne artikel: break-even er ikke "100 millioner tokens/måned for alting." Det er arbejdsbelastningsspecifikt og afhænger helt af, hvilken cloud-linje du konkurrerer med. Købere, der siger "vi når 50 millioner, vi skal gå on-prem", sammenligner normalt med Claude Opus, hvor de har ret – og ignorerer, at en arbejdsbelastningsflytning fra Opus til Sonnet 4.6 sparer dem fem gange mere end en flytning fra Sonnet til on-prem med den mængde.
Cloud GPU-udlejning — den midterste mulighed
Timepriser pr. GPU, maj 2026 on-demand:
| Provider | Instans | GPU'er | $/time-forekomst | $/GPU-time |
|---|---|---|---|---|
| AWS | p5.48xlarge | 8× H100 SXM | 55.18 | 6.90 |
| AWS | p5e.48xlarge | 8× H200 SXM | 30.00 | 3.75 |
| AWS | p6-b200 | 8× B200 | 74.88 | 9.36 |
| Azure | ND H200 v5 | 8× H200 | 31.00 | 3.88 |
| GCP | a3-ultraglutamat-8g | 8× H200 | 28.00 | 3.50 |
| Lambda | 8× H100 | 8× H100 | 16.00 | 2.00 |
| CoreWeave | 8× H100 | 8× H100 | 19.20 | 2.40 |
Reserverede 1-årige commits giver 25-35% rabat. AWS p5 on-demand er cirka 3× Lambda for den samme H100 silicium. Oversæt til pr. token: 8× H100 ved Lambda, der kører Llama 3.3 70B FP8 ved ~3,500 tok/s vedvarende → $16/time × 8,760 × 3 = €389,000 over 3 år → €1.96/Mtok ved 60% udnyttelse. Det er 4× en 8× Pro 6000 SE on-prem build (€0.53/Mtok) og 2.5× bare calling Together (€0.81/Mtok).
At leje H100 til at levere inferens til åbne modeller er det værste fra begge verdener: lejepriser for boksen og driften til at køre den. Matematikken fungerer kun, når du har brug for en specifik model, som ingen hoster, og mangler volumen til on-prem. Cloud GPU-udlejning har et ærligt eksempel: burst-træning . En LoRA-finjustering på 8× H100 i 8 timer koster ~$130 hos Lambda. Ingen on-prem TCO slår det for en engangsforeteelse. Logikken overføres ikke til inferens, som er vedvarende og kører 24/7. "Spot"-fælden: spot/preemptible/community-niveauer tilbyder 50-80% rabat, men er afbrydelige. Fint for statsløse inferensreplikaer. For et 18-timers træningsjob, der kontrollerer hvert trin, fordobler to afbrydelser din pris pr. fuldført trin, og du er ikke længere billigere end on-demand.
Skjulte omkostninger, ingen citerer
Cloud: Udgående hastighed på $0.05-0.09/GB rammer, når du sender billeder, lyd eller video tilbage. Logføring tilføjer 5-10% i skala. Genfaktureret kontekst er det værste - alle API'er opkræver fuld prompt for hvert kald, så en agentkontekst på 50 tokens koster 50 inputtokens pr. trin i en 20-trins løkke. Prompt-caching (Anthropic, OpenAI, Google understøtter det alle) reducerer dette med 50-90% på cachelagrede præfikser, men kun hvis du har en arkitektur til det. Produktionshastighedsgrænser starter ved 30-500 TPM og kræver brugshistorik; nye kunder kan ikke køre i skala fra dag ét. SKU'er i EU-regionen er 10-20% flere end i det østlige USA med lavere tilgængelighed.
On-prem: Driftstid ved 0.1-0.3 FTE pr. server er €8-€24/år, ikke medregnet per-Mtok-matematikken. Nedetid kræver en redundant boks eller et elegant cloud-fallback. Elektricitet koster ikke €0.20/kWh overalt — EU's industri i 2026 varierer fra €0.09/kWh (Sverige, Norge vandkraft) til €0.35/kWh (Italien, Irland), Tyskland på €0.18-€0.22/kWh på subsidieret industri, Tjekkiet på €0.18-€0.25/kWh åben kommerciel. For Italien eller Irland stiger hver elektricitetsrække i T01 med 50%. Colo rack koster €100-€300/måned for 4U — €3,600-€10,800 over tre år oven i hardware.
Den offentliggjorte cloudpris er cirka 1.2-1.5 gange den faktiske regning; den offentliggjorte on-prem TCO er cirka 1.2-1.5 gange den samlede ejerandel. Multiplikatorerne udligner sammenligningen.
Ikke-omkostningsfaktorer
Tre ting tilsidesætter prisen pr. Mtok for rigtige købere.
Datasuverænitet. Den største grund til, at europæiske købere går on-prem i 2026, er GDPR plus sektorregler (DORA, NIS2, AI-loven, MDR). At sende produktionsprompter med personoplysninger, lægejournaler eller industrielle hemmeligheder til et amerikansk-hostet endpoint er et kontraktmæssigt problem uanset prisen. SKU'er i EU-regionen betyder ikke EU-kontrolleret. For en reguleret køber er on-prem-præmien ikke en omkostning, det er prisen for at have lov til at implementere.
Latensgrænse. WAN til det nærmeste hostede slutpunkt tilføjer 15-40 ms RTT inden for EU og 80-120 ms transatlantisk. On-prem på et 10 GbE LAN er under et millisekund. For interaktiv chat er WAN-deltaet usynligt mod 800 ms TTFT. For en robotstyringsløkke ( I01 ) eller en stemmeagent på under 300 ms er WAN fatalt.
Tilpasningsmuligheder. Cloud-API'er leverer den model og kvantitet, som udbyderen har valgt. On-prem vælger du model, kvantitet, serveringstakk (vLLM, SGLang, llama.cpp), LoRA-adaptere og spekulativ dekoder. For forskningslaboratorier eller specialiserede produkter er det dette, du køber – prisen pr. Mtok er sekundær.
Hvis ingen af dem gælder, hører køberen hjemme i skyen under break-even. Ikke alle potentielle kunder bør købe en server.
Udarbejdet beslutning: 70B-klasse arbejdsbyrde på to bind
Kundeprofil: SaaS, der udfører dokumentklassificering og opsummering, 70/30 input/output, åben 70B-klassemodel.
| Option | Ved 100 millioner tok/md. (3 år) | Ved 2 B tok/md. (3 år) |
|---|---|---|
| Sammen (Llama 3.3 70B) | €2,916 | €58,320 |
| AWS Bedrock (Llama 3.3 70B) | €2,412 | €48,240 |
| Claude Sonnet 4.6 (grænsereference) | €21,996 | €439,920 |
| On-prem 4× 5090 (amortiseret) | €27,000 | €27,000 |
| Lambda 8× H100 selvhostet | €389,000 | €389,000 |
Ved 100 millioner tokens/måned vinder Bedrock med en størrelsesorden i forhold til on-prem; kunden har ikke fortjent boksen. Ved 2 milliarder tokens/måned vinder on-prem afgørende med 1.8-2.2 gange lige så meget som det billigste hostede alternativ. Break-even for denne arbejdsbyrde landede omkring 800 millioner – 1.2 milliarder tokens/måned. Derunder, leje. Derover, eje.
Beslutningsmatrix
| Volumen / måned | 8B–13B-modellen | 32B model | 70B model | Frontier (Claude / GPT-5) |
|---|---|---|---|---|
| < 100 millioner tok | Cloud API | Cloud API | Cloud API | Cloud API |
| 100–500 millioner tok | Cloud API eller 4× L4 | Cloud API | Cloud API | Cloud API |
| 500 M – 1 B | 4–8× L4 on-prem | 4× 5090 eller Cloud | Sky (grundfjeld/sammen) | Cloud API |
| 1–5 B tok | 8× L4 on-premise | 4 × 5090 | 4× 5090 eller 4× Pro 6000 SE | Cloud + on-prem hybrid |
| 5–50 B tok | 8× L4-klynge | 4× Pro 6000 BW SE | 4–8× Pro 6000 BW SE | Frontier Cloud + hvile på stedet |
| > 50 B tok | Multinode L4 | 8× Pro 6000 BW SE | 8× Pro 6000 SE × N | Virksomhedstakster + hybrid |
Konservativ — en reguleret køber rykker on-prem-kolonnen én række tidligere; en eksperimentel køber én række senere. Frontier-kolonnen er speciel: ingen on-prem-build erstatter Claude Opus 4.7 eller GPT-5. Det er kvalitets-SKU'er, du kalder, når det er nødvendigt, ikke arbejdsbelastninger, du hoster.
Den ærlige holdning
De fleste potentielle kunder, der kommer ind og tror, de har brug for en server, har ikke. Ved typiske volumener – 5-50 millioner tokens/måned for et tidligt produkt, 50-500 millioner for mellemfasen – vinder cloud-API'er i yderligere tolv til fireogtyve måneder. Det rigtige svar er "brug Together eller Bedrock, hold øje med dit månedlige forbrug, ring til os, når det overstiger €1,500/måned vedvarende."
Købere, for hvem on-prem-løsninger giver mening i 2026, falder i tre former. Reguleret : data må ikke forlade bygningen. Vedvarende i stor skala : 1 B+ tokens/måned på en 70B-klasse model, hvor matematikken vinder med 2-3 gange. Robotteknologi eller lav latenstid : WAN-gulvet ødelægger applikationen. Omkring 30-40 % af vores potentielle kunder passer til en. For de andre 60-70 % er cloud-API'er i 2026 et bemærkelsesværdigt produkt, og de bør fortsætte med at bruge en, indtil matematikken ændrer sig.
Træning er en anden snak. Næsten alle arbejdsopgaver på Kentino AI-skala (LoRA, QLoRA, finjustering af 7B-32B) er billigere on-prem end cloud-GPU-udlejning - boksen kører 100% under kørslen. Undtagelsen er hyperskala-træning (fuld prætræning på 70B+, RLHF i skala), hvor du har brug for 8× H100 med NVLink, som vi ikke sælger ( W07 dækker hvorfor). Lej det, kør det, tag vægtene med hjem.
Hvad skal jeg gøre næste
Kør denne sekvens, før du taler med en leverandør:
- Mål den nuværende månedlige tokenvolumen, opdelt efter modelniveau. Hvis du ikke kan, så instrumentér den i to uger. Uden dette tal er hvert efterfølgende trin et gæt.
- Projekt seks måneder ude i fremtiden, konservativt — gang med 1.5–2. LLM-regninger vokser hurtigere end produktet, fordi kontekster udvides, og agenter tilføjer trin.
- Identificér niveauerne ærligt. Fraktion der kræver grænsekvalitet? Fraktionsfin på Sonnet 4.6 / GPT-5 mini? Fraktionsfin på Llama 3.3 70B? Typisk fordeling: 5% / 25% / 70%.
- Beregn cloud-regningen ved forventet volumen efter niveau fra tabellen ovenfor. Det er din konkurrent.
- Beregning på stedet for en 4× 5090 eller 4× Pro 6000 SE boks ved projekteret volumen med T01.
- Hvis skyen overstiger on-prem med mindre end 1.5 gange, skal du forblive i skyen. Drift, nedetid og kapitaludgifter æder den lille gevinst.
- Hvis skyen overstiger on-prem med 2 gange eller mere, er on-prem-tilfældet reelt. Suverænitet, latenstid og tilpasning bliver afgørende faktorer – de forstærker næsten altid on-prem-funktioner i den skala.
- Hvis det er reguleret eller latenstidsbundet, så spring matematikken over. Du køber på stedet uanset hvad. Størrelse med T01 og W07.
Opfølgningen T03 fungerer vedvarende vs. burst — når hybrid giver mening, hvordan man dimensionerer baseline on-prem med cloud overflow. Krydsreferencer: T01 (TCO og tok/s pr. GPU), W07 (GPU-valg), I04 (den elektriske matematik på vægsiden bag €/kWh-antagelsen).
En enkelt sætning at huske: Spørgsmålet om prisen pr. million tokens har intet generelt svar – det har et specifikt svar for din arbejdsbyrde, din volumen, dit modelniveau og dit lands elpris. Undersøg tallene, før du underskriver noget.
Dette er en del af Kentino Wiki, en referenceserie om AI-beregning, robotteknologi og de systemer, der forbinder dem. Kommentarer og rettelser er velkomne på info@kentino.com.