AI-modellpriser spriker fra 0,05 til 12,50 dollar
Inngangsprisen på AI-modeller varierer fra 0,05 til 12,50 dollar per million tokens. Her er regnestykket norske SMB-er bør gjøre før de bytter leverandør.

Nøkkelpunkter per 30. august 2026:
- Inngangsprisen per million tokens spenner fra 0,05 dollar hos DeepInfra til 12,50 dollar hos OpenAI i samme oversikt (llm-stats.com).
- 130 modellutgivelser ble sporet på tolv måneder frem til 26. august 2026, og 45 prosent av dem hadde åpne vekter (benchlm.ai).
- Kontekstvinduet varierer fra 4K tokens hos enkelte leverandører til 2,0 millioner hos xAI, og det treffer regningen hardere enn listeprisen (llm-stats.com).
- Maskinvaren flytter prisen: NVIDIA oppgir 15 ganger ytelsesfordel for DeepSeek-R1 på Blackwell GB200 NVL72 mot Hopper H200 (NVIDIA).
- AI-forordningen blir fullt anvendelig 24 måneder etter ikrafttredelse, og åpenhetskravene følger modellen du bytter til (EU-kommisjonen).
Hva priskrigen mellom AI-modellene faktisk handler om
Det er ikke lenger meningsfullt å snakke om «prisen på AI». Aggregatoren llm-stats.com sporer over 500 språkmodeller og mer enn 359 modellutgivelser på tvers av 59 organisasjoner og 15 API-leverandører (llm-stats.com). Innenfor det landskapet går inngangsprisen per million tokens fra 0,05 dollar i den billigste enden til 12,50 dollar i den dyreste. Forskjellen mellom bunn og topp i den samme oversikten er ikke marginal, den er strukturell.
For en norsk SMB betyr det noe helt konkret: valget av modell er blitt en budsjettpost du kan påvirke, ikke en teknisk detalj utviklerne fikser. Samtidig er listeprisen bare det ene av flere tall som avgjør hva fakturaen faktisk lander på. Denne artikkelen går gjennom prisbildet, regnestykket du selv kan gjøre, og de fem spørsmålene som avgjør om et leverandørbytte er verdt arbeidet.
Fra en leverandør til et marked
For få år siden var praktisk talt alle norske AI-prosjekter bygget mot en håndfull API-er. I dag fører llm-stats.com opp 69 aktive modeller hos OpenAI, 60 hos Google, 38 hos xAI og 22 hos Anthropic, i tillegg til rene inferensleverandører som Fal med 97 aktive modeller og Replicate med 63 (llm-stats.com). Markedet har med andre ord fått mellomledd: selskaper som ikke lager modellene selv, men som kjører dem for deg til en annen pris.
Dette er årsaken til at prisspennet er så bredt. Du betaler ikke bare for modellens evner, du betaler for hvem som drifter den, på hvilken maskinvare og med hvilke garantier. To leverandører kan tilby den samme åpne modellen til svært ulik pris, og forskjellen ligger i drift, ikke i intelligens.
Konsekvensen for innkjøp er at «hvilken modell skal vi bruke» og «hvem skal kjøre den for oss» er blitt to separate spørsmål. Mange SMB-er behandler dem fortsatt som ett, og betaler for det.
Hvorfor listeprisen er et dårlig beslutningsgrunnlag alene
Alura mener at listepris per million tokens sier lite alene. Volum, kontekstvindu og hvor mange forsøk en oppgave krever avgjør den reelle regningen. En modell til en tiendedel av prisen som trenger tre forsøk på å levere brukbart svar, og som må mates med hele dokumentet hver gang, er ikke billigere. Den er bare billigere per token.
Vi har skrevet mer utfyllende om hvordan enhetsprisen kan falle samtidig som totalregningen stiger, i analysen av token-kostnader for AI-agenter. Kortversjonen: når prisen faller, øker bruken raskere enn prisen synker, og agentiske arbeidsflyter forbruker langt flere tokens per oppgave enn en enkel chat gjør.
Det praktiske rådet er derfor enkelt. Bruk listeprisen til å lage en kortliste, aldri til å ta beslutningen.
Prisbildet i august 2026
Tabellen under viser inngangspris per million tokens slik llm-stats.com fører den opp for de største API-leverandørene. Inngangspris betyr her det laveste og høyeste tallet i leverandørens oppgitte spenn, ikke prisen for en bestemt modell.
| Leverandør | Inngangspris per million tokens |
|---|---|
| DeepInfra | 0,05 til 1,74 dollar |
| OpenAI | 0,10 til 12,50 dollar |
| Novita | 0,10 til 3,00 dollar |
| xAI | 0,20 til 3,00 dollar |
| 0,25 til 2,50 dollar | |
| Fireworks | 0,30 til 3,00 dollar |
| Anthropic | 1,00 til 10,00 dollar |
Kilde for alle tallene i tabellen: llm-stats.com, august 2026. Kontekstvinduene til de samme leverandørene behandles i en egen seksjon lenger nede, fordi de påvirker regningen på en helt annen måte enn listeprisen. Tallene endrer seg, og poenget er ikke å pugge dem, men å se formen på markedet.
Spennet innenfor en og samme leverandør
Det som overrasker flest som ser tabellen for første gang, er hvor stort spennet er innad hos en leverandør. Hos OpenAI går inngangsprisen fra 0,10 til 12,50 dollar per million tokens, altså to helt ulike prisklasser under samme merkenavn (llm-stats.com). Hos DeepInfra er hele spennet, fra 0,05 til 1,74 dollar, lavere enn OpenAIs øvre nivå.
Det betyr at «vi bytter fra OpenAI til noe billigere» ofte er feil formulert problem. Det riktige spørsmålet er om du bruker riktig modell hos leverandøren du allerede har. Mange oppgaver som i dag kjøres på toppmodellen, klassifisering, uttrekk, oppsummering av korte tekster, kan flyttes ned et hakk uten at kvaliteten faller merkbart.
Å rydde i modellvalget internt er nesten alltid raskere enn å bytte leverandør, og det gir et bedre sammenligningsgrunnlag hvis du senere likevel skal bytte.
Når aggregatortall spriker
Vær kritisk til prislister du ikke har lest definisjonen til. På samme oversikt der Anthropics inngangspris oppgis til 1,00 til 10,00 dollar, står Claude Opus 5 oppført til 500,00 dollar per million tokens, og GPT-5.6 Cyber til 1250,00 dollar (llm-stats.com). To tall fra samme kilde, med ulikt grunnlag.
Slike sprik skyldes som regel at kolonner måler forskjellige ting: pris for inn-tokens mot ut-tokens, pris med eller uten resonneringstokens, eller kostnad for en hel benchmark-kjøring omregnet til en enhetspris. Ingen av delene er feil, men de er ikke sammenlignbare.
Regelen er å alltid verifisere mot leverandørens egen prisside før du legger et tall inn i budsjettet, og å notere hvilken enhet tallet er i. For Anthropic-modellene har vi samlet gjeldende priser og norske bruksmønstre i Claude-guiden.
Hva prisen ikke inkluderer
Tokenprisen dekker inferens. Den dekker ikke vektorbase, lagring, logging, overvåking, evalueringskjøringer, eller timene teamet bruker på å vedlikeholde promptene. For små volumer er disse postene ofte større enn selve modellregningen.
Den dekker heller ikke feilkostnaden. Et svar som er galt nok til at en ansatt må gjøre jobben på nytt, koster mer enn differansen mellom to modeller. Dette er grunnen til at kvalitetsmåling må inn i regnestykket, ikke ved siden av det.
Ta med begge kategoriene når du sammenligner. Ellers optimaliserer du en post som kanskje utgjør en mindre del av totalen.
Les også: Claude AI-guiden: modeller, priser og norsk bruk i 2026. Alt du trenger å vite om Claude AI: modeller (Opus, Sonnet, Haiku), Claude Code, Claude Mythos, priser, norsk ...
Rammeverk for å regne ut din faktiske modellkostnad
Regnestykket er enklere enn folk tror, men det har flere ledd enn pris ganger volum. Kjernen er: antall oppgaver, tokens per oppgave inn og ut, antall forsøk per fullførte oppgave, og prisen per million tokens for hver retning. Alle fem må være med, ellers får du et tall som ser bra ut på lysbildet og feil på fakturaen.
| Variabel | Hva den betyr | Hvor du henter den |
|---|---|---|
| Oppgaver per måned | Antall ganger arbeidsflyten faktisk kjøres | Logg i egen applikasjon |
| Inn-tokens per oppgave | Prompt, systeminstruks, hentet kontekst, historikk | Leverandørens forbruksdashbord |
| Ut-tokens per oppgave | Svaret, inkludert eventuelle resonneringstokens | Leverandørens forbruksdashbord |
| Forsøk per fullført oppgave | Hvor mange kall som kreves før svaret er brukbart | Egen evaluering, ikke leverandørens tall |
| Pris inn og pris ut | Ulik pris for de to retningene hos de fleste | Leverandørens prisside |
Sett tallene inn i den enkle formen: (inn-tokens × prisen inn + ut-tokens × prisen ut) delt på en million, ganget med antall oppgaver, ganget med forsøksfaktoren. Gjør det for dagens leverandør først. Det tallet er referansen din.
Forsøksfaktoren er den skjulte multiplikatoren
Ingen prisliste oppgir hvor mange forsøk en modell trenger. Likevel er det ofte den variabelen som snur en sammenligning. Hvis en billigere modell krever et ekstra kall i en av tre tilfeller, spiser det raskt opp en prisfordel som så solid ut i tabellen.
Forsøksfaktoren måler du bare hos deg selv, på dine egne oppgaver. Den er ikke overførbar fra en benchmark, og den varierer mellom oppgavetyper: strukturert uttrekk fra faktura oppfører seg helt annerledes enn fritekst-oppsummering av møtereferat.
Praktisk grep: logg antall kall per fullførte oppgave i en uke før du gjør noe annet. Uten det tallet er enhver kostnadssammenligning et estimat forkledd som et regnestykke.
Skill mellom faste og variable AI-kostnader
Modellkostnaden er variabel og skalerer med bruk. Integrasjonsarbeid, evalueringsoppsett, tilgangsstyring og dokumentasjon er faste kostnader som påløper uansett volum. Et bytte flytter alltid noe fra den variable kolonnen til den faste.
For en SMB med moderat volum kan de faste kostnadene ved et bytte overstige besparelsen i flere kvartaler. Da er svaret ikke å la være å bytte, men å bygge slik at neste bytte blir billigere enn dette.
Det er nettopp derfor abstraksjonslaget mellom applikasjonen din og modellen er verdt arbeidet. Det gjør fremtidige bytter til en variabel kostnad i stedet for et prosjekt.
Regn i kroner, ikke i tokens
Tokens er en teknisk enhet som få ledere har intuisjon for. Konverter alltid til månedlig kostnad i kroner per arbeidsflyt før tallet går til ledergruppen. Da blir sammenligningen mot alternativet, som oftest er timer brukt av en ansatt, mulig å gjøre.
Legg også inn valutarisiko. Prisene er i dollar, inntektene dine er i kroner, og et AI-budsjett satt i januar kan se annerledes ut i oktober uten at leverandøren har rørt prisen.
Til slutt: sett et tak. Kostnadsvarsler og hardt tak per prosjekt er billig forsikring mot en løkke som kjører i helgen.
Fem spørsmål å stille før du bytter AI-leverandør
Et bytte er sjelden feil, men det er ofte for tidlig. Disse fem spørsmålene avgjør om jobben er verdt det. Klarer du ikke å svare på et av dem med tall, har du funnet neste oppgave.
| Spørsmål | Hva du ser etter | Rødt flagg |
|---|---|---|
| 1. Hva koster dagens oppsett per måned per arbeidsflyt? | Et tall fra faktisk logg, ikke estimat | «Rundt et par tusen i måneden» |
| 2. Har vi en fasit å måle kvalitet mot? | Et testsett med riktige svar for egne oppgaver | Kvalitet vurderes ved at noen «prøver litt» |
| 3. Hvor mye kode må endres? | Kall samlet bak ett internt grensesnitt | Leverandørens SDK kalt fra tjue filer |
| 4. Hva skjer med data og databehandleravtale? | Behandlingssted, underleverandører, sletting, logging | Ingen har lest avtalen siden signering |
| 5. Hva er kostnaden ved å bli værende? | Differanse over tolv måneder mot arbeidet ved bytte | Bytte vurderes bare når noen blir irritert |
Legg merke til at bare ett av spørsmålene handler om pris. De fire andre handler om hvor lett bygget ditt er å flytte, og det er der de fleste SMB-er faktisk taper penger.
Bytter du modell eller arkitektur?
Å bytte fra en modell til en annen hos samme leverandør er som regel en konfigurasjonsendring. Å bytte leverandør berører autentisering, feilhåndtering, formatet på verktøykall, hvordan strukturert utdata defineres, og hvordan strømming oppfører seg. Det er to helt ulike prosjekter.
Vurder derfor rekkefølgen: rydd i modellvalget internt, mål effekten, og gjør leverandørbyttet først hvis gevinsten fortsatt er der. En sammenligning av et konkret slikt valg finner du i gjennomgangen av MAI-Thinking-1 i Azure.
Alura mener at med 130 modellutgivelser på tolv måneder bør SMB-er bygge løsninger som kan bytte modell, ikke låse seg til en leverandør (benchlm.ai). Det er en arkitekturbeslutning, og den tas best før du trenger den.
Hva koster selve flyttingen?
Sett opp tre poster: utviklingstimer for integrasjonen, timer til ny evaluering av kvalitet, og en periode med dobbel drift mens du sammenligner. Den siste posten glemmes nesten alltid, og den er reell.
Legg til risikoen for regresjon. En modell som scorer likt totalt kan være merkbart dårligere på en oppgavetype som betyr mye for dere. Uten et testsett oppdager du det først når en kunde klager.
Hvis summen av disse tre postene ikke er tjent inn i løpet av rimelig tid, er svaret å utsette byttet og heller bruke tiden på å gjøre neste bytte billigere.
Slik tester du en ny modell mot dagens oppsett på to uker
En strukturert test er den billigste forsikringen du kan kjøpe før et bytte. To uker holder for de fleste SMB-arbeidsflyter, forutsatt at du bruker den første uken på å bygge fasit i stedet for å leke med den nye modellen.
Målet er ikke å finne den beste modellen i verden. Målet er å finne ut om den nye modellen er minst like god som dagens på nettopp dine oppgaver, til lavere total kostnad.
Uke 1: bygg fasiten
Plukk ut mellom femti og hundre reelle oppgaver fra loggen, gjerne skjevfordelt mot de vanskelige. Skriv ned hva riktig svar er for hver av dem. Dette er kjedelig arbeid, og det er hele grunnlaget for beslutningen.
Definer samtidig hva som teller som feil. Er et delvis riktig uttrekk godkjent? Er feil format like ille som feil innhold? Uten en definisjon vil to personer måle ulikt og resultatet blir uegnet som beslutningsgrunnlag.
Kjør så dagens oppsett mot fasiten og noter både treffprosent og forbruk. Nå har du en referanse i to dimensjoner, kvalitet og kostnad, som er sammenlignbar over tid.
Uke 2: kjør parallelt
Send de samme oppgavene gjennom kandidatmodellen med identisk prompt først, og noter resultatet. Juster deretter prompten for den nye modellen og kjør på nytt. Begge tallene er interessante: det første viser hvor lett byttet er, det andre viser potensialet.
Mål latens og feilrate under realistisk last, ikke bare i et skript på en utviklermaskin. Gjennomstrømning varierer betydelig mellom leverandører som kjører den samme modellen på ulik maskinvare (NVIDIA).
Loggfør alt i et regneark med en rad per oppgave. Det tar en time ekstra og gjør at diskusjonen i etterkant handler om tall, ikke om hvem som likte svarene best.
Beslutningsregelen
Sett regelen på forhånd: kandidaten må være minst like god på kvalitet og merkbart billigere totalt, ellers blir vi. Å definere terskelen før testen fjerner den vanligste feilkilden, som er at man rasjonaliserer et bytte man allerede har bestemt seg for.
Hvis kandidaten er bedre på kvalitet, men dyrere, er det en annen beslutning og bør behandles som en investering med egen begrunnelse. Bland aldri de to sakene i samme innstilling.
Uansett utfall: behold testsettet. Neste gang en interessant modell dukker opp, og det tar sjelden lang tid, er testen en dagsjobb i stedet for et prosjekt.
Markedet: 130 utgivelser på tolv måneder
BenchLM sporet 130 AI-modellutgivelser i løpet av tolv måneder frem til 26. august 2026 (benchlm.ai). Tempoet er den viktigste enkeltfaktoren for hvordan du bør bygge: en beslutning om modellvalg har kort holdbarhet, og det bør arkitekturen din reflektere.
August 2026 var den travleste måneden i perioden med 22 utgivelser, og Alibaba hadde flest sporede utgivelser med 13, foran OpenAI med 12 (benchlm.ai). Det er ikke lenger en håndfull amerikanske laboratorier som setter takten.
Hvem som fyller katalogene
Ser man på totale kataloger fremfor utgivelser siste tolv måneder, blir bildet enda tydeligere. Tabellen viser antall modeller per organisasjon slik llm-stats.com fører dem opp.
| Organisasjon | Sporede modeller |
|---|---|
| Alibaba Cloud / Qwen Team | 59 |
| 53 | |
| xAI | 28 |
| DeepSeek | 27 |
| Microsoft | 13 |
| Zhipu AI | 13 |
| NVIDIA | 9 |
| Cohere | 4 |
| Liquid AI | 2 |
Tallene er hentet fra llm-stats.com, som oppdaterer oversikten hver time. En vesentlig del av volumet kommer fra kinesiske aktører, og prisnivået deres presser hele markedet nedover. Vi har sett nærmere på hva det betyr for norske selskaper i artikkelen om kinesiske modeller til lavere pris.
Hva tempoet betyr for innkjøp
Når det kommer nye modeller i dette tempoet, er treårige bindinger til en enkelt modellversjon lite klokt. Be om avtaler som lar deg flytte volum mellom modeller hos samme leverandør uten reforhandling, og som ikke straffer deg for å redusere forbruk.
Det betyr også at intern kompetanse på evaluering er mer verdifull enn intern kompetanse på en spesifikk leverandørs SDK. Evne til å måle er varig, integrasjonsdetaljer er ferskvare.
De store rådgiverne rapporterer om det samme mønsteret i sine årlige gjennomganger av bedriftsadopsjon (Deloitte). Det interessante for en SMB er ikke at store selskaper sliter med det samme, men at de bruker vesentlig mer penger på å finne ut av det.
Åpne vektmodeller mot lukkede API-er
45 prosent av de klassifiserte utgivelsene i tolvmånedersperioden var åpne vektmodeller (benchlm.ai). Alura mener disse modellene er et reelt alternativ for norske SMB-er, ikke en nisje for utviklere. En så stor andel av utgivelsene er ikke et sidespor, det er en hovedvei.
Åpne vekter betyr at modellens parametere er tilgjengelige for nedlasting. Det gir deg tre valg: kjøpe den som API fra en inferensleverandør, kjøre den i egen sky, eller kjøre den på egen maskinvare. Prisen og kontrollnivået er ulikt i alle tre tilfellene.
Modellfamiliene du faktisk møter
NVIDIAs oversikt over optimaliserte åpne modeller gir et representativt utvalg. Gemma er Google DeepMinds familie av lette, åpne modeller med støtte for flere språk og modaliteter. Llama er Metas samling av åpne grunnmodeller, gjort multimodale med Llama 4. Qwen3-familien består av to MoE-modeller og seks tette modeller, med totale parametere fra 0,6B til 235B (NVIDIA).
I den store enden finner du Kimi K2, en MoE-språkmodell med 32 milliarder aktiverte parametere og et langt større totalt parameterantall. I den lille enden ligger Microsofts Phi-familie, der Phi-3.5-mini-Instruct har 3,8 milliarder parametere og likevel gjør det godt på matematisk resonnering og kodegenerering (NVIDIA).
NVIDIAs egen Nemotron-familie er delt etter formål: Nano for kostnadseffektivitet, Super for balanse og Ultra for maksimal nøyaktighet. Den inndelingen er en god mal for hvordan du selv bør tenke om modellvalg per oppgave.
Tre måter å kjøpe den samme modellen på
| Modell for anskaffelse | Passer når | Hovedrisiko |
|---|---|---|
| Lukket API fra modellprodusent | Du vil ha nyeste evner og minst mulig drift | Prisendringer og avvikling av modellversjoner |
| Åpen modell hos inferensleverandør | Du vil ha lav pris uten å drifte selv | Varierende gjennomstrømning og driftsmodenhet |
| Åpen modell i egen drift | Data må bli hos dere, eller volumet er høyt og stabilt | Maskinvare, kompetanse og faktisk utnyttelsesgrad |
Legg merke til at rad to og tre bruker den samme modellen. Forskjellen er hvem som eier driften og hvor dataene ligger, ikke hvilke svar du får. Det gjør åpne vekter til det eneste alternativet der du kan bytte leverandør uten å bytte modell.
Det er en undervurdert form for forhandlingskraft. Kan du flytte den samme modellen mellom tre leverandører på en dag, forhandler du fra en annen posisjon enn den som må skrive om integrasjonen sin først.
Når åpne vekter ikke lønner seg
Egen drift lønner seg sjelden ved lavt eller ujevnt volum. En GPU som står stille koster like mye som en som jobber, og de fleste SMB-arbeidsflyter har store døgnvariasjoner. Tommelfingerregelen er at du trenger jevn belastning før regnestykket snur.
Kompetansekostnaden er heller ikke null. Noen må håndtere oppdateringer, kvantisering, minnebruk og feilsøking når gjennomstrømningen faller. Hvis den kompetansen ikke finnes internt, blir den kjøpt inn, og da er den en fast kostnad.
For dem som likevel vurderer det, har vi gått gjennom hva som faktisk er mulig på begrenset maskinvare i artikkelen om komprimerte modeller på lokal GPU.
Les også: Token-kostnader faller 75 prosent mens regningen femdobles. Enhetsprisen på tokens faller 75 prosent, men totalkostnaden femdobles.
Kontekstvinduet påvirker regningen mer enn listeprisen
Kontekstvinduet er antallet tokens modellen kan ha i arbeidsminnet på en gang. Spennet er stort: llm-stats.com fører opp 2,0 millioner tokens hos xAI, 1,1 millioner hos OpenAI, og bare 4K hos Fal og 10K hos Replicate (llm-stats.com). Det er forskjellen mellom å sende hele avtaleverket og å sende et avsnitt. De øvrige leverandørene i prisoversikten, DeepInfra, Novita, Google, Fireworks og Anthropic, ligger på et jevnere nivå et stykke under xAI.
Her ligger den vanligste kostnadsfellen. Et stort kontekstvindu er en mulighet, ikke en instruks. Fyller du det hver gang, betaler du for hvert eneste token du sender inn, hver eneste gang.
Kontekst er en kostnadsdriver, ikke en funksjon
Vurder en arbeidsflyt der samme produktdokumentasjon sendes med hvert kall. Dokumentet betales for på nytt ved hver forespørsel, selv om innholdet er identisk. Over et år er dette ofte den største enkeltposten i AI-budsjettet til en SMB.
Motgiften er kjent: hent bare relevante deler i stedet for hele dokumentet, komprimer samtalehistorikk i stedet for å sende alt, og bruk mellomlagring av kontekst der leverandøren tilbyr det. Effekten er som regel større enn å bytte til en billigere modell.
Test dette før du tester nye leverandører. Det er billigere, raskere og gir ofte et bedre svar i tillegg, fordi modellen slipper å lete i støy.
Slik sjekker du om kontekst er problemet ditt
Se på forholdet mellom inn-tokens og ut-tokens i forbruksdashbordet. Er inn-tokens mange ganger større enn ut-tokens for enkle oppgaver, er kontekst nesten helt sikkert kostnadsdriveren.
Sammenlign deretter forholdet mellom to arbeidsflyter dere har. Den som skiller seg ut, er der du bør begynne. Det er som regel den ingen har rørt siden den ble satt i drift.
Merk også at leverandører priser inn og ut ulikt. En modell som er billig på inn-tokens kan være et godt valg for kontekstunge oppgaver selv om totalinntrykket i prislisten er dyrt.
Maskinvaren bak prisen og hvorfor gjennomstrømning betyr noe
Prisene faller ikke fordi leverandørene er snille. De faller fordi hver ny generasjon maskinvare presser flere tokens gjennom det samme strømbudsjettet. NVIDIA oppgir en 15 ganger ytelsesfordel for DeepSeek-R1 på Blackwell GB200 NVL72 sammenlignet med Hopper H200, og en maksimal gjennomstrømning på 1,5 millioner tokens per sekund for gpt-oss-modeller på GB200 NVL72 (NVIDIA).
For deg som kunde er dette forklaringen på hvorfor en prisliste fra i fjor er ubrukelig, og hvorfor det er rimelig å forvente at prisen på en gitt kapabilitet fortsetter å falle.
Tallene som driver prisutviklingen
NVIDIA oppgir markert høyere gjennomstrømning for Llama 3.3 70B på B200 enn på H200, og en ytterligere økning når spekulativ dekoding i TensorRT-LLM slås på. Samme mønster gjelder Llama Nemotron Super 1.5, der B200 oppgis å gi klart høyere gjennomstrømning enn FP8 på H100 (NVIDIA).
For agentiske arbeidsbelastninger oppgir NVIDIA 50 ganger ytelsesforbedring og 35 ganger kostnadsreduksjon for Blackwell Ultra. Dette er leverandørens egne tall under gunstige forutsetninger, og bør leses som en retning, ikke som en garanti for din arbeidsflyt.
Den praktiske lærdommen: kapasiteten som er dyr i dag, er sannsynligvis rimeligere om et halvår. Bygg derfor arbeidsflyter du kan skru opp senere, i stedet for å utsette dem til prisen føles riktig.
Gjennomstrømning er en kostnadsvariabel for deg også
Gjennomstrømning påvirker mer enn ventetid. Treg respons betyr flere avbrutte kall, flere gjenopptak, og i agentiske løsninger flere tidsavbrudd som utløser nye forsøk. Alt dette betales i tokens.
NVIDIA oppgir for eksempel 140 tokens per sekund eller mer for Kimi K2 Thinking på Blackwell hos en av partnerne (NVIDIA). Slike tall er nyttige som en forventning, men de må verifiseres på din egen last hos den leverandøren du faktisk kjøper fra.
Be derfor om gjennomstrømningstall i tilbudet, ikke bare pris per million tokens. To leverandører med samme pris og ulik gjennomstrømning gir ulik totalkostnad.
AI-forordningen og hva som følger med når du bytter modell
EU har vedtatt verdens første omfattende AI-lov, foreslått av Europakommisjonen i april 2021 (EU-kommisjonen). Regelverket klassifiserer AI-systemer etter risiko, og ulike risikonivåer utløser ulike krav. For norske SMB-er er dette ikke en akademisk øvelse, det er en klausul i leverandøravtalen.
Alura mener at åpenhetskravene i AI-forordningen bør inn i leverandøravtalen før et bytte, ikke etterpå. Det er langt enklere å få inn dokumentasjonsplikter i en avtale du ennå ikke har signert.
Risikoklassene i korte trekk
Systemer med uakseptabel risiko er forbudt i EU, med enkelte unntak for rettshåndhevelse. Høyrisikosystemer må vurderes før de settes på markedet og gjennom hele livssyklusen (EU-kommisjonen). De aller fleste SMB-bruksområder, kundeservice, dokumentbehandling, innholdsproduksjon, faller utenfor høyrisikokategorien.
Generativ AI som ChatGPT er ikke klassifisert som høyrisiko, men må overholde åpenhetskrav og EUs opphavsrettslovgivning. AI-generert innhold, inkludert deepfakes, må merkes tydelig som AI-generert (EU-kommisjonen).
Tidslinjen er verdt å notere: forordningen blir fullt anvendelig 24 måneder etter ikrafttredelse, mens forpliktelsene for høyrisikosystemer gjelder fra 36 måneder etter ikrafttredelse. Loven har samtidig som uttalt mål å støtte innovasjon og oppstartsbedrifter i Europa.
Klausulene som bør stå i avtalen
Krev at leverandøren dokumenterer hvilken modellversjon som kjører, at endringer varsles, og at du får tilgang til den tekniske dokumentasjonen som kreves for å oppfylle åpenhetsplikten din overfor egne brukere. Uten dette blir merkeplikten din umulig å etterleve i praksis.
Ta også inn behandlingssted for data, bruk av underleverandører, retningslinjer for logging og oppbevaring, og hvorvidt dine data brukes til trening. Dette er standardspørsmål, og en leverandør som ikke kan svare presist på dem har svart likevel.
Til slutt: en exit-klausul. Rett til å ta ut egne data og prompter i lesbart format, og en oppsigelsestid som gjør et bytte praktisk gjennomførbart.
Vanlige feil norske SMB-er gjør i leverandørvalget
Feilene går igjen, og de er sjelden tekniske. De handler om beslutningsgrunnlag, om hvem som eier valget internt, og om hvor tett applikasjonen er sydd sammen med en bestemt leverandør.
Å bytte på listepris alene
Den vanligste feilen er å sammenligne to tall fra to prislister og konkludere. Uten forsøksfaktor, kontekstforbruk og kvalitetsmåling er en slik sammenligning uten informasjonsverdi.
Resultatet er ofte et bytte som ser ut som en besparelse i tre uker, og som deretter spises opp av flere kall, mer promptarbeid og noen misfornøyde brukere. Da byttes det tilbake, og begge byttene er betalt.
Krev alltid en referansemåling før beslutningen. Det er en dags arbeid, og det er den best betalte dagen i hele prosjektet.
Å bygge direkte mot en leverandørs SDK
Når leverandørens bibliotek kalles direkte fra tjue filer, er byttekostnaden bygget inn i koden. Et tynt internt grensesnitt mellom applikasjonen og modellen koster lite å lage og gjør neste bytte til en konfigurasjonsendring.
Det samme gjelder prompter. Ligger de spredt som strenger i koden, kan de ikke versjoneres, testes eller sammenlignes. Samle dem ett sted fra dag en.
Dette er ikke overteknisk arkitektur. Det er den minste investeringen som gir deg valgfrihet i et marked der noe nytt kommer hver uke.
Å glemme kostnaden ved å bli værende
Å ikke bytte er også en beslutning, og den har en pris. Hvis du betaler toppmodellpris for oppgaver som en rimeligere modell løser like godt, betaler du differansen hver eneste måned uten at noen tar en beslutning om det.
Sett derfor en fast gjennomgang, for eksempel hvert kvartal, der forbruk per arbeidsflyt og modellvalg vurderes på nytt mot testsettet. Uten en kalenderfestet gjennomgang skjer det aldri.
Med 22 utgivelser i den travleste måneden alene er kvartalsvis gjennomgang ikke overivrig, det er minimum (benchlm.ai).
Ofte stilte spørsmål om AI-modellpriser og leverandørbytte
Spørsmålene under er de vi oftest får fra daglige ledere og teknisk ansvarlige i norske SMB-er som skal ta dette valget for første gang.
Hva koster egentlig en million tokens?
Det avhenger helt av leverandør og modell. Oversikten hos llm-stats.com viser inngangspriser fra 0,05 dollar i den laveste enden til 12,50 dollar i den høyeste, og ulike priser for inn- og ut-tokens hos de fleste (llm-stats.com).
Det praktiske svaret er at du må hente ditt eget forbruk fra dashbordet og regne på arbeidsflyten din. Et bransjegjennomsnitt hjelper deg ikke med å sette et budsjett.
Er de billigste modellene gode nok?
For mange oppgaver, ja. Klassifisering, uttrekk av felter, ruting og korte oppsummeringer løses ofte utmerket av små modeller. Microsofts Phi-familie er et eksempel på små modeller som gjør det godt på matematisk resonnering og kodegenerering (NVIDIA).
For oppgaver med lange resonneringskjeder, mange verktøykall eller høy konsekvens ved feil er svaret som regel nei. Skille mellom oppgavetypene og bruk ulik modell til hver, i stedet for å velge en modell til alt.
Hvor lang tid tar et leverandørbytte?
Med et internt grensesnitt på plass er det dager. Uten er det uker, og hovedarbeidet er ikke integrasjonen, men å bygge kvalitetsmålingen du skulle hatt fra før.
Legg alltid inn en periode med parallell drift. Å gå rett over uten sammenligning er den raskeste måten å oppdage en regresjon i produksjon.
Bør vi kjøre AI-modeller på egen maskinvare?
Bare hvis dere har jevnt, høyt volum eller data som ikke kan forlate huset. Åpne vektmodeller gjør det teknisk mulig, og 45 prosent av utgivelsene siste tolvmånedersperiode hadde åpne vekter (benchlm.ai).
Mellomveien er ofte riktigere for en SMB: kjøp den åpne modellen som API fra en inferensleverandør. Du får lav pris og portabilitet uten å bygge driftskompetanse du ikke trenger.
Hva krever AI-forordningen av oss som kjøper?
For vanlige generative bruksområder handler det først og fremst om åpenhet: brukere skal vite at de forholder seg til AI, og AI-generert innhold som deepfakes skal merkes (EU-kommisjonen).
Bruker dere AI i beslutninger om ansettelse, kreditt eller lignende, bør dere gjøre en grundig vurdering av om systemet faller inn under høyrisikokategorien, som har egne krav gjennom hele livssyklusen.
Oppsummering og neste steg for norske SMB-er
Prisbildet er bredt, tempoet er høyt, og ingen av delene ser ut til å endre seg med det første. Det gjør evnen til å bytte viktigere enn hvilket bytte du gjør akkurat nå.
Fem punkter å ta med i beslutningen
For det første: inngangsprisene spenner fra 0,05 til 12,50 dollar per million tokens, og spennet er stort også innad hos en enkelt leverandør (llm-stats.com). For det andre: kontekstforbruket ditt påvirker regningen mer enn valget av leverandør for de fleste arbeidsflyter.
For det tredje: forsøksfaktoren er den variabelen ingen prisliste oppgir, og den snur oftest sammenligningen. For det fjerde: åpne vektmodeller gir deg muligheten til å bytte leverandør uten å bytte modell, noe som er den mest undervurderte formen for forhandlingskraft i dette markedet.
For det femte: åpenhetskrav og databehandling hører hjemme i avtalen før byttet, ikke i en e-post etterpå (EU-kommisjonen).
Slik ser et robust oppsett ut
Et oppsett som tåler markedet har fire ting: alle modellkall bak ett internt grensesnitt, prompter samlet og versjonert, et testsett med fasit for egne oppgaver, og kostnadslogg per arbeidsflyt. Har du disse, er et leverandørbytte en beslutning du kan ta på en ettermiddag.
Mangler du dem, er neste steg ikke å velge modell. Det er å bygge målingen. Med 130 utgivelser bak seg på tolv måneder er dette et marked der evnen til å vurdere raskt er mer verdt enn å ha valgt riktig en gang (benchlm.ai).
Start med en arbeidsflyt, den med høyest forbruk. Mål den i en uke, bygg fasit i den neste, og la resultatet avgjøre om dere skal bytte modell, bytte leverandør, eller bare rydde i det dere allerede har.
I Alura bygger vi AI-infrastruktur for norske virksomheter, fra dataplattformer til agentiske systemer i produksjon. Vi er ikke en SaaS-leverandør. Vi er håndverkere som setter sammen byggesteinene som faktisk fungerer for din situasjon.
Bestill en arkitektur-samtale: vi går gjennom din nåværende infrastruktur, identifiserer integrasjonspunkter, og foreslår en pragmatisk vei videre. Uforpliktende, 45 minutter.
Kilder
- llm-stats.com. AI Updates Today (August 2026) – Latest AI Model Releases
- benchlm.ai. AI Model Release Statistics (2026): Launch Cadence by Lab | BenchLM.ai
- NVIDIA. AI Models
- EU-kommisjonen. EU AI Act: first regulation on artificial intelligence | Topics
- Deloitte. The State of AI in the Enterprise - 2026 AI report
Alura
Praktisk kunnskap om AI-automatisering og effektivisering for norske bedrifter.
Les neste
Agentisk videoforståelse kutter analysekostnaden 66 prosent
Google har lansert agentisk videoforståelse i Gemini med 66 prosent lavere analysekostnad og 88 prosent færre tokens. Her er hva norske virksomheter bør vurdere først.
AI-brikker kuttet inferenskostnaden 70 prosent hos AWS
OpenAIs Jalapeno-brikke og AWS Inferentia peker samme vei: inferens blir billigere per token. Her er tallene norske SMB-er bor regne pa for opprampingen i 2027.
Groq droppet egne AI-brikker og ble Nvidia-operatør
Groq hentet 350 millioner dollar, men sluttet å bygge egne LPU-brikker og drifter nå Nvidia-systemer. Slik leser du brikkemarkedet før du planlegger AI-infrastruktur.
Token-kostnader faller 75 prosent mens regningen femdobles
Enhetsprisen på tokens faller 75 prosent, men totalkostnaden femdobles. Her er tallene bak prislappen på AI-agenter og hva norske SMB-er bør regne på først.

