Token-kostnader faller 75 prosent mens regningen femdobles
Enhetsprisen på tokens faller 75 prosent, men totalkostnaden femdobles. Her er tallene bak prislappen på AI-agenter og hva norske SMB-er bør regne på først.

Nøkkelpunkter per 24. august 2026:
- Enhetsprisen på tokens har falt 75 prosent mens totale kostnader er femdoblet, fordi agentiske oppgaver bruker rundt 20 ganger flere tokens (VentureBeat).
- Orkestreringen slår modellbyttet: Writer-forskere målte 40 prosent gjennomsnittlig kostnadskutt fra endringer i harness-laget alene (TechCrunch, 2026).
- Prisspennet er stort nok til å avgjøre lønnsomheten: fra 0,31 dollar per million tokens for GPT-5.6 Luna til 14,44 dollar for Claude Fable 5 (punku.ai, 2026).
- 128 modellanseringer på tolv måneder frem til august 2026, og 45 prosent av dem kom med åpne vekter (benchlm.ai).
- AI Act krever åpenhet om AI-generert innhold, og forpliktelsene for høyrisikosystemer inntrer 36 måneder etter ikrafttredelse (EU-kommisjonen).
Token-kostnader forklart for beslutningstakere
Et token er en tekstbit, omtrent en stavelse eller et kort ord. Modellene tar betalt per million tokens inn og per million tokens ut, og prisen står i en prisliste som ser ut som et enkelt, sammenlignbart tall. Det tallet er en enhetspris, ikke en kostnad. Avstanden mellom de to er hele grunnen til at AI-budsjetter sprekker i år der prislistene faller.
For en SMB som vurderer AI-agenter er dette den viktigste distinksjonen i hele budsjettarbeidet. Du kjøper ikke tokens, du kjøper fullførte oppgaver. Mellom de to ligger et forbruksmønster du kontrollerer langt mindre enn du tror, og som endrer seg hver gang noen justerer en systemprompt eller kobler på et nytt verktøy.
Input og output prises ulikt
Modellene tar mer betalt for det de skriver enn for det de leser. Writers nye Palmyra X6 ligger på 2 dollar per million input-tokens og 8 dollar per million output-tokens, mens Claude Opus 4.8 er priset til 15 dollar for input og 75 dollar for output per million tokens (VentureBeat). Et agentoppsett som resonnerer mye, og altså produserer mye output, får en helt annen kostnadsprofil enn en chatbot som svarer kort. Den samme modellen kan være billig i ett bruksmønster og dyr i et annet, uten at prislisten har endret seg.
Blandet pris skjuler et forholdstall
Ledertavler oppgir gjerne en blandet pris per million tokens, som forutsetter et bestemt forhold mellom input og output. GPT-5.6 Luna havner på rundt 0,31 dollar per million tokens ved en 8:1-blanding av input og output (punku.ai, 2026). Endrer bruksmønsteret ditt det forholdet, endrer den effektive prisen seg umiddelbart. Blandet pris er nyttig for grovsortering av kandidater og ubrukelig som budsjettgrunnlag.
Enhetsprisen er ikke kostnaden
Alura mener at kostnad skal regnes per fullført oppgave, ikke per million tokens. Enhetsprisen alene skjuler hvor mange tokens et agentoppsett faktisk bruker for å komme i mål. To leverandører med identisk prisliste kan sende deg regninger som skiller seg kraftig, fordi det ene oppsettet leser hele konteksten på nytt i hvert steg og det andre ikke gjør det. Prislisten er en av fire faktorer, og sjelden den som avgjør.
Prisfallet som likevel femdobler regningen
Enhetsprisene på tokens har falt 75 prosent, og totale kostnader har likevel femdoblet seg (VentureBeat). Forklaringen ligger åpent i dagen: agentiske oppgaver bruker i størrelsesorden 20 ganger flere tokens enn en vanlig chatforespørsel. Når volumet vokser raskere enn prisen faller, går regningen opp uansett hvor gunstig prislisten ser ut.
| Størrelse | Retning | Nivå |
|---|---|---|
| Enhetspris per token | Ned | 75 prosent fall |
| Token-forbruk i agentiske oppgaver | Opp | 20 ganger |
| Totale AI-kostnader | Opp | Femdoblet |
| Prognostisert forbruk mot 2030 | Opp | 24 ganger |
Dette er den sentrale mekanismen bak all kostnadsdiskusjon om AI-agenter i 2026. Prisfallet er reelt, men det blir spist opp av volumvekst før det når budsjettlinjen din. En leder som planlegger ut fra «tokens blir jo billigere hvert kvartal» planlegger for feil kurve.
Hvorfor agenter sluker tokens
En chatforespørsel er ett kall. En agent bryter oppgaven i steg, kaller verktøy, leser resultatene, vurderer om den er i mål, og fortsetter. Hvert steg sender som regel hele samtalehistorikken inn på nytt, slik at input-siden vokser kvadratisk gjennom oppgaven. Legger du på verktøyoutput, søkeresultater og dokumentinnhold, blir de fleste tokens i et agentoppsett brukt på å lese det agenten selv nettopp produserte. Vi har skrevet mer om hvordan dette slår ut i utviklerverktøy i vår gjennomgang av token-budsjett i kodeverktøy.
Prognosen frem mot 2030
Goldman Sachs anslår at token-forbruket vil multipliseres med 24 ganger mellom 2026 og 2030, til en prognose på 120 quadrillion tokens per måned (VentureBeat). Prognoser på dette nivået er grove, og de er verdt å lese som retning heller enn som tall. Retningen er tydelig nok: forbruket vokser fortere enn prisene faller, og det er forbruket du styrer.
Les også: Token-budsjett for AI-kodeverktøy: Uber-saken og norske SMB. Uber brukte opp hele 2026-budsjettet på fire måneder.
Fire kostnadsdrivere i et agentoppsett
Fire størrelser bestemmer hva et agentoppsett koster. De ganges sammen, ikke legges sammen, og derfor slår en forbedring i den ene igjennom på hele regningen. De fleste diskusjoner om AI-kostnader handler om den første og ignorerer de tre andre.
| Driver | Hva den styrer | Hvor du påvirker den |
|---|---|---|
| Enhetspris | Kroner per million tokens inn og ut | Modellvalg og ruting mellom modeller |
| Tokens per steg | Hvor mye kontekst og verktøyoutput som sendes inn på nytt | Orkestrering, komprimering, caching |
| Antall forsøk | Hvor ofte agenten må prøve på nytt før resultatet godkjennes | Modellkvalitet, verktøydesign, evaluering |
| Tidsbudsjett | Hvor lenge agenten får jobbe uovervåket | Tak, avbrudd og godkjenningspunkter |
Driver 1: enhetsprisen på modellen
Enhetsprisen er den eneste driveren leverandøren publiserer, og derfor den eneste de fleste sammenligner. Spennet mellom modellene er stort: fra 0,54 dollar per million tokens for Gemini 3.5 Flash-Lite til 14,44 dollar for Claude Fable 5 (punku.ai, 2026). Det spennet er stort nok til å avgjøre om et agentprosjekt lønner seg, men bare hvis de tre andre driverne holdes noenlunde like.
Driver 2: tokens per steg
Dette er driveren som gjør agenter dyre. Hvor mye av samtalehistorikken sendes inn på nytt i hvert steg? Hvor mye rå verktøyoutput får lov til å havne i konteksten? Komprimerer oppsettet mellomresultater, eller dumper det hele dokumenter inn i hver runde? Et oppsett som håndterer dette dårlig kan bruke flere ganger så mange tokens som et som håndterer det godt, på nøyaktig samme modell og nøyaktig samme oppgave.
Driver 3: antall forsøk før oppgaven er godkjent
En agent som ofte må gjøre samme oppgave om igjen koster langt mer per fullført oppgave enn prislisten antyder, og det er før du regner inn menneskelig etterarbeid. Kvalitetsforskjeller mellom modeller er ofte små på papiret: Writer oppgir 0,87 i gjennomsnittlig score på egne evalueringer for X6 mot 0,85 for Claude Sonnet 4.6 (VentureBeat). Små forskjeller i suksessrate gir store forskjeller i kostnad, fordi et mislykket forsøk koster like mye i tokens som et vellykket. Vi har argumentert for at pålitelighet før hastighet er riktig rekkefølge nettopp av denne grunn.
Driver 4: tiden agenten får lov til å jobbe
Autonomi er en kostnadsdriver, ikke bare en funksjon. Writer oppgir at X6 bruker 26 sekunder i snitt på å fullføre en oppgave, men at modellen kan jobbe uovervåket mot et mål i inntil åtte timer (VentureBeat). Snittet er billig. Halen er ikke. Uten tak på steg, tid eller kroner er det halen som definerer verstefallsregningen din, og halen er den som dukker opp i en produksjonshendelse en fredag ettermiddag.
Modellvalg eller orkestrering: hvor besparelsen faktisk ligger
Det mest interessante funnet i årets kostnadsdebatt handler ikke om modeller. Writer-forskere fant at endringer i harness, altså orkestreringslaget rundt modellen, var en mer pålitelig måte å kutte kostnader på enn å bytte modell, med et gjennomsnittlig kutt på 40 prosent (TechCrunch, 2026). Begrunnelsen er strukturell: harness er komponenten hvis effektivitet multipliseres på tvers av alle modellene en organisasjon kjører.
Hva orkestreringslaget faktisk gjør
Harness er alt som ikke er modellen: hvordan oppgaven brytes i steg, hva som havner i konteksten, når verktøy kalles, hvordan mellomresultater komprimeres, når agenten får stoppe. Writer oppgir 41 prosent kostnadsreduksjon og 44 prosent hastighetsforbedring fra harness-endringene alene, og 52 prosent lavere kostnad, 48 prosent raskere og 10 prosent bedre kvalitet for agentproduktet samlet med Palmyra X6 (VentureBeat). Selskapet anslår at kundene kan se opptil 50 prosent lavere kostnad for grunnleggende oppgaver (TechCrunch, 2026).
| Tiltak | Målt effekt | Gjelder for |
|---|---|---|
| Bytte til billigere modell | Varierer med oppgave og kvalitetskrav | Den ene modellen du bytter |
| Endre harness og orkestrering | 41 prosent lavere kostnad, 44 prosent raskere | Alle modeller du kjører |
| Modell og harness samlet | 52 prosent lavere kostnad, 48 prosent raskere, 10 prosent bedre kvalitet | Leverandørens eget agentprodukt |
Hvorfor modellbytte er mindre forutsigbart
Alura mener at orkestreringslaget rundt modellen ofte gir mer forutsigbar besparelse enn å bytte modell, fordi effektiviteten der gjelder alle modellene du kjører. Et modellbytte er en engangsgevinst som må gjentas hver gang markedet flytter seg, og som må valideres på nytt for hver oppgavetype. En forbedring i hvordan du håndterer kontekst følger med videre til neste modell.
Samtidig er tallene over leverandørens egne. Alura mener at leverandørens kostnadstall er et utgangspunkt for testing, ikke en garanti, og at reell besparelse avhenger av bruksmønster og integrasjon. Writers CEO May Habib peker selv på at store AI-laboratorier har økonomiske insentiver til å øke token-bruken (TechCrunch, 2026). Den observasjonen gjelder også for leverandører som selger kostnadskutt.
Regn ut kostnad per fullført oppgave, ikke per token
Her er den praktiske delen. Kostnad per fullført oppgave er summen av det du betaler for alle forsøk, delt på antall oppgaver som faktisk ble godkjent. Formelen ser slik ut: (input-tokens per forsøk ganger inputpris, pluss output-tokens per forsøk ganger outputpris), ganget med antall forsøk per oppgave, delt på fullføringsgraden, pluss kostnaden for menneskelig etterarbeid.
Ingen av disse størrelsene finnes i en prisliste. Alle finnes i loggene dine etter en uke med målrettet instrumentering. Det er derfor denne øvelsen alltid begynner med måling og aldri med et anbud.
De fem tallene du trenger
| Komponent | Hva du måler | Hvor det hentes |
|---|---|---|
| Input-tokens per forsøk | Sum tokens sendt inn over alle steg i oppgaven | API-logg per kall |
| Output-tokens per forsøk | Sum tokens generert av modellen | API-logg per kall |
| Forsøk per oppgave | Totale kjøringer delt på unike oppgaver | Oppgavelogg med korrelasjons-ID |
| Fullføringsgrad | Andel oppgaver godkjent uten manuelt inngrep | Evaluering eller stikkprøve |
| Menneskelig etterarbeid | Minutter brukt etter agenten per oppgave | Tidsregistrering på et utvalg |
Legg merke til at bare de to første kommer gratis fra leverandøren. De tre siste krever at du definerer hva en fullført oppgave er, og det er den definisjonen som gjør resten av regnestykket meningsfullt. Uten den måler du aktivitet, ikke resultat.
Fullføringsgraden er multiplikatoren
Fullføringsgraden ligger i nevneren, og derfor slår den hardest ut av alle tallene i modellen. Faller den, stiger kostnaden per fullført oppgave selv om ikke en eneste token er blitt dyrere. Det er også den eneste størrelsen som fanger opp kvalitetsforskjeller mellom modeller på en måte som er direkte sammenlignbar med kroner. En dyrere modell som fullfører mer kan være den billigste totalt.
Etterarbeidet hører hjemme i regnestykket
Det vanligste hullet i AI-budsjetter er at menneskelig kontroll ikke telles med. Hvis en saksbehandler bruker syv minutter på å kvalitetssikre noe agenten produserte på 26 sekunder, ligger hovedkostnaden i lønn, ikke i tokens. Da er tiltaket som lønner seg å redusere kontrollbehovet, ikke å bytte til en modell som er noen øre billigere. Regn etterarbeidet inn fra første måling, ellers optimaliserer du feil størrelse i et halvt år.
Dette gjør du den første uken med kostnadskontroll
Fem arbeidsdager er nok til å komme fra «vi vet ikke hva dette koster» til en kostnad per fullført oppgave du kan legge frem for styret. Rekkefølgen betyr mer enn verktøyene.
Dag 1 og 2: mål før du optimaliserer
Legg på en korrelasjons-ID per oppgave, og logg input-tokens, output-tokens, antall steg og utfall for hvert kall. Velg de to eller tre oppgavetypene som står for mesteparten av volumet, ikke alle. Definer skriftlig hva godkjent resultat betyr for hver av dem, og la en person som faktisk gjør jobben eie den definisjonen. Uten dette blir alt senere arbeid gjetting med desimaler.
Dag 3 og 4: sett tak og rut oppgavene
Innfør harde tak: maks antall steg per oppgave, maks tid per kjøring, og et månedlig kronetak med varsling før det treffes. Rut deretter oppgavene: enkle klassifiserings- og uttrekksoppgaver til en billig modell, komplekse resonneringsoppgaver til en sterk. Prisspennet mellom 0,31 dollar og 14,44 dollar per million tokens gjør ruting til et av de mest lønnsomme tiltakene som finnes (punku.ai, 2026). Rutinglaget bør ligge i din kode, ikke i leverandørens produkt, slik at det overlever et bytte.
Dag 5: test leverandørens tall mot dine egne
Kjør den samme oppgavemengden gjennom to oppsett og sammenlign kostnad per fullført oppgave, ikke per token. De publiserte besparelsene er målt på leverandørens egne oppgaver og eget produkt (VentureBeat). Dine oppgaver har annen kontekstlengde, andre verktøy og andre kvalitetskrav. En A/B-test på hundre reelle oppgaver forteller deg mer enn enhver benchmark, og den tar en ettermiddag.
Modellmarkedet i 2026 og 128 lanseringer på tolv måneder
Kostnadsplanlegging er vanskelig fordi grunnlaget flytter seg. BenchLM sporet 128 AI-modellanseringer i løpet av tolv måneder frem til 18. august 2026, og juli 2026 var travleste måned med 21 utgivelser (benchlm.ai). Et modellvalg tatt i januar er ikke nødvendigvis riktig i september, og det er nettopp derfor besparelser som ligger i din egen kode er mer verdifulle enn besparelser som ligger i et leverandørvalg.
Hvem lanserer mest
OpenAI og Alibaba toppet med 12 sporede utgivelser hver, Google og Anthropic fulgte med 10, mens Meta, DeepSeek og NVIDIA lå på 4 og Z.AI på 3 (benchlm.ai). Konsentrasjonen på toppen er mindre enn omtalen antyder. For en SMB betyr det at leverandørrisikoen ikke først og fremst handler om hvem som vinner, men om hvor dyrt det er for deg å bytte når rangeringen endrer seg.
Åpne vekter som prisdemper
45 prosent av de klassifiserte utgivelsene var åpne vektmodeller (benchlm.ai). Effekten ser du direkte i prisene: Kimi K3 er høyest rangerte åpne vekt-modell i topp ti med en blandet API-pris på 4,33 dollar per million tokens (punku.ai, 2026). Palmyra X6 er selv bygget som en post-training-variant av Z.ai sin åpne GLM-5.2, kjørt på amerikansk infrastruktur (TechCrunch, 2026). Åpne vekter åpner også for lokal kjøring, som vi har sett nærmere på i saken om komprimerte modeller lokalt.
Les også: Tolv AI-agenter per bedrift endrer CRM for norske SMB-er. Organisasjoner kjorer i snitt tolv AI-agenter, og adopsjonen ventes a oke 67 prosent pa to ar.
Hva de ledende modellene koster per million tokens
Tabellen under viser rangering og pris fra LLM Stats-snapshotet 7. august 2026. Metodikken er dynamisk, og score fra august bør ikke sammenlignes direkte med tidligere snapshots (punku.ai, 2026). Les den som et øyeblikksbilde av prisstrukturen, ikke som en fasit.
| Modell | Score i LLM Stats | Pris per 1M tokens |
|---|---|---|
| GPT-5.6 Sol | 57,2 | Ikke oppgitt |
| Claude Opus 5 | 56,5 | Ikke oppgitt |
| Claude Fable 5 | 56,3 | 14,44 dollar blandet |
| Kimi K3 (åpne vekter) | 55,4 | 4,33 dollar blandet |
| GPT-5.6 Terra | Ikke oppgitt | 3,11 dollar blandet |
| Claude Sonnet 5 | Ikke oppgitt | 2,89 dollar blandet |
| Gemini 3.5 Flash-Lite | Ikke oppgitt | 0,54 dollar |
| GPT-5.6 Luna | Ikke oppgitt | 0,31 dollar ved 8:1 |
Toppen av ledertavlen er sjelden der pengene ligger
GPT-5.6 Sol topper med 57,2 poeng, og avstanden ned til Claude Fable 5 er 0,9 poeng (punku.ai, 2026). Prisforskjellen mellom modeller i samme sjikt er derimot ikke marginal. Alura mener at modell skal velges etter oppgaven, ikke etter toppen av en ledertavle, fordi prisspennet mellom modellene er stort nok til å avgjøre om et agentprosjekt lønner seg. En modell som er noen tiendeler bedre på en samlescore kan være helt feil valg for en uttrekksoppgave som kjøres titusenvis av ganger i måneden.
Kontekstvindu og hastighet påvirker regningen
Grok-4 Fast Reasoning har det største praktiske kontekstvinduet LLM Stats sporer, med 2M tokens, mens Mercury 2 leder på hastighet med 988 tokens per sekund (punku.ai, 2026). Store kontekstvinduer er en felle like mye som en fordel: kapasiteten inviterer til å sende inn alt, og alt koster input-tokens i hvert eneste steg. Hastighet betyr mest der en agent kjører mange korte steg etter hverandre, fordi ventetiden da blir en lønnskostnad.
Maskinvaren som setter prisgulvet
Prislistene henger sammen med hva det koster å kjøre inferens. NVIDIA oppgir 50 ganger ytelsesforbedring og 35 ganger kostnadsreduksjon for agentisk AI med Blackwell Ultra, og 15 ganger ytelsesfordel for DeepSeek-R1 på GB200 NVL72 sammenlignet med Hopper H200 (NVIDIA). Tallene er leverandørens egne og målt på gunstige konfigurasjoner. De forklarer likevel hvorfor enhetsprisene fortsetter å falle, og hvorfor det fallet ikke er nok til å holde regningen din i ro.
AI Act og åpenhetskravene som treffer agentoppsettet
Regulering er en kostnadsdriver som sjelden står i budsjettet. Forordning (EU) 2024/1689, bedre kjent som AI Act, ble vedtatt 13. juni 2024 og fastsetter en enhetlig juridisk ramme for utvikling, markedsføring og bruk av AI-systemer i EU (EUR-Lex, 2024). Den definerer et AI-system som et maskinbasert system designet til å operere med varierende nivåer av autonomi, og som kan utvise adaptivitet etter utrulling. Den definisjonen treffer agentoppsett direkte.
Åpenhetskrav som koster tokens og tid
Generativ AI må overholde åpenhetskrav og EUs opphavsrettslovgivning, og AI-generert innhold som deepfakes må merkes tydelig (EU-kommisjonen). I praksis betyr det logging, sporbarhet og merking i produksjon. Loggingen er billig i seg selv, men den forutsetter at du allerede har korrelasjons-ID og oppgavedefinisjoner på plass. Det er de samme byggeklossene du trenger for å regne kostnad per fullført oppgave, som gjør at etterlevelse og kostnadskontroll kan bygges i samme trekk.
Tidslinjen du planlegger etter
| Hendelse | Tidspunkt |
|---|---|
| Kommisjonens forslag | April 2021 |
| Forordning (EU) 2024/1689 vedtatt | 13. juni 2024 |
| Fullt anvendelig | 24 måneder etter ikrafttredelse |
| Forpliktelser for høyrisikosystemer | 36 måneder etter ikrafttredelse |
Loven følger en risikobasert tilnærming: forbud mot uakseptable praksiser, krav til høyrisikosystemer, og åpenhetsforpliktelser for visse systemer (EUR-Lex, 2024). Høyrisikosystemer må vurderes både før de settes på markedet og gjennom hele livssyklusen (EU-kommisjonen). For de fleste norske SMB-er havner agentoppsettene under åpenhetskravene og ikke i høyrisikokategorien, men klassifiseringen bør gjøres skriftlig og en gang, ikke antas.
Markedssignaler å følge når token-forbruket vokser
Fire signaler forteller deg om kostnadsbildet er i ferd med å snu: investeringstakten, beregningskapasiteten, lanseringsfrekvensen og energibruken per svar. Ingen av dem er direkte handlingsutløsende, men samlet forteller de om prisfallet fortsetter eller flater ut.
Investeringene og kapasiteten
Global AI-investering nådde 581 milliarder dollar i 2025, opp fra 253 milliarder dollar i 2024, og godt over den tidligere rekorden på 360 milliarder dollar fra 2021 (IEEE Spectrum, 2026). USA alene sto for 344 milliarder dollar. Verdens AI-beregningskapasitet har mer enn tredoblet seg årlig siden 2022, og er 30 ganger større enn i 2021. Kapasitetsvekst er det som gjør prisfall mulig, og den veksten er finansiert av kapital som forventer avkastning, altså høyere forbruk.
Energibruk per svar som prisindikator
Energiforbruk per respons varierer mer mellom modeller enn de fleste tror. DeepSeek V3 bruker 23 watt ved et svar på en middels lang prompt, mens Claude 4 Opus bruker 5 watt (IEEE Spectrum, 2026). Effektivitet per svar er den underliggende driveren bak både pris og klimaavtrykk, og den er verdt å følge for virksomheter med rapporteringskrav. For budsjettet er den indirekte, men den peker samme vei som prisene.
Vanlige feil når SMB-er budsjetterer AI-agenter
De fleste sprukne AI-budsjetter vi ser skyldes ikke dårlige beslutninger, men riktige beslutninger tatt på feil størrelse. Tre feil går igjen.
Å budsjettere fra prislisten
Å gange antatt antall forespørsler med prisen per million tokens gir et tall som ser presist ut og som er systematisk for lavt. Det ignorerer at agentiske oppgaver sluker mange ganger flere tokens enn en enkel forespørsel, og det ignorerer mislykkede forsøk helt (VentureBeat). Budsjetter fra målte oppgaver, ikke fra antatte forespørsler.
Å bruke toppmodellen på alle oppgaver
Det er fristende å standardisere på den sterkeste modellen for å slippe å tenke. Med et prisspenn fra under en dollar til over fjorten dollar per million tokens er det en dyr forenkling (punku.ai, 2026). Rutinemessig klassifisering, uttrekk og formatering trenger ikke frontmodell. Bygg rutinglaget tidlig, mens oppsettet er lite nok til at det er enkelt.
Å glemme at antall agenter vokser
Kostnadsmodellen som holder for ett agentoppsett holder sjelden når hver avdeling har sitt. Vi har sett nærmere på hva det gjør med systemlandskapet i saken om tolv agenter per bedrift. Sett et felles tak og en felles rapportering fra første agent, ikke fra den femte. Det samme gjelder tilgangsstyring, som blir en kostnadssak i det agenter får skrive til produksjonssystemer, noe vi berørte i omtalen av sikre AI-agenter.
Ofte stilte spørsmål om token-kostnader
Spørsmålene under er de vi får oftest fra ledere som skal legge frem et AI-budsjett for styret.
Hva koster en AI-agent i måneden?
Spørsmålet kan ikke besvares fra en prisliste, og enhver leverandør som svarer med et tall uten å spørre om oppgavetypen din gjetter. Det som kan besvares er kostnad per fullført oppgave for en definert oppgavetype, målt over en uke. Gang det med forventet volum, og legg på et tak. Da har du et budsjett du kan forsvare.
Bør vi bytte modell eller fikse orkestreringen først?
Orkestreringen, i de fleste tilfeller. Writers forskere fant 40 prosent gjennomsnittlig kostnadsreduksjon fra harness-endringer, og pekte på at effektiviteten der multipliseres på tvers av alle modeller organisasjonen kjører (TechCrunch, 2026). Unntaket er hvis du kjører en dyr frontmodell på oppgaver som åpenbart ikke trenger den. Da er ruting det raskeste tiltaket.
Er åpne modeller billigere i praksis?
Ofte i enhetspris, ikke alltid i totalkostnad. Kimi K3 ligger på 4,33 dollar blandet per million tokens som høyest rangerte åpne vekt-modell i topp ti (punku.ai, 2026). Kjører du dem selv, flytter kostnaden seg fra API-regning til maskinvare og drift. Kjøper du dem som tjeneste, som Writer gjør med sin GLM-baserte modell, får du enhetsprisen uten driftsansvaret (TechCrunch, 2026).
Hvordan påvirker AI Act kostnadene våre?
Mest gjennom dokumentasjon og merking. Generativ AI må oppfylle åpenhetskrav, og AI-generert innhold skal merkes tydelig (EU-kommisjonen). Kostnaden er i hovedsak en engangsjobb med logging og klassifisering, pluss løpende vedlikehold. Systemer som utelukkende brukes til vitenskapelig forskning og utvikling faller utenfor virkeområdet (EUR-Lex, 2024).
Hvor mye kan vi realistisk spare?
De publiserte tallene gjelder kombinasjonen av modell og orkestrering, og de er målt av leverandøren selv (VentureBeat). Behandle dem som en hypotese å teste på egne oppgaver. Den delen av besparelsen som kommer fra ruting og kontekststyring er lettest å reprodusere, fordi den ikke avhenger av at leverandørens modell passer akkurat din bruk.
Oppsummering og veien videre
Enhetsprisen på tokens faller, men den er ikke det som bestemmer AI-regningen din. Volumveksten i agentiske arbeidsflyter spiser prisfallet, og har gjort det så grundig at totale kostnader har gått opp mens prislistene har gått ned (VentureBeat). Den erkjennelsen flytter kostnadsarbeidet fra innkjøp til ingeniørarbeid.
Regn kostnad per fullført oppgave, ikke per million tokens. Instrumenter to eller tre oppgavetyper, definer hva godkjent betyr, mål antall forsøk og fullføringsgrad, og legg menneskelig etterarbeid inn i samme regnestykke. Da vet du om problemet ditt er prisen, forbruket eller kvaliteten, og de tre krever helt ulike tiltak.
Legg deretter innsatsen der den følger med videre. Orkestreringslaget gjelder alle modeller du kjører, mens et modellbytte gjelder til neste gang markedet flytter seg, og med 128 lanseringer på tolv måneder flytter det seg ofte (benchlm.ai). Sett tak, rut oppgavene etter kompleksitet, og behandle enhver publisert besparelse som noe du skal etterprøve på hundre av dine egne oppgaver før du fører den inn i budsjettet.
I Alura bygger vi AI-infrastruktur for norske virksomheter, fra dataplattformer til agentiske systemer i produksjon. Vi er ikke en SaaS-leverandør. Vi er håndverkere som setter sammen byggesteinene som faktisk fungerer for din situasjon.
Bestill en arkitektur-samtale: vi går gjennom din nåværende infrastruktur, identifiserer integrasjonspunkter, og foreslår en pragmatisk vei videre. Uforpliktende, 45 minutter.
Kilder
- VentureBeat. Writer says its new Palmyra X6 model cuts AI agent costs ...
- TechCrunch (2026). Writer introduces new AI model and upgraded harness to contain token costs
- punku.ai (2026). AI Comparison 2026: The Best AI Models
- benchlm.ai. AI Model Release Statistics (2026): Launch Cadence by Lab
- EU-kommisjonen. EU AI Act: first regulation on artificial intelligence
- NVIDIA. AI Models
- EUR-Lex (2024). Regulation (EU) 2024/1689 of the European Parliament and ...
- IEEE Spectrum (2026). Stanford's AI Index for 2026 Shows the State of AI - IEEE Spectrum
Alura
Praktisk kunnskap om AI-automatisering og effektivisering for norske bedrifter.
Les neste
Stripe kjøper AI-gatewayen som ruter 10 billioner tokens
Stripe betaler 7,5 milliarder dollar for OpenRouter, gatewayen som ruter 10 billioner tokens daglig mellom 400 modeller. Dette bør norske SMB-er vurdere rundt pris og leverandorrisiko.
Gemini 3.7 Flash koster halv pris ut 2026
Google halverte tokenprisen på Gemini 3.7 Flash frem til 31. desember 2026. Her er hva norske utviklingsteam bør teste nå, og hvordan de budsjetterer for doblingen i 2027.
Claude Code auto mode fanger 89 prosent, mennesker 13,6
Auto mode blir standard i Claude Code fra 14. august. Her er tallene bak sikkerhetsloftet, kontrollene som faktisk virker, og hva norske SMB-team bor sette opp forst.
AI-sikkerhetsrutiner for SMB når AI selv kjører angrepene
Check Point beskriver AI som aktiv angrepsoperatør, og i tjenestesektoren har én av 17 AI-interaksjoner betydelig risiko for dataeksponering. Her er rutinene SMB-er bør ha på plass.

