20 min

    Token-kostnader faller 75 prosent mens regningen femdobles

    Enhetsprisen på tokens faller 75 prosent, men totalkostnaden femdobles. Her er tallene bak prislappen på AI-agenter og hva norske SMB-er bør regne på først.

    Teknologi & Verktøytoken-kostnader AI-agenterkostnad AI-agenterpris per million tokensPalmyra X6AI-budsjett SMBagentisk AI kostnaderAI-modeller 2026
    Token-kostnader faller 75 prosent mens regningen femdobles

    Nøkkelpunkter per 24. august 2026:

    • Enhetsprisen på tokens har falt 75 prosent mens totale kostnader er femdoblet, fordi agentiske oppgaver bruker rundt 20 ganger flere tokens (VentureBeat).
    • Orkestreringen slår modellbyttet: Writer-forskere målte 40 prosent gjennomsnittlig kostnadskutt fra endringer i harness-laget alene (TechCrunch, 2026).
    • Prisspennet er stort nok til å avgjøre lønnsomheten: fra 0,31 dollar per million tokens for GPT-5.6 Luna til 14,44 dollar for Claude Fable 5 (punku.ai, 2026).
    • 128 modellanseringer på tolv måneder frem til august 2026, og 45 prosent av dem kom med åpne vekter (benchlm.ai).
    • AI Act krever åpenhet om AI-generert innhold, og forpliktelsene for høyrisikosystemer inntrer 36 måneder etter ikrafttredelse (EU-kommisjonen).

    Token-kostnader forklart for beslutningstakere

    Et token er en tekstbit, omtrent en stavelse eller et kort ord. Modellene tar betalt per million tokens inn og per million tokens ut, og prisen står i en prisliste som ser ut som et enkelt, sammenlignbart tall. Det tallet er en enhetspris, ikke en kostnad. Avstanden mellom de to er hele grunnen til at AI-budsjetter sprekker i år der prislistene faller.

    For en SMB som vurderer AI-agenter er dette den viktigste distinksjonen i hele budsjettarbeidet. Du kjøper ikke tokens, du kjøper fullførte oppgaver. Mellom de to ligger et forbruksmønster du kontrollerer langt mindre enn du tror, og som endrer seg hver gang noen justerer en systemprompt eller kobler på et nytt verktøy.

    Input og output prises ulikt

    Modellene tar mer betalt for det de skriver enn for det de leser. Writers nye Palmyra X6 ligger på 2 dollar per million input-tokens og 8 dollar per million output-tokens, mens Claude Opus 4.8 er priset til 15 dollar for input og 75 dollar for output per million tokens (VentureBeat). Et agentoppsett som resonnerer mye, og altså produserer mye output, får en helt annen kostnadsprofil enn en chatbot som svarer kort. Den samme modellen kan være billig i ett bruksmønster og dyr i et annet, uten at prislisten har endret seg.

    Blandet pris skjuler et forholdstall

    Ledertavler oppgir gjerne en blandet pris per million tokens, som forutsetter et bestemt forhold mellom input og output. GPT-5.6 Luna havner på rundt 0,31 dollar per million tokens ved en 8:1-blanding av input og output (punku.ai, 2026). Endrer bruksmønsteret ditt det forholdet, endrer den effektive prisen seg umiddelbart. Blandet pris er nyttig for grovsortering av kandidater og ubrukelig som budsjettgrunnlag.

    Enhetsprisen er ikke kostnaden

    Alura mener at kostnad skal regnes per fullført oppgave, ikke per million tokens. Enhetsprisen alene skjuler hvor mange tokens et agentoppsett faktisk bruker for å komme i mål. To leverandører med identisk prisliste kan sende deg regninger som skiller seg kraftig, fordi det ene oppsettet leser hele konteksten på nytt i hvert steg og det andre ikke gjør det. Prislisten er en av fire faktorer, og sjelden den som avgjør.

    Prisfallet som likevel femdobler regningen

    Enhetsprisene på tokens har falt 75 prosent, og totale kostnader har likevel femdoblet seg (VentureBeat). Forklaringen ligger åpent i dagen: agentiske oppgaver bruker i størrelsesorden 20 ganger flere tokens enn en vanlig chatforespørsel. Når volumet vokser raskere enn prisen faller, går regningen opp uansett hvor gunstig prislisten ser ut.

    StørrelseRetningNivå
    Enhetspris per tokenNed75 prosent fall
    Token-forbruk i agentiske oppgaverOpp20 ganger
    Totale AI-kostnaderOppFemdoblet
    Prognostisert forbruk mot 2030Opp24 ganger

    Dette er den sentrale mekanismen bak all kostnadsdiskusjon om AI-agenter i 2026. Prisfallet er reelt, men det blir spist opp av volumvekst før det når budsjettlinjen din. En leder som planlegger ut fra «tokens blir jo billigere hvert kvartal» planlegger for feil kurve.

    Hvorfor agenter sluker tokens

    En chatforespørsel er ett kall. En agent bryter oppgaven i steg, kaller verktøy, leser resultatene, vurderer om den er i mål, og fortsetter. Hvert steg sender som regel hele samtalehistorikken inn på nytt, slik at input-siden vokser kvadratisk gjennom oppgaven. Legger du på verktøyoutput, søkeresultater og dokumentinnhold, blir de fleste tokens i et agentoppsett brukt på å lese det agenten selv nettopp produserte. Vi har skrevet mer om hvordan dette slår ut i utviklerverktøy i vår gjennomgang av token-budsjett i kodeverktøy.

    Prognosen frem mot 2030

    Goldman Sachs anslår at token-forbruket vil multipliseres med 24 ganger mellom 2026 og 2030, til en prognose på 120 quadrillion tokens per måned (VentureBeat). Prognoser på dette nivået er grove, og de er verdt å lese som retning heller enn som tall. Retningen er tydelig nok: forbruket vokser fortere enn prisene faller, og det er forbruket du styrer.


    Les også: Token-budsjett for AI-kodeverktøy: Uber-saken og norske SMB. Uber brukte opp hele 2026-budsjettet på fire måneder.


    Fire kostnadsdrivere i et agentoppsett

    Fire størrelser bestemmer hva et agentoppsett koster. De ganges sammen, ikke legges sammen, og derfor slår en forbedring i den ene igjennom på hele regningen. De fleste diskusjoner om AI-kostnader handler om den første og ignorerer de tre andre.

    DriverHva den styrerHvor du påvirker den
    EnhetsprisKroner per million tokens inn og utModellvalg og ruting mellom modeller
    Tokens per stegHvor mye kontekst og verktøyoutput som sendes inn på nyttOrkestrering, komprimering, caching
    Antall forsøkHvor ofte agenten må prøve på nytt før resultatet godkjennesModellkvalitet, verktøydesign, evaluering
    TidsbudsjettHvor lenge agenten får jobbe uovervåketTak, avbrudd og godkjenningspunkter

    Driver 1: enhetsprisen på modellen

    Enhetsprisen er den eneste driveren leverandøren publiserer, og derfor den eneste de fleste sammenligner. Spennet mellom modellene er stort: fra 0,54 dollar per million tokens for Gemini 3.5 Flash-Lite til 14,44 dollar for Claude Fable 5 (punku.ai, 2026). Det spennet er stort nok til å avgjøre om et agentprosjekt lønner seg, men bare hvis de tre andre driverne holdes noenlunde like.

    Driver 2: tokens per steg

    Dette er driveren som gjør agenter dyre. Hvor mye av samtalehistorikken sendes inn på nytt i hvert steg? Hvor mye rå verktøyoutput får lov til å havne i konteksten? Komprimerer oppsettet mellomresultater, eller dumper det hele dokumenter inn i hver runde? Et oppsett som håndterer dette dårlig kan bruke flere ganger så mange tokens som et som håndterer det godt, på nøyaktig samme modell og nøyaktig samme oppgave.

    Driver 3: antall forsøk før oppgaven er godkjent

    En agent som ofte må gjøre samme oppgave om igjen koster langt mer per fullført oppgave enn prislisten antyder, og det er før du regner inn menneskelig etterarbeid. Kvalitetsforskjeller mellom modeller er ofte små på papiret: Writer oppgir 0,87 i gjennomsnittlig score på egne evalueringer for X6 mot 0,85 for Claude Sonnet 4.6 (VentureBeat). Små forskjeller i suksessrate gir store forskjeller i kostnad, fordi et mislykket forsøk koster like mye i tokens som et vellykket. Vi har argumentert for at pålitelighet før hastighet er riktig rekkefølge nettopp av denne grunn.

    Driver 4: tiden agenten får lov til å jobbe

    Autonomi er en kostnadsdriver, ikke bare en funksjon. Writer oppgir at X6 bruker 26 sekunder i snitt på å fullføre en oppgave, men at modellen kan jobbe uovervåket mot et mål i inntil åtte timer (VentureBeat). Snittet er billig. Halen er ikke. Uten tak på steg, tid eller kroner er det halen som definerer verstefallsregningen din, og halen er den som dukker opp i en produksjonshendelse en fredag ettermiddag.

    Modellvalg eller orkestrering: hvor besparelsen faktisk ligger

    Det mest interessante funnet i årets kostnadsdebatt handler ikke om modeller. Writer-forskere fant at endringer i harness, altså orkestreringslaget rundt modellen, var en mer pålitelig måte å kutte kostnader på enn å bytte modell, med et gjennomsnittlig kutt på 40 prosent (TechCrunch, 2026). Begrunnelsen er strukturell: harness er komponenten hvis effektivitet multipliseres på tvers av alle modellene en organisasjon kjører.

    Hva orkestreringslaget faktisk gjør

    Harness er alt som ikke er modellen: hvordan oppgaven brytes i steg, hva som havner i konteksten, når verktøy kalles, hvordan mellomresultater komprimeres, når agenten får stoppe. Writer oppgir 41 prosent kostnadsreduksjon og 44 prosent hastighetsforbedring fra harness-endringene alene, og 52 prosent lavere kostnad, 48 prosent raskere og 10 prosent bedre kvalitet for agentproduktet samlet med Palmyra X6 (VentureBeat). Selskapet anslår at kundene kan se opptil 50 prosent lavere kostnad for grunnleggende oppgaver (TechCrunch, 2026).

    TiltakMålt effektGjelder for
    Bytte til billigere modellVarierer med oppgave og kvalitetskravDen ene modellen du bytter
    Endre harness og orkestrering41 prosent lavere kostnad, 44 prosent raskereAlle modeller du kjører
    Modell og harness samlet52 prosent lavere kostnad, 48 prosent raskere, 10 prosent bedre kvalitetLeverandørens eget agentprodukt

    Hvorfor modellbytte er mindre forutsigbart

    Alura mener at orkestreringslaget rundt modellen ofte gir mer forutsigbar besparelse enn å bytte modell, fordi effektiviteten der gjelder alle modellene du kjører. Et modellbytte er en engangsgevinst som må gjentas hver gang markedet flytter seg, og som må valideres på nytt for hver oppgavetype. En forbedring i hvordan du håndterer kontekst følger med videre til neste modell.

    Samtidig er tallene over leverandørens egne. Alura mener at leverandørens kostnadstall er et utgangspunkt for testing, ikke en garanti, og at reell besparelse avhenger av bruksmønster og integrasjon. Writers CEO May Habib peker selv på at store AI-laboratorier har økonomiske insentiver til å øke token-bruken (TechCrunch, 2026). Den observasjonen gjelder også for leverandører som selger kostnadskutt.

    Regn ut kostnad per fullført oppgave, ikke per token

    Her er den praktiske delen. Kostnad per fullført oppgave er summen av det du betaler for alle forsøk, delt på antall oppgaver som faktisk ble godkjent. Formelen ser slik ut: (input-tokens per forsøk ganger inputpris, pluss output-tokens per forsøk ganger outputpris), ganget med antall forsøk per oppgave, delt på fullføringsgraden, pluss kostnaden for menneskelig etterarbeid.

    Ingen av disse størrelsene finnes i en prisliste. Alle finnes i loggene dine etter en uke med målrettet instrumentering. Det er derfor denne øvelsen alltid begynner med måling og aldri med et anbud.

    De fem tallene du trenger

    KomponentHva du målerHvor det hentes
    Input-tokens per forsøkSum tokens sendt inn over alle steg i oppgavenAPI-logg per kall
    Output-tokens per forsøkSum tokens generert av modellenAPI-logg per kall
    Forsøk per oppgaveTotale kjøringer delt på unike oppgaverOppgavelogg med korrelasjons-ID
    FullføringsgradAndel oppgaver godkjent uten manuelt inngrepEvaluering eller stikkprøve
    Menneskelig etterarbeidMinutter brukt etter agenten per oppgaveTidsregistrering på et utvalg

    Legg merke til at bare de to første kommer gratis fra leverandøren. De tre siste krever at du definerer hva en fullført oppgave er, og det er den definisjonen som gjør resten av regnestykket meningsfullt. Uten den måler du aktivitet, ikke resultat.

    Fullføringsgraden er multiplikatoren

    Fullføringsgraden ligger i nevneren, og derfor slår den hardest ut av alle tallene i modellen. Faller den, stiger kostnaden per fullført oppgave selv om ikke en eneste token er blitt dyrere. Det er også den eneste størrelsen som fanger opp kvalitetsforskjeller mellom modeller på en måte som er direkte sammenlignbar med kroner. En dyrere modell som fullfører mer kan være den billigste totalt.

    Etterarbeidet hører hjemme i regnestykket

    Det vanligste hullet i AI-budsjetter er at menneskelig kontroll ikke telles med. Hvis en saksbehandler bruker syv minutter på å kvalitetssikre noe agenten produserte på 26 sekunder, ligger hovedkostnaden i lønn, ikke i tokens. Da er tiltaket som lønner seg å redusere kontrollbehovet, ikke å bytte til en modell som er noen øre billigere. Regn etterarbeidet inn fra første måling, ellers optimaliserer du feil størrelse i et halvt år.

    Dette gjør du den første uken med kostnadskontroll

    Fem arbeidsdager er nok til å komme fra «vi vet ikke hva dette koster» til en kostnad per fullført oppgave du kan legge frem for styret. Rekkefølgen betyr mer enn verktøyene.

    Dag 1 og 2: mål før du optimaliserer

    Legg på en korrelasjons-ID per oppgave, og logg input-tokens, output-tokens, antall steg og utfall for hvert kall. Velg de to eller tre oppgavetypene som står for mesteparten av volumet, ikke alle. Definer skriftlig hva godkjent resultat betyr for hver av dem, og la en person som faktisk gjør jobben eie den definisjonen. Uten dette blir alt senere arbeid gjetting med desimaler.

    Dag 3 og 4: sett tak og rut oppgavene

    Innfør harde tak: maks antall steg per oppgave, maks tid per kjøring, og et månedlig kronetak med varsling før det treffes. Rut deretter oppgavene: enkle klassifiserings- og uttrekksoppgaver til en billig modell, komplekse resonneringsoppgaver til en sterk. Prisspennet mellom 0,31 dollar og 14,44 dollar per million tokens gjør ruting til et av de mest lønnsomme tiltakene som finnes (punku.ai, 2026). Rutinglaget bør ligge i din kode, ikke i leverandørens produkt, slik at det overlever et bytte.

    Dag 5: test leverandørens tall mot dine egne

    Kjør den samme oppgavemengden gjennom to oppsett og sammenlign kostnad per fullført oppgave, ikke per token. De publiserte besparelsene er målt på leverandørens egne oppgaver og eget produkt (VentureBeat). Dine oppgaver har annen kontekstlengde, andre verktøy og andre kvalitetskrav. En A/B-test på hundre reelle oppgaver forteller deg mer enn enhver benchmark, og den tar en ettermiddag.

    Modellmarkedet i 2026 og 128 lanseringer på tolv måneder

    Kostnadsplanlegging er vanskelig fordi grunnlaget flytter seg. BenchLM sporet 128 AI-modellanseringer i løpet av tolv måneder frem til 18. august 2026, og juli 2026 var travleste måned med 21 utgivelser (benchlm.ai). Et modellvalg tatt i januar er ikke nødvendigvis riktig i september, og det er nettopp derfor besparelser som ligger i din egen kode er mer verdifulle enn besparelser som ligger i et leverandørvalg.

    Hvem lanserer mest

    OpenAI og Alibaba toppet med 12 sporede utgivelser hver, Google og Anthropic fulgte med 10, mens Meta, DeepSeek og NVIDIA lå på 4 og Z.AI på 3 (benchlm.ai). Konsentrasjonen på toppen er mindre enn omtalen antyder. For en SMB betyr det at leverandørrisikoen ikke først og fremst handler om hvem som vinner, men om hvor dyrt det er for deg å bytte når rangeringen endrer seg.

    Åpne vekter som prisdemper

    45 prosent av de klassifiserte utgivelsene var åpne vektmodeller (benchlm.ai). Effekten ser du direkte i prisene: Kimi K3 er høyest rangerte åpne vekt-modell i topp ti med en blandet API-pris på 4,33 dollar per million tokens (punku.ai, 2026). Palmyra X6 er selv bygget som en post-training-variant av Z.ai sin åpne GLM-5.2, kjørt på amerikansk infrastruktur (TechCrunch, 2026). Åpne vekter åpner også for lokal kjøring, som vi har sett nærmere på i saken om komprimerte modeller lokalt.


    Les også: Tolv AI-agenter per bedrift endrer CRM for norske SMB-er. Organisasjoner kjorer i snitt tolv AI-agenter, og adopsjonen ventes a oke 67 prosent pa to ar.


    Hva de ledende modellene koster per million tokens

    Tabellen under viser rangering og pris fra LLM Stats-snapshotet 7. august 2026. Metodikken er dynamisk, og score fra august bør ikke sammenlignes direkte med tidligere snapshots (punku.ai, 2026). Les den som et øyeblikksbilde av prisstrukturen, ikke som en fasit.

    ModellScore i LLM StatsPris per 1M tokens
    GPT-5.6 Sol57,2Ikke oppgitt
    Claude Opus 556,5Ikke oppgitt
    Claude Fable 556,314,44 dollar blandet
    Kimi K3 (åpne vekter)55,44,33 dollar blandet
    GPT-5.6 TerraIkke oppgitt3,11 dollar blandet
    Claude Sonnet 5Ikke oppgitt2,89 dollar blandet
    Gemini 3.5 Flash-LiteIkke oppgitt0,54 dollar
    GPT-5.6 LunaIkke oppgitt0,31 dollar ved 8:1

    Toppen av ledertavlen er sjelden der pengene ligger

    GPT-5.6 Sol topper med 57,2 poeng, og avstanden ned til Claude Fable 5 er 0,9 poeng (punku.ai, 2026). Prisforskjellen mellom modeller i samme sjikt er derimot ikke marginal. Alura mener at modell skal velges etter oppgaven, ikke etter toppen av en ledertavle, fordi prisspennet mellom modellene er stort nok til å avgjøre om et agentprosjekt lønner seg. En modell som er noen tiendeler bedre på en samlescore kan være helt feil valg for en uttrekksoppgave som kjøres titusenvis av ganger i måneden.

    Kontekstvindu og hastighet påvirker regningen

    Grok-4 Fast Reasoning har det største praktiske kontekstvinduet LLM Stats sporer, med 2M tokens, mens Mercury 2 leder på hastighet med 988 tokens per sekund (punku.ai, 2026). Store kontekstvinduer er en felle like mye som en fordel: kapasiteten inviterer til å sende inn alt, og alt koster input-tokens i hvert eneste steg. Hastighet betyr mest der en agent kjører mange korte steg etter hverandre, fordi ventetiden da blir en lønnskostnad.

    Maskinvaren som setter prisgulvet

    Prislistene henger sammen med hva det koster å kjøre inferens. NVIDIA oppgir 50 ganger ytelsesforbedring og 35 ganger kostnadsreduksjon for agentisk AI med Blackwell Ultra, og 15 ganger ytelsesfordel for DeepSeek-R1 på GB200 NVL72 sammenlignet med Hopper H200 (NVIDIA). Tallene er leverandørens egne og målt på gunstige konfigurasjoner. De forklarer likevel hvorfor enhetsprisene fortsetter å falle, og hvorfor det fallet ikke er nok til å holde regningen din i ro.

    AI Act og åpenhetskravene som treffer agentoppsettet

    Regulering er en kostnadsdriver som sjelden står i budsjettet. Forordning (EU) 2024/1689, bedre kjent som AI Act, ble vedtatt 13. juni 2024 og fastsetter en enhetlig juridisk ramme for utvikling, markedsføring og bruk av AI-systemer i EU (EUR-Lex, 2024). Den definerer et AI-system som et maskinbasert system designet til å operere med varierende nivåer av autonomi, og som kan utvise adaptivitet etter utrulling. Den definisjonen treffer agentoppsett direkte.

    Åpenhetskrav som koster tokens og tid

    Generativ AI må overholde åpenhetskrav og EUs opphavsrettslovgivning, og AI-generert innhold som deepfakes må merkes tydelig (EU-kommisjonen). I praksis betyr det logging, sporbarhet og merking i produksjon. Loggingen er billig i seg selv, men den forutsetter at du allerede har korrelasjons-ID og oppgavedefinisjoner på plass. Det er de samme byggeklossene du trenger for å regne kostnad per fullført oppgave, som gjør at etterlevelse og kostnadskontroll kan bygges i samme trekk.

    Tidslinjen du planlegger etter

    HendelseTidspunkt
    Kommisjonens forslagApril 2021
    Forordning (EU) 2024/1689 vedtatt13. juni 2024
    Fullt anvendelig24 måneder etter ikrafttredelse
    Forpliktelser for høyrisikosystemer36 måneder etter ikrafttredelse

    Loven følger en risikobasert tilnærming: forbud mot uakseptable praksiser, krav til høyrisikosystemer, og åpenhetsforpliktelser for visse systemer (EUR-Lex, 2024). Høyrisikosystemer må vurderes både før de settes på markedet og gjennom hele livssyklusen (EU-kommisjonen). For de fleste norske SMB-er havner agentoppsettene under åpenhetskravene og ikke i høyrisikokategorien, men klassifiseringen bør gjøres skriftlig og en gang, ikke antas.

    Markedssignaler å følge når token-forbruket vokser

    Fire signaler forteller deg om kostnadsbildet er i ferd med å snu: investeringstakten, beregningskapasiteten, lanseringsfrekvensen og energibruken per svar. Ingen av dem er direkte handlingsutløsende, men samlet forteller de om prisfallet fortsetter eller flater ut.

    Investeringene og kapasiteten

    Global AI-investering nådde 581 milliarder dollar i 2025, opp fra 253 milliarder dollar i 2024, og godt over den tidligere rekorden på 360 milliarder dollar fra 2021 (IEEE Spectrum, 2026). USA alene sto for 344 milliarder dollar. Verdens AI-beregningskapasitet har mer enn tredoblet seg årlig siden 2022, og er 30 ganger større enn i 2021. Kapasitetsvekst er det som gjør prisfall mulig, og den veksten er finansiert av kapital som forventer avkastning, altså høyere forbruk.

    Energibruk per svar som prisindikator

    Energiforbruk per respons varierer mer mellom modeller enn de fleste tror. DeepSeek V3 bruker 23 watt ved et svar på en middels lang prompt, mens Claude 4 Opus bruker 5 watt (IEEE Spectrum, 2026). Effektivitet per svar er den underliggende driveren bak både pris og klimaavtrykk, og den er verdt å følge for virksomheter med rapporteringskrav. For budsjettet er den indirekte, men den peker samme vei som prisene.

    Vanlige feil når SMB-er budsjetterer AI-agenter

    De fleste sprukne AI-budsjetter vi ser skyldes ikke dårlige beslutninger, men riktige beslutninger tatt på feil størrelse. Tre feil går igjen.

    Å budsjettere fra prislisten

    Å gange antatt antall forespørsler med prisen per million tokens gir et tall som ser presist ut og som er systematisk for lavt. Det ignorerer at agentiske oppgaver sluker mange ganger flere tokens enn en enkel forespørsel, og det ignorerer mislykkede forsøk helt (VentureBeat). Budsjetter fra målte oppgaver, ikke fra antatte forespørsler.

    Å bruke toppmodellen på alle oppgaver

    Det er fristende å standardisere på den sterkeste modellen for å slippe å tenke. Med et prisspenn fra under en dollar til over fjorten dollar per million tokens er det en dyr forenkling (punku.ai, 2026). Rutinemessig klassifisering, uttrekk og formatering trenger ikke frontmodell. Bygg rutinglaget tidlig, mens oppsettet er lite nok til at det er enkelt.

    Å glemme at antall agenter vokser

    Kostnadsmodellen som holder for ett agentoppsett holder sjelden når hver avdeling har sitt. Vi har sett nærmere på hva det gjør med systemlandskapet i saken om tolv agenter per bedrift. Sett et felles tak og en felles rapportering fra første agent, ikke fra den femte. Det samme gjelder tilgangsstyring, som blir en kostnadssak i det agenter får skrive til produksjonssystemer, noe vi berørte i omtalen av sikre AI-agenter.

    Ofte stilte spørsmål om token-kostnader

    Spørsmålene under er de vi får oftest fra ledere som skal legge frem et AI-budsjett for styret.

    Hva koster en AI-agent i måneden?

    Spørsmålet kan ikke besvares fra en prisliste, og enhver leverandør som svarer med et tall uten å spørre om oppgavetypen din gjetter. Det som kan besvares er kostnad per fullført oppgave for en definert oppgavetype, målt over en uke. Gang det med forventet volum, og legg på et tak. Da har du et budsjett du kan forsvare.

    Bør vi bytte modell eller fikse orkestreringen først?

    Orkestreringen, i de fleste tilfeller. Writers forskere fant 40 prosent gjennomsnittlig kostnadsreduksjon fra harness-endringer, og pekte på at effektiviteten der multipliseres på tvers av alle modeller organisasjonen kjører (TechCrunch, 2026). Unntaket er hvis du kjører en dyr frontmodell på oppgaver som åpenbart ikke trenger den. Da er ruting det raskeste tiltaket.

    Er åpne modeller billigere i praksis?

    Ofte i enhetspris, ikke alltid i totalkostnad. Kimi K3 ligger på 4,33 dollar blandet per million tokens som høyest rangerte åpne vekt-modell i topp ti (punku.ai, 2026). Kjører du dem selv, flytter kostnaden seg fra API-regning til maskinvare og drift. Kjøper du dem som tjeneste, som Writer gjør med sin GLM-baserte modell, får du enhetsprisen uten driftsansvaret (TechCrunch, 2026).

    Hvordan påvirker AI Act kostnadene våre?

    Mest gjennom dokumentasjon og merking. Generativ AI må oppfylle åpenhetskrav, og AI-generert innhold skal merkes tydelig (EU-kommisjonen). Kostnaden er i hovedsak en engangsjobb med logging og klassifisering, pluss løpende vedlikehold. Systemer som utelukkende brukes til vitenskapelig forskning og utvikling faller utenfor virkeområdet (EUR-Lex, 2024).

    Hvor mye kan vi realistisk spare?

    De publiserte tallene gjelder kombinasjonen av modell og orkestrering, og de er målt av leverandøren selv (VentureBeat). Behandle dem som en hypotese å teste på egne oppgaver. Den delen av besparelsen som kommer fra ruting og kontekststyring er lettest å reprodusere, fordi den ikke avhenger av at leverandørens modell passer akkurat din bruk.

    Oppsummering og veien videre

    Enhetsprisen på tokens faller, men den er ikke det som bestemmer AI-regningen din. Volumveksten i agentiske arbeidsflyter spiser prisfallet, og har gjort det så grundig at totale kostnader har gått opp mens prislistene har gått ned (VentureBeat). Den erkjennelsen flytter kostnadsarbeidet fra innkjøp til ingeniørarbeid.

    Regn kostnad per fullført oppgave, ikke per million tokens. Instrumenter to eller tre oppgavetyper, definer hva godkjent betyr, mål antall forsøk og fullføringsgrad, og legg menneskelig etterarbeid inn i samme regnestykke. Da vet du om problemet ditt er prisen, forbruket eller kvaliteten, og de tre krever helt ulike tiltak.

    Legg deretter innsatsen der den følger med videre. Orkestreringslaget gjelder alle modeller du kjører, mens et modellbytte gjelder til neste gang markedet flytter seg, og med 128 lanseringer på tolv måneder flytter det seg ofte (benchlm.ai). Sett tak, rut oppgavene etter kompleksitet, og behandle enhver publisert besparelse som noe du skal etterprøve på hundre av dine egne oppgaver før du fører den inn i budsjettet.

    I Alura bygger vi AI-infrastruktur for norske virksomheter, fra dataplattformer til agentiske systemer i produksjon. Vi er ikke en SaaS-leverandør. Vi er håndverkere som setter sammen byggesteinene som faktisk fungerer for din situasjon.

    Bestill en arkitektur-samtale: vi går gjennom din nåværende infrastruktur, identifiserer integrasjonspunkter, og foreslår en pragmatisk vei videre. Uforpliktende, 45 minutter.

    Kilder

    • VentureBeat. Writer says its new Palmyra X6 model cuts AI agent costs ...
    • TechCrunch (2026). Writer introduces new AI model and upgraded harness to contain token costs
    • punku.ai (2026). AI Comparison 2026: The Best AI Models
    • benchlm.ai. AI Model Release Statistics (2026): Launch Cadence by Lab
    • EU-kommisjonen. EU AI Act: first regulation on artificial intelligence
    • NVIDIA. AI Models
    • EUR-Lex (2024). Regulation (EU) 2024/1689 of the European Parliament and ...
    • IEEE Spectrum (2026). Stanford's AI Index for 2026 Shows the State of AI - IEEE Spectrum
    A

    Alura

    Praktisk kunnskap om AI-automatisering og effektivisering for norske bedrifter.