23 min

    AI-brikker kuttet inferenskostnaden 70 prosent hos AWS

    OpenAIs Jalapeno-brikke og AWS Inferentia peker samme vei: inferens blir billigere per token. Her er tallene norske SMB-er bor regne pa for opprampingen i 2027.

    Teknologi & VerktøyAI-inferens kostnaderAI-brikkerAWS InferentiaOpenAI JalapenoAI-kostnader i skyeninferens per tokenedge AI brikke
    AI-brikker kuttet inferenskostnaden 70 prosent hos AWS

    Nøkkelpunkter per 29. august 2026:

    • Inferens er driftskostnaden, ikke investeringen. AWS oppgir opptil 70 prosent lavere kostnad per inferens for Inf1-instanser mot sammenlignbare EC2-instanser (AWS).
    • OpenAIs Jalapeño målte 1,5 til 1,9 ganger mer AI-arbeid per watt ved topp gjennomstrømning mot sammenligningssystemene, men volumutrulling kommer først i 2027 (OpenAI).
    • Markedet for inferensbrikker ventes å vokse fra 17,73 milliarder dollar i 2025 til 36,97 milliarder dollar i 2030 (sg.finance.yahoo.com).
    • Strøm blir flaskehalsen. USA hadde 5 426 datasentre i mars 2025, og energiforbruket ventes å nå 130 GW innen 2030 (sg.finance.yahoo.com).
    • Europa satser på edge. EU-finansierte Aloe AI sikter mot språkmodeller på enheter under 1 W, med to størrelsesordener lavere kostnad per ytelse (EU-kommisjonen).

    Hva en AI-inferensbrikke faktisk gjør

    En AI-modell koster penger to ganger. Først når den trenes, deretter hver eneste gang den svarer. Den andre kostnaden heter inferens, og det er den eneste av de to som vokser i takt med hvor mye dere faktisk bruker modellen. En inferensbrikke er maskinvare bygget for akkurat den jobben: ta imot en forespørsel, kjøre den gjennom en ferdig trent modell og levere tokens tilbake så raskt og så billig som mulig.

    Det er derfor både OpenAI og Amazon nå designer sine egne. Jalapeño er en ASIC utviklet sammen med Broadcom (The Verge). AWS Inferentia er designet av AWS for å levere høy ytelse til lavest kostnad i Amazon EC2 for dyp læring og generativ AI-inferens (AWS). Begge er svar på det samme problemet: en generell GPU gjør langt mer enn inferens, og du betaler for hele brikken uansett.

    Prefill og dekoding er to ulike jobber

    Inferens består av to faser. Først leser modellen inn hele forespørselen din, systemprompt, kontekst og vedlegg, i det som kalles prefill. Deretter produserer den svaret token for token i dekodingsfasen. De to fasene belaster maskinvaren helt ulikt: prefill er regnetungt og parallelliserbart, dekoding er minnetungt og seriell. Jalapeño er eksplisitt designet for å minimere forsinkelser i prefill- og kommunikasjonsfasene (TechCrunch, 2026).

    Dette har direkte praktisk betydning. Et dokumentanalyseverktøy med lange vedlegg er prefill-tungt. En kundechat med korte spørsmål og lange svar er dekodingstung. En brikke som ser strålende ut på den ene profilen kan være middelmådig på den andre, og leverandøren viser deg sjelden begge.

    Tre måltall du må kunne før du snakker med en leverandør

    Gjennomstrømning er hvor mange tokens systemet leverer totalt per tidsenhet. Latens er hvor lenge den enkelte brukeren venter. Ytelse per watt er hvor mye arbeid du får ut per energienhet, og det er der prislappen kommer fra i et datasenter. De tre henger sammen og trekker ofte i hver sin retning: du kan kjøpe høy gjennomstrømning ved å samle mange forespørsler i store batcher, men da venter hver enkelt bruker lenger.

    AWS oppgir at Inferentia2 gir opptil 4x høyere gjennomstrømning og opptil 10x lavere latens enn forrige generasjon, med 190 TFLOPS FP16-ytelse per brikke (AWS). Det er nyttig som retning. Det sier ingenting om hva din applikasjon vil se.

    Derfor ligger den løpende kostnaden i inferensen

    Trening er en engangsutgift som ligner et prosjektbudsjett: stort, avgrenset, og deretter ferdig. Inferens er en enhetskostnad som ligner strøm eller frakt. Den følger volumet, og volumet følger hvor godt løsningen fungerer. For de aller fleste norske SMB-er er treningskostnaden dessuten irrelevant, fordi dere aldri kommer til å trene en grunnmodell. Dere kommer derimot til å kjøre inferens hver arbeidsdag i årevis.

    AI-brikker for inferens som reduserer kostnader
    AI-brikker for inferens som reduserer kostnader. Foto: Pachon in Motion / Pexels

    Det gir en ubehagelig dynamikk: regningen vokser når prosjektet lykkes. Prisen per token har falt kraftig, men forbruket har vokst raskere enn prisen har falt, og nettoresultatet for mange er en høyere regning enn i fjor (token-kostnader). Et budsjett som bare inneholder lisenser og oppstartsarbeid vil bomme systematisk.

    Suksess er den vanligste årsaken til budsjettsprekk

    En pilot med noen få brukere gir små tall. Så rulles løsningen ut, den blir god nok til at folk bruker den til mer enn den ble laget for, og forbruket per bruker stiger samtidig som antall brukere stiger. To kurver som ganges sammen. Den vanligste feilen er å skalere pilotens totale forbruk lineært med antall ansatte, i stedet for å måle forbruk per aktiv bruker og legge på at aktive brukere også bruker mer over tid.

    Motmidlet er ikke å bremse bruken. Det er å vite hva en enhet koster, slik at dere kan svare på om den er verdt prisen. Uten det tallet blir enhver diskusjon om AI-budsjett en diskusjon om magefølelse.

    Minne og båndbredde, ikke bare regnekraft

    Ved dekoding er det sjelden regnekraften som er flaskehalsen. Det er hvor raskt brikken kan hente modellvektene ut av minnet. Derfor er generasjonsspranget hos AWS like mye et minnesprang: fra 8 GB DDR4 per Inferentia-brikke til 32 GB HBM per Inferentia2-brikke, altså 4x mer totalt minne og 10x høyere minnebåndbredde (AWS).

    For deg som kjøper betyr det at «hvor stor modell får plass» og «hvor raskt kan den lese» er mer avgjørende for kostnaden per svar enn toppytelsen i TFLOPS. Store modeller som må splittes over flere brikker betaler en kommunikasjonsavgift som ikke vises i datablader.


    Les også: Token-kostnader faller 75 prosent mens regningen femdobles. Enhetsprisen på tokens faller 75 prosent, men totalkostnaden femdobles.


    Jalapeño i tall: hva OpenAI faktisk målte

    OpenAI la fram de første benchmarkresultatene for Jalapeño på Hot Chips-konferansen, og tallene viste høyere tokens per bruker og høyere gjennomstrømning per kilowatt enn eksisterende toppmoderne inferensprosessorer (TechCrunch, 2026). Brikken er OpenAIs første egendefinerte inferensbrikke, og den gikk fra første design til tapeout på ni måneder (OpenAI).

    Tidslinjen er verdt å merke seg før noen begynner å planlegge rundt den. Første utrulling skjer i svært små volumer ved utgangen av 2026, og mer betydelig utrulling først i 2027 (TechCrunch, 2026). OpenAI har også sagt at brikken ikke erstatter hele chip-linjen (The Verge). Dette er en flergenerasjonsplan, ikke en bryter som slås på.

    Tallene OpenAI publiserte

    Målingene er gjort på tre offentlig tilgjengelige modeller, slik at andre i prinsippet kan reprodusere oppsettet. Tallene til venstre er Jalapeño, tallene til høyre er sammenligningssystemet.

    ModellTopp blandet TPS/kWEnde-til-ende-latensTokens/s per bruker
    GPT-OSS 120B85 448 mot 44 9601,03 s mot 1,80 s1 459 mot 535
    DeepSeek R1 670B19 641 mot 11 7811,65 s mot 5,99 s700 mot 169
    Kimi K2.5 1T18 195 mot 11 8621,56 s mot 5,31 s694 mot 182

    Oppsummert oppgir OpenAI 1,5 til 1,9 ganger mer AI-arbeid per watt ved topp gjennomstrømning, 1,7 til 3,6 ganger lavere ende-til-ende-latens, og klart høyere ytelse for svært interaktive arbeidsbelastninger (OpenAI). Sammenligningen er mot Nvidia GB200 og GB300 (The Verge). Det interessante er ikke toppallet, men at gevinsten er størst der brukeren venter.

    700 watt på papiret, 550 watt målt

    Jalapeño har en publisert effektklassifisering på 700 watt, mens målt vedvarende effekt på den testede arbeidsbelastningen var 550 watt (OpenAI). Forskjellen er ikke en detalj. Datasenterkapasitet planlegges etter klassifisering, mens driftskostnaden følger faktisk forbruk, og ytelse per watt regnes ulikt avhengig av hvilket av de to tallene som brukes i nevneren.

    Merk også at OpenAI oppgir at brikken ble designet med AI-hjelp, og at AI-genererte implementasjoner av utvalgte GPT-OSS-blokker ga 1,5 til 1,8 ganger hastighetsøkning sammenlignet med menneskelige ekspertimplementasjoner. Det er et signal om utviklingstempo i hele bransjen, ikke bare hos OpenAI.

    Hva tallene ikke sier

    Alle tallene over er produsentens egne, målt på produsentens oppsett, med produsentens valg av sammenligningssystem, batchstørrelse og modellversjon. Det gjør dem ikke usanne. Det gjør dem uegnet som budsjettgrunnlag. Alura mener leverandørenes egne benchmarktall er utgangspunkt for spørsmål, ikke for budsjett. Krev måling på din egen arbeidsbelastning.

    Konkret: be om å få vite kontekstlengde, samtidighet, kvantisering og hvilken programvarestabel som ble brukt. En brikke som vinner på 128 samtidige forespørsler kan tape på fire. Og en gevinst målt på en 1T-parametermodell sier lite om hva dere får på den langt mindre modellen dere faktisk kommer til å kjøre. Hvis du vil ha bakgrunnen på aktøren, har vi dekket OpenAI separat.

    AWS Inferentia viser hva spesialbrikker gjør med prislappen

    Der Jalapeño fortsatt er et løfte, har AWS levert spesialbrikker til kunder i flere år. Det gir noe Jalapeño ikke har ennå: kunder som har flyttet reell produksjonstrafikk og rapportert hva som skjedde med regningen. AWS oppgir opptil 70 prosent lavere kostnad per inferens og opptil 2,3x høyere gjennomstrømning for Inf1-instanser sammenlignet med sammenlignbare EC2-instanser (AWS).

    Ordet «opptil» gjør mye arbeid i den setningen. Det er et tak, ikke et gjennomsnitt, og det forutsetter at modellen din kompilerer godt til brikken. Men størrelsesordenen er reell nok til at den bør endre hvordan dere stiller spørsmål til skyleverandøren.

    Hva som endret seg med Inferentia2

    Inf2-instanser er ifølge AWS de første inferensoptimaliserte instansene i EC2 som støtter skalerbar distribuert inferens med ultra-høyhastighetsforbindelse mellom brikker, og de tilbyr opptil 50 prosent bedre ytelse per watt enn sammenlignbare EC2-instanser (AWS). Brikken støtter også dynamiske inngangsstørrelser og egendefinerte operatører skrevet i C++.

    Den siste detaljen er viktigere enn den ser ut. Dynamiske inngangsstørrelser betyr at du slipper å padde alle forespørsler til samme lengde, og støtte for egendefinerte operatører betyr at en modell med uvanlige lag kan kjøres uten omskriving. Begge deler avgjør om taket AWS oppgir blir noe du faktisk ser på fakturaen.

    Kundetallene spriker, og det er hele poenget

    KundeRapportert effektHva det gjaldt
    NTT PC Communications90 prosent lavere kostnad, 25 prosent lavere latensInf1 mot GPU-baserte EC2-instanser
    Amazon Search85 prosent lavere ML-inferenskostnaderIntern søkeinfrastruktur
    Tomofun83 prosent lavere distribusjonskostnadBLIP-inferens
    Leonardo.ai80 prosent kostnadsreduksjonInferentia2
    Finch Computing80 prosent lavere enn GPUInf1-instanser
    ByteDance60 prosent besparelse på inferenskostnaderAWS Inferentia
    Metagenomi56 prosent lavere kostnadProteindesign
    Screening Eagle Technologies50 prosent kostnadsreduksjonMigrering til Inferentia
    Dataminr9x bedre gjennomstrømning per dollarAWS Inferentia

    Alle tallene i tabellen er hentet fra AWS sine kundehistorier (AWS). Spennet mellom kundene er ikke støy, det er informasjon: gevinsten avhenger av modelltype, trafikkmønster og hvor godt teamet klarte å kompilere modellen. Autodesk oppgir 4,9x høyere gjennomstrømning over G4dn for sine NLU-modeller på en virtuell agent som svarer på 100 000 kundespørsmål i måneden, mens NetoAI rapporterer inferenslatens på 300 til 600 ms med Inferentia2.

    Det disse historiene har til felles er at de gjelder modne, stabile arbeidsbelastninger med høyt volum. Der ligger gevinsten. En prototype med lav trafikk får ingenting igjen for spesialmaskinvare, og vil bruke mer på ingeniørtimer til migrering enn den sparer på regningen.

    Fire spørsmål som avgjør inferensregningen din

    De fleste anskaffelsesprosesser for AI stiller feil spørsmål. De handler om funksjonalitet, sikkerhet og pris per bruker, og hopper over det leddet som faktisk skalerer. Alura mener inferenskostnad per token, ikke lisenspris, er tallet norske SMB-er bør styre AI-budsjettet etter. Fire spørsmål tar deg det meste av veien.

    SpørsmålHva du ber om skriftligRødt flagg i svaret
    Hva koster en typisk forespørsel hos oss?Pris per million tokens inn og ut, for modellen og kontekstlengden vi faktisk brukerKun pris per bruker per måned, uten volumtak
    Hvilken latens, og målt hvordan?Tid til første token og tid mellom tokens ved vår samtidighetBare gjennomsnitt, ingen persentiler
    Hva er ytelsen per watt eller per krone på vår last?Måling fra en pilot på våre dataHenvisning til leverandørens egen benchmark
    Hvor låst blir vi?Liste over hva som må skrives om ved bytte av modell eller akselerator«Alt er standard», uten spesifikasjon

    Kostnad per token, ikke per sete

    En lisensmodell per bruker gir forutsigbarhet helt til den ikke gjør det, fordi nesten alle leverandører har en form for forbrukstak eller rettferdig-bruk-klausul bak seteprisen. Be om å få vite hva som skjer når taket nås: struper de, fakturerer de, eller forhandler dere på nytt? Og be om kostnaden både inn og ut, siden utgående tokens som regel er dyrest og det er dem resonnerende modeller produserer flest av.

    Regn deretter om til noe forretningen forstår: kostnad per behandlet faktura, per kundehenvendelse, per generert tilbud. Det er den enheten en daglig leder kan holde opp mot verdien.

    Latens er en produktegenskap, ikke en teknisk detalj

    Brukere forlater et verktøy som føles tregt, uansett hvor riktig svaret er. Derfor er tid til første token og tid mellom tokens mer relevant enn total gjennomstrømning for alt som har et menneske i den andre enden. Legg merke til at OpenAI rapporterer minimum tid mellom tokens på 0,69 ms mot 1,87 ms for GPT-OSS 120B (OpenAI), altså akkurat det målet som styrer opplevd flyt.

    Krev persentiler, ikke gjennomsnitt. Et system med god snittlatens og elendig 95-persentil oppleves som ustabilt, og det er ustabiliteten brukerne husker.

    Ytelse per watt er prisen din i forkledning

    Som skykunde kjøper du ikke watt. Du kjøper instansetimer. Men leverandørens energikostnad er den viktigste enkeltkomponenten bak den prisen, og forbedringer i ytelse per watt er derfor det som over tid presser instansprisene ned. Når AWS fremhever bedre ytelse per watt for Inf2, er det en prognose for hvor prisene kan gå, ikke bare en teknisk merittliste.

    På kort sikt betyr det at du bør spørre om det finnes en inferensoptimalisert instanstype for din modell, og hva den koster mot GPU-alternativet på din faktiske last.

    Innlåsing er den prisen du ikke ser i tilbudet

    Spesialbrikker leverer besparelser fordi de er spesialiserte, og spesialisering betyr kompilatorer, kjøretidsmiljøer og operatørstøtte som er unike for leverandøren. Jo dypere du optimaliserer, jo dyrere blir det å flytte. Alura mener spesialbrikker gjør det billigere å kjøre AI i skyen, men de øker innlåsingsrisikoen. Arkitektur som kan flyttes er verdt noe.

    Praktisk håndverk: hold modellkall bak et eget grensesnitt i koden, ikke spre leverandørspesifikke SDK-kall utover hele applikasjonen, og hold en evalueringssuite som kan kjøres mot en alternativ modell på en dag. Da er bytte en beslutning, ikke et prosjekt. Vi har skrevet mer om avveiningene ved modellbytte i Azure.

    Slik regner du på inferens uten å gjette

    Regnestykket er ikke komplisert, det er bare sjelden utført. Kostnaden er tokens inn ganger prisen inn, pluss tokens ut ganger prisen ut, ganger antall forespørsler, pluss alt det som ikke er ren produksjonstrafikk. Tallene henter du fra en pilot, ikke fra en presentasjon.

    Ledd i regnestykketHvor du henter talletVanlig bomskudd
    Tokens inn per forespørselLogg fra pilotperiodenGlemmer systemprompt, historikk og vedlegg
    Tokens ut per forespørselLogg fra pilotperiodenResonnerende modeller produserer langt flere
    Forespørsler per periodeFaktisk målt bruk, per aktiv brukerGanger opp med antall ansatte
    Pris per million tokensPrisliste for modellen dere faktisk kjørerRegner med prisen på den billigste modellen
    Retries, feilkall og evalueringerObservabilitetsverktøyUtelates helt fra budsjettet
    Vekst ved full utrullingForbruk per aktiv bruker ganget med planlagt antallAntar at forbruk per bruker holder seg flatt

    Volumdriverne de fleste undervurderer

    Tre ting flytter forbruket kraftig oppover uten at noen tar en beslutning om det. Agenter som kaller modellen flere ganger per oppgave. Resonnerende modeller som produserer lange tankerekker før svaret. Kontekstvekst, der voksende mengder dokumentasjon dyttes inn i hver forespørsel for å bedre kvaliteten. Alle tre gjør produktet bedre, og alle tre ganger opp regningen.

    Kodeverktøy er det tydeligste eksempelet, fordi forbruket per utvikler varierer enormt mellom folk som bruker verktøyet lett og folk som lever i det. Vi har gått gjennom hvordan et token-budsjett kan settes opp for et lite team.

    Mål i en periode med reell bruk

    En pilot på to uker med ti frivillige entusiaster gir et forbruksmønster du ikke kan skalere. Kjør heller en periode der en hel avdeling bruker verktøyet i vanlig arbeid, og logg tokens per forespørsel og forespørsler per aktiv bruker. Deretter har du en enhetskostnad du kan forhandle med, sammenligne modeller på, og sette alarm på.

    Sett terskler før dere trenger dem: et månedlig tak per team, varsling ved avvik, og en enkel regel for hvem som kan godkjenne overskridelse. Det er billigere enn å oppdage det på fakturaen.

    Markedet for inferensbrikker mer enn dobler seg mot 2030

    Markedet for AI-inferensbrikker er ventet å vokse fra 17,73 milliarder dollar i 2025 til 36,97 milliarder dollar i 2030 (sg.finance.yahoo.com). Vekstdriverne som oppgis er økt bruk av AI-modeller, etterspørsel etter sanntidsinferens, fremskritt innen halvlederteknologi og utbredelse av edge computing.

    ÅrMarkedsverdiMerknad
    202517,73 milliarder dollarUtgangspunkt
    202620,51 milliarder dollarVentet nivå inneværende år
    203036,97 milliarder dollarVentet nivå ved slutten av prognoseperioden

    Hvem som bygger, og hvem som kjøper seg inn

    Google lanserte Ironwood-brikken i april 2025, designet spesifikt for inferensberegning, og SoftBank Group kjøpte Ampere Computing for 6,5 milliarder dollar for å styrke sin Arm-baserte prosessorportefølje (sg.finance.yahoo.com). Legg til AWS med Inferentia og OpenAI med Jalapeño, så ser du mønsteret: de som eier arbeidsbelastningen vil eie brikken som kjører den.

    Kapitalen som finansierer dette kommer i stor grad fra investorer som satser på at bedriftsmarkedet betaler regningen, noe OpenAIs kapitalinnhenting illustrerer godt.

    Hva konkurransen betyr for prisen du betaler

    Flere leverandører av inferensmaskinvare betyr mindre marginmakt hos den ene dominerende aktøren. For deg som kjøper er det gode nyheter på tre til fem års sikt, men det skjer ikke automatisk og det skjer ikke jevnt. Egenutviklede brikker brukes først på leverandørens egen interne trafikk, og gevinsten når kundene når kapasiteten er stor nok til å selges videre.

    Den praktiske konsekvensen er å unngå lange, dyre bindinger på inferenskapasitet akkurat nå. Kortere avtaler med rett til å reforhandle når nye instanstyper lanseres er mer verdt enn en rabatt du låser inn i dag.


    Les også: Token-budsjett for AI-kodeverktøy: Uber-saken og norske SMB. Uber brukte opp hele 2026-budsjettet på fire måneder.


    Energi og kapasitet setter gulvet for prisen

    Prisen på inferens er til syvende og sist en funksjon av strøm, kjøling og tilgjengelig datasenterkapasitet. USA hadde 5 426 datasentre per mars 2025, og energiforbruket forventes å nå 130 GW innen 2030 (sg.finance.yahoo.com). Det er den fysiske virkeligheten bak enhver prisliste for AI-tjenester.

    Derfor er ytelse per watt den viktigste enkeltmålingen

    Når nettkapasitet er flaskehalsen, blir spørsmålet ikke hvor mange brikker du kan kjøpe, men hvor mye arbeid du får ut av hver megawatt. Det forklarer hvorfor OpenAI måler i tokens per kilowatt og ikke bare i tokens per sekund, og hvorfor AWS fremhever ytelse per watt for Inf2. En brikke som gir mer arbeid per watt frigjør kapasitet som allerede er kjøpt og bygget.

    For en norsk kjøper oversettes dette til noe enkelt: energieffektivitet i leverandørleddet er den mekanismen som gjør at prisen din kan falle uten at noen forhandler.

    Hva norske kjøpere bør ta med i vurderingen

    Kapasitet er ujevnt fordelt mellom regioner, og den regionen som er nærmest deg er ikke alltid den som får de nyeste instanstypene først. Hvis dere har krav om databehandling i Europa, spør konkret hvilke inferensoptimaliserte instanstyper som er tilgjengelige i den regionen dere faktisk kan bruke, og når nye generasjoner rulles ut der.

    Spør også om kapasitetsgaranti ved trafikktopper. En pris uten tilgjengelighet er ikke en pris.

    Europeisk motsvar: inferens under en watt

    Mens amerikanske aktører bygger for datasenteret, går et EU-finansiert prosjekt motsatt vei. Aloe AI, koordinert av SEMRON GMBH og finansiert av European Innovation Council, utvikler en 3D-stablet AI-inferensbrikke som skal kjøre store språkmodeller på små enheter (EU-kommisjonen).

    CapRAM og 3D-stabling

    SEMRON bruker en kapasitiv tilnærming kalt CapRAM, som ifølge prosjektbeskrivelsen gir bedre signal-til-støy-forhold enn resistive tilnærminger, og bygger på 3D NAND flash-teknologi for å stable beregningslag oppå hverandre. Målet er en demonstrator av en monolittisk 3D-inferensbrikke, med en ambisjon om to størrelsesordener lavere kostnad per ytelse (EU-kommisjonen).

    Den harde begrensningen er effektbudsjettet: edge-enheter tåler maksimalt 1 W kontinuerlig strømforbruk. Til sammenligning har Jalapeño en publisert klassifisering på 700 watt. Det er to helt ulike ingeniørproblemer, og de løses ikke med samme arkitektur.

    Når edge-inferens er relevant for en SMB

    Edge blir interessant når data ikke bør forlate enheten, når nettforbindelsen er upålitelig, eller når volumet er så høyt og oppgaven så avgrenset at skyprisen per forespørsel blir urimelig. Industriell inspeksjon, sensordata i felt, og produkter som selges med innebygget intelligens er de typiske tilfellene i norsk sammenheng.

    For de fleste kontorprosesser er dette derimot ikke løsningen de neste par årene. Prosjektet er i forsknings- og demonstratorfase, ikke en hylleavare. Behandle det som en retningsindikator: presset på kostnad per ytelse kommer fra begge ender av markedet samtidig.

    Tariffer og leverandørkjede påvirker prisen du betaler

    Brikkemarkedet er ikke bare teknologi. Geopolitiske tariffer påvirker markedet ved å øke kostnadene for halvledermaterialer, særlig i Asia-Stillehavsregionen og Nord-Amerika (sg.finance.yahoo.com). Kostnader i leverandørkjeden ender til slutt i instansprisen, med forsinkelse.

    Hvorfor handelspolitikk havner på skyfakturaen

    Skyleverandører kjøper maskinvare i store, langsiktige kontrakter, og skjermer kundene fra svingninger en stund. Men når inngangskostnaden holder seg høy over tid, justeres prislister og rabattnivåer. Det er derfor prognosen for hvor billig inferens blir de neste årene er mer usikker enn de rene teknologikurvene antyder.

    Norske kjøpere har i tillegg en valutaeksponering: prisene er i dollar, mens inntektene er i kroner. En budsjettmodell som ikke tåler en valutabevegelse er ikke en budsjettmodell.

    Hva du kan gjøre i avtalen

    Be om prisjusteringsklausuler med varslingsfrist, ikke bare en pris. Hold en andel av forbruket på løpende betaling selv om dere kjøper reservert kapasitet, slik at dere kan flytte trafikk hvis prisbildet endrer seg. Og sørg for at avtalen tillater at dere kjører den samme applikasjonen mot en annen modell uten å bryte vilkårene.

    Dette er kjedelige innkjøpsdetaljer. De er også det eneste som gir handlingsrom når markedet beveger seg.

    Vanlige feil når SMB-er budsjetterer AI-bruk

    Feilene går igjen på tvers av bransjer og størrelser. De handler sjelden om teknologiforståelse og nesten alltid om hvilke tall som havner i regnearket.

    Å budsjettere lisensen og glemme forbruket

    Lisenslinjen er synlig, forutsigbar og lett å godkjenne. Forbrukslinjen er usynlig til den kommer. Resultatet er budsjetter som treffer på det som var lett å estimere og bommer på det som faktisk vokser. Legg inn en egen linje for inferens fra dag en, selv om tallet i starten er lite.

    Å bruke leverandørens benchmark som eget estimat

    Et «opptil»-tall fra en leverandør er en øvre grense målt under gunstige forhold. Spennet i AWS sine egne kundehistorier, der noen halverer kostnaden og andre kutter det aller meste av den, viser hvor mye variasjon som ligger mellom kundene (AWS). Bruk slike tall til å bestemme om det er verdt å teste, aldri til å love innsparing internt.

    Å optimalisere maskinvare før prompt og modellvalg

    De største kostnadskuttene i en typisk SMB-løsning ligger ikke i brikken. De ligger i å slutte å sende hele dokumentbunken inn i hver forespørsel, å bruke en mindre modell til rutineoppgaver, å cache det som gjentas, og å fjerne kall som ikke tilfører verdi. Det er arbeid som tar dager, ikke kvartaler, og som virker uansett hvilken maskinvare leverandøren kjører på.

    Å vente på neste brikkegenerasjon

    Jalapeño kommer i svært små volumer ved utgangen av 2026 og i mer betydelig omfang i 2027 (TechCrunch, 2026). Det er et argument for å forberede seg, ikke for å utsette. Alura mener du ikke bør vente på neste brikkegenerasjon for å komme i gang. Kostnadskurven faller uansett, og læringen tar lengre tid enn maskinvaren.

    Organisasjoner som venter, venter ikke bare på billigere tokens. De utsetter også arbeidet med datakvalitet, prosesskartlegging og målekultur, og det arbeidet blir ikke raskere av at maskinvaren blir bedre.

    Ofte stilte spørsmål om AI-inferens og kostnader

    Spørsmålene under er de vi oftest får fra ledere som skal sette et AI-budsjett for første gang.

    Hva er forskjellen på trening og inferens?

    Trening er prosessen der modellen lærer, og den skjer en gang per modellversjon med enorm regnekraft. Inferens er hver gang modellen brukes til å svare på noe. For en SMB som kjøper AI-tjenester er treningskostnaden allerede innbakt i prisen, mens inferenskostnaden er den dere styrer selv gjennom hvor mye og hvor smart dere bruker modellene.

    Hvorfor blir inferens billigere på spesialbrikker?

    Fordi brikken bare gjør en ting. En generell GPU må håndtere trening, grafikk og et bredt sett av operasjoner, og betaler for den fleksibiliteten i areal og strømforbruk. En inferens-ASIC bruker transistorbudsjettet på det som faktisk trengs for å produsere tokens, og henter gevinsten i minnebåndbredde og ytelse per watt. AWS oppgir opptil 2,3x høyere gjennomstrømning for Inf1-instanser mot sammenlignbare EC2-instanser (AWS).

    Bør vi vente på at Jalapeño blir tilgjengelig?

    Nei. Jalapeño er OpenAIs egen infrastrukturbrikke, ikke et produkt du kjøper, og volumutrullingen kommer i 2027 (The Verge). Effekten for deg blir eventuelt indirekte, i form av lavere priser eller raskere svar på tjenester du allerede bruker. Planlegg for at kostnadskurven fortsetter nedover, og bygg løsningen slik at den drar nytte av det automatisk.

    Hva betyr ytelse per watt for oss som bare kjøper skytjenester?

    Det er leverandørens kostnadsdriver, og dermed din fremtidige pris. Når AWS oppgir opptil 50 prosent bedre ytelse per watt for Inf2-instanser, og OpenAI måler 1,5 til 1,9 ganger mer arbeid per watt for Jalapeño, forteller det hvor mye rom det er for prisreduksjon i leddet over deg (OpenAI). Det du kan gjøre praktisk, er å spørre om inferensoptimaliserte instanstyper finnes for din modell i din region.

    Hvordan unngår vi å bli låst til en leverandør?

    Isoler modellkallene bak et eget grensesnitt i koden, hold prompt og evalueringer i deres eget repo, og test minst en alternativ modell i kvartalet slik at bytte er øvd inn. Unngå å bygge forretningslogikk inn i leverandørspesifikke funksjoner. Full portabilitet er dyrt og sjelden verdt det, men å kunne bytte på uker i stedet for måneder er realistisk for de fleste.

    Oppsummering og hva du bør gjøre før 2027

    Inferens er den delen av AI-regningen som følger bruken, og derfor den eneste delen som virkelig krever styring. Maskinvaren under er i rask endring: AWS har levert spesialbrikker med dokumenterte kundegevinster i årevis, OpenAI har publisert sine første Jalapeño-målinger med volum først i 2027, og et EU-finansiert prosjekt jobber mot språkmodeller på enheter under 1 W. Retningen er entydig, tempoet er ikke.

    Det viktigste skillet for deg som beslutningstaker er mellom dokumenterte målinger og markedsføring. Alle tallene i denne artikkelen kommer fra leverandørene selv eller fra markedsanalyser, og ingen av dem er målt på din arbeidsbelastning. Det er den målingen som mangler, og den kan dere gjøre selv.

    Sjekkliste før neste budsjettrunde

    Finn kostnaden per forespørsel i den løsningen dere allerede kjører, og oversett den til en forretningsenhet alle forstår. Still leverandøren de fire spørsmålene om kostnad per token, latens, ytelse per watt og innlåsing, og be om svarene skriftlig. Sett et forbrukstak med varsling før dere trenger det. Sørg for at minst en alternativ modell er testet mot deres egen evalueringssuite.

    Og bruk tiden fram til neste brikkegenerasjon på det som faktisk tar tid: datagrunnlaget, prosessene og folkene som skal bruke løsningen. Maskinvaren kommer uansett.

    I Alura bygger vi AI-infrastruktur for norske virksomheter, fra dataplattformer til agentiske systemer i produksjon. Vi er ikke en SaaS-leverandør. Vi er håndverkere som setter sammen byggesteinene som faktisk fungerer for din situasjon.

    Bestill en arkitektur-samtale: vi går gjennom din nåværende infrastruktur, identifiserer integrasjonspunkter, og foreslår en pragmatisk vei videre. Uforpliktende, 45 minutter.

    Kilder

    • AWS. AI Chip - Amazon Inferentia - AWS
    • OpenAI. Jalapeño’s first results show industry-leading speed and efficiency in AI inference
    • sg.finance.yahoo.com. AI Inference Chip Market Soars: Predicted Growth to $36.97 Billion by 2030
    • EU-kommisjonen. Breakthrough 3D-Stacked AI Inference Chip Enabling the Deployment of Multi-Billion-Parameter LLMs on Edge Devices | Aloe AI | Project | Fact Sheet | HORIZON | CORDIS | European Commission
    • The Verge. OpenAI says its Jalapeño chip can power faster AI responses than the competition
    • TechCrunch (2026). OpenAI's Jalapeño chip is built for fast inference at scale, benchmarks show
    A

    Alura

    Praktisk kunnskap om AI-automatisering og effektivisering for norske bedrifter.