22 min

    Gemini 3.7 Flash koster halv pris ut 2026

    Google halverte tokenprisen på Gemini 3.7 Flash frem til 31. desember 2026. Her er hva norske utviklingsteam bør teste nå, og hvordan de budsjetterer for doblingen i 2027.

    Teknologi & VerktøyGemini 3.7 FlashAI-modell for kodingGemini API pristokenpris AIAI-kodeassistent bedriftGemini Sparkbytte AI-modell
    Gemini 3.7 Flash koster halv pris ut 2026

    Nøkkelpunkter per 18. august 2026:

    • Introduksjonsprisen utløper 31. desember 2026. Da dobles input fra 0,75 til 1,50 dollar per million tokens, og output fra 3,75 til 7,50 (Google DeepMind, 2026).
    • Kodetallene har flyttet seg reelt. DeepSWE v1.1 gikk fra 49 til 65,3 prosent mellom versjonene, og FrontierCode 1.1 Main lander på 43,6 prosent (Ars Technica, 2026).
    • Modellen kom tre uker etter forgjengeren og erstatter den. Det tempoet gjør arkitektur som er låst til en bestemt modellversjon til en løpende kostnad (VentureBeat).
    • Prispresset kommer nedenfra. OpenAIs GPT 5.6 Luna ligger på 0,20 dollar per million input-tokens og 1,20 dollar for output, altså langt under Gemini-nivået (Ars Technica, 2026).
    • Tilgangen er ujevn. Modellen finnes i Gemini API, AI Studio og Gemini Enterprise, men for enkeltbrukere kun via Gemini Spark for AI Pro- og Ultra-abonnenter (Ars Technica, 2026).

    Hva Gemini 3.7 Flash er, og hva Google lover

    Google lanserte Gemini 3.7 Flash 13. august 2026 og beskriver den som sin mest intelligente arbeidshestmodell for koding og agenter (Google DeepMind, 2026). Ordet arbeidshest er presist. Dette er ikke toppmodellen i familien, men modellen som skal ta volumet: kodefullføring, feilsøking, verktøykall og oppgaver som kjøres tusenvis av ganger i uken. Google oppgir forbedret ytelse innen koding, kunnskapsarbeid og webutvikling.

    For en norsk SMB er det to opplysninger som avgjør om dette er relevant nå. Den ene er at prisen er halvert ut 2026. Den andre er at modellen kom bare tre uker etter forgjengeren og erstatter den (Ars Technica, 2026). Begge deler påvirker hvordan dere bør planlegge, ikke bare hva dere bør teste.

    En arbeidshest, ikke en toppmodell

    Flash-serien er posisjonert der volumet ligger. Toppmodeller brukes til de vanskeligste oppgavene og de mest krevende resonnementene. Arbeidshestmodeller brukes til alt annet, og det er der token-forbruket faktisk samler seg. Når Google beskriver 3.7 Flash som sin mest intelligente arbeidshestmodell for koding og agenter, sier de samtidig at den ikke er ment å konkurrere med det ypperste (VentureBeat).

    Google oppgir at modellen «tenker mer grundig» og legger mer innsats i flertrinnsplanlegging og verktøykall enn forgjengeren. Det er en beskrivelse med praktiske konsekvenser: mer resonnering betyr som regel flere tokens per oppgave. En modell som gjør mer arbeid per forespørsel kan koste mer i drift selv om listeprisen per million tokens er lik.

    Tre uker etter forrige versjon

    Gemini 3.7 Flash kom tre uker etter Gemini 3.6 Flash og erstatter den (Google DeepMind, 2026). Det er kortere enn mange team bruker på å fullføre en evaluering av en ny modell. Hvis evalueringsprosessen deres tar seks uker, rekker markedet å bytte to ganger mens dere jobber.

    Dette er ikke et argument for å slutte å evaluere. Det er et argument for å gjøre evalueringen billigere og raskere, slik at den kan gjentas. Team som bruker et kvartal på å velge modell, bruker et kvartal på en beslutning som er utdatert når den lander.

    Planlegg rundt det som faktisk er tilgjengelig

    Google presenterer 3.7 Flash som arbeidshesten for koding og agenter, og det er Flash-linjen som faktisk er tilgjengelig å planlegge rundt akkurat nå (VentureBeat). Modellen er ute i Gemini API, AI Studio og Gemini Enterprise, mens tilgangen for enkeltbrukere er smalere (Ars Technica, 2026).

    Ikke bygg en plan som forutsetter en modell som ennå ikke er lansert. En plan som hviler på en leveranse ingen har datofestet, er ikke en plan. Hvis oppgavene deres krever mer enn en arbeidshest, er svaret enten en annen leverandør eller en annen arbeidsdeling mellom modell og menneske.

    Benchmarktallene som skiller 3.7 Flash fra 3.6 Flash

    Google publiserte en rekke sammenligninger mot forgjengeren. Tallene er de mest konkrete opplysningene som finnes om modellen akkurat nå, og de peker samme vei: framgangen er størst på koding og agentiske oppgaver, ikke på generell tekstbehandling.

    BenchmarkGemini 3.7 FlashHva den måler
    FrontierCode 1.1 Main43,6 %Krevende kodeoppgaver
    DeepSWE v1.165,3 %Programvareutvikling ende til ende
    WebDev Arena (Elo)1588Webutvikling, menneskelig preferanse
    AutomationBench30,4 %Agentisk automatisering

    Sammenligningsgrunnlaget for forgjengeren er 49 prosent på DeepSWE v1.1, 1538 i Elo på WebDev Arena og 17 prosent på AutomationBench. Kildene for tabellen er Ars Technica, 2026 og VentureBeat.

    Koding: FrontierCode og DeepSWE

    Den største enkeltbevegelsen ligger i DeepSWE v1.1, der scoren gikk fra 49 til 65,3 prosent. FrontierCode 1.1 Main lander på 43,6 prosent, også det et tydelig løft fra forgjengeren. Begge testene måler noe nærmere ekte utviklingsarbeid enn klassiske kodegenereringsoppgaver, og et hopp av denne størrelsen på tre uker er uvanlig innen en modellfamilie.

    Merk hva tallene ikke sier. En score på 65,3 prosent betyr at en betydelig andel av oppgavene i testsettet fortsatt ikke løses. På et utviklingsteam betyr det at gjennomgang fortsatt er nødvendig, og at gevinsten ligger i tid spart på de oppgavene modellen faktisk klarer, ikke i at oppgaver forsvinner.

    Web, dokumenter og agentiske oppgaver

    På WebDev Arena gikk Elo-scoren fra 1538 til 1588 (Google DeepMind, 2026). Elo måler menneskelig preferanse i direkte sammenligninger, ikke absolutt riktighet. Femti Elo-poeng er en merkbar, men ikke dramatisk forskjell i hvor ofte en bruker foretrekker det ene svaret over det andre.

    Dokumentforståelse målt med GDP.pdf peker samme vei, og AutomationBench gikk fra 17 til 30,4 prosent. De to er de mest interessante for bedrifter som vurderer agenter. Samtidig løser modellen fortsatt langt fra alle oppgavene i disse testsettene, og det setter en grense for hvor mye ubevoktet automatisering som er forsvarlig.

    Benchmark er en hypotese, ikke et vedtak

    Alura mener at benchmarktall er et utgangspunkt for en test, ikke et beslutningsgrunnlag i seg selv. Kjør modellen mot egne kodebaser og egne oppgaver før dere flytter produksjonslast. Benchmarker er standardiserte oppgavesett, og en modell kan gjøre det godt der uten å gjøre det godt på deres kombinasjon av rammeverk, kodekonvensjoner og domenespråk.

    Den praktiske testen er enkel å formulere: tar modellen færre forsøk på å fullføre en oppgave dere faktisk har, og hvor mye koster de forsøkene. Alt annet er indikasjon. Dette gjelder generelt ved valg av språkmodell, ikke bare for Gemini.


    Les også: LLM-er og valg av språkmodell: GPT-4, Claude, Gemini eller lokal modell – hva passer for norsk bedrift?. Valget mellom GPT-4, Claude, Gemini og norske modeller handler om mer enn ytelse.


    Prisen er halvert frem til 31. desember 2026

    Gemini 3.7 Flash koster 0,75 dollar per million input-tokens og 3,75 dollar per million output-tokens i introduksjonsperioden (Google DeepMind, 2026). Perioden utløper 31. desember 2026. Fra 2027 er prisen 1,50 dollar for input og 7,50 dollar for output per million tokens.

    TokentypeTil 31. desember 2026Fra 2027Økning
    Input per million tokens0,75 dollar1,50 dollar0,75 dollar
    Output per million tokens3,75 dollar7,50 dollar3,75 dollar

    Tallene er hentet fra Google DeepMind, 2026 og VentureBeat.

    Prisen er ikke satt ned, den er utsatt

    Introduksjonsprisen ligger under det 3.6 Flash opprinnelig kostet per million tokens (Google DeepMind, 2026). Regn litt på det: standardprisen fra 2027 er nøyaktig den samme som forgjengeren kostet. Google har ikke senket det langsiktige prisnivået på arbeidshestmodellen sin. Selskapet har gitt en rabatt som løper ut året.

    Det er en fullt legitim markedsføringsmekanikk, og 50 prosent avslag er reelt så lenge det varer. Poenget er hvordan dere leser det i planleggingen. En rabatt med utløpsdato er ikke en prisreduksjon, den er en tidsbegrenset finansiering av deres testperiode.

    Output koster mye mer enn input

    Forholdet mellom input og output er verdt å legge merke til. Output er priset vesentlig høyere enn input i begge periodene. For kodeoppgaver betyr det at lange genererte filer, omfattende forklaringer og verbose agentlogger treffer budsjettet hardere enn store kontekstvinduer gjør.

    Praktisk konsekvens: å mate inn mye kontekst er relativt billig, å generere mye tekst er dyrt. Team som strammer inn på hvor mye modellen skriver, og som ber om differ heller enn hele filer, får merkbart lavere regninger uten å tape kvalitet.

    Budsjetter til full pris

    Alura mener at introduksjonspriser skal budsjetteres til full pris. Regn kostnaden på 1,50 og 7,50 dollar per million tokens, ikke på introduksjonsprisen som utløper 31. desember 2026. Begrunnelsen er ikke pessimisme, den er at budsjettåret for de fleste norske virksomheter dekker perioden der prisen er høy, ikke perioden der den er lav.

    Hvis regnestykket bare går opp på introduksjonspris, har dere ikke et business case. Dere har en gratisperiode. Det kan være god nok grunn til å teste, men det er ikke god nok grunn til å flytte produksjonslast.

    Fire akser for å vurdere en ny kodemodell

    De fleste modellvurderinger kollapser til ett spørsmål: er den bedre? Det er feil spørsmål, fordi «bedre» ikke er handlingsrettet og fordi svaret uansett endrer seg neste kvartal. Fire akser gir en beslutning som holder lenger og som kan gjentas raskt.

    AkseSpørsmålet dere må svare påSignal på at dere bør bytteSignal på at dere bør vente
    OppgavetreffLøser den oppgavene vi faktisk har?Færre forsøk per fullført oppgave i egen kodebaseGevinsten viser seg bare i offentlige benchmarker
    Kostnad per fullført oppgaveHva koster et ferdig resultat, ikke en forespørsel?Lavere totalkostnad regnet på full prisRegnestykket krever introduksjonsprisen for å gå opp
    ByttekostnadHva koster det å gå tilbake eller videre?Modellvalget ligger bak et abstraksjonslagPrompts og arkitektur er skreddersydd for dagens modell
    EtterlevelseTåler bruken dokumentasjonskrav og datakrav?Databehandling og logging er avklart på forhåndIngen har svart på hvor data behandles

    Akse 1: oppgavetreff foran generell styrke

    En modell som er sterk på gjennomsnittet av verdens kodeoppgaver kan være svak på deres. Norsk domenespråk, eldre rammeverk, interne biblioteker og udokumenterte konvensjoner er alle ting benchmarker ikke inneholder. Målet på oppgavetreff er hvor mange forsøk en oppgave krever før den er ferdig, målt av noen som ville gjort oppgaven selv.

    Velg ti til femten oppgaver som er representative, ikke oppgaver som er valgt for å vise fram modellen. Sett sammen listen av kjedelige feilrettinger, en refaktorering, en integrasjon og en oppgave dere vet er vanskelig. Det er fordelingen som avgjør driftsverdien.

    Akse 2: kostnad per fullført oppgave

    Tokenpris er ikke kostnad. En billigere modell som trenger tre forsøk er dyrere enn en dyrere modell som trenger ett. Legg til utviklertid i regnestykket, for det er den dyreste innsatsfaktoren i et norsk team. En modell som sparer gjennomgangstid har verdi selv til høyere tokenpris.

    Dette er også grunnen til at billige kodemodeller ikke automatisk vinner. Prisforskjellen mellom modeller er ofte mindre enn forskjellen i hvor mange forsøk de bruker.

    Akse 3: byttekostnad og innelåsing

    Alura mener at når en leverandør erstatter modellen sin etter tre uker, er det billigere å bygge et abstraksjonslag rundt modellvalget enn å binde arkitekturen til en bestemt versjon. Et abstraksjonslag trenger ikke være avansert. Det holder ofte med et internt grensesnitt der modellnavn, promptmal og parametre er konfigurasjon, ikke kode.

    Testen er konkret: hvor lang tid tar det å kjøre hele systemet mot en annen modell? Er svaret mer enn en dag, er byttekostnaden en risiko dere bærer uten å ha priset den.

    Akse 4: etterlevelse og datahåndtering

    Generativ AI som ChatGPT klassifiseres ikke som høyrisiko under EUs AI Act, men må overholde åpenhetskrav og EUs opphavsrettslovgivning (EU-kommisjonen). For et utviklingsteam er hovedspørsmålene hvor kildekoden sendes, hva som logges, og om dere kan dokumentere hva systemet gjør.

    Avklar dette før testen, ikke etter. En teknisk vellykket pilot som må stanses fordi ingen har svart på hvor data behandles, er en dyrere feil enn en modell som yter litt svakere.

    Praktisk test: hva du gjør de første fem dagene

    En modelltest bør være billig nok til å gjentas hver gang markedet flytter seg. Fem arbeidsdager med en person er nok til å ta en informert beslutning, forutsatt at rammene er satt på forhånd. Målet er ikke å bevise at modellen er god, men å finne ut om den er bedre for dere enn det dere har.

    Dag 1: velg oppgavene og baselinen

    Bestem oppgavesettet og skriv ned hva dagens løsning presterer på det. Uten en baseline har dere ingen sammenligning, bare et inntrykk. Baselinen skal måles på det samme som den nye modellen: antall forsøk, tid til ferdig resultat, og token-forbruk.

    Sett også avbruddskriteriet nå. Hvis modellen ikke slår baselinen på minst to av fire akser innen fem dager, stopper dere. Kriteriet er lettere å holde når det er skrevet ned før noen har investert prestisje i utfallet.

    Dag 2 og 3: kjør parallelt, ikke i produksjon

    Kjør de samme oppgavene gjennom begge modellene. Ikke bytt ut noe i produksjon i denne fasen. Parallellkjøring gir sammenlignbare tall og fjerner den vanligste feilkilden, som er at folk husker den nye modellen som bedre fordi den er ny.

    Logg token-forbruk per oppgave. Modellen legger mer innsats i flertrinnsplanlegging og verktøykall enn forgjengeren (VentureBeat), og den innsatsen dukker opp i forbruket. Uten logging oppdager dere det først på fakturaen.

    Dag 4 og 5: regn, beslutt, sett revurderingsdato

    Regn kostnaden på full pris, altså 1,50 og 7,50 dollar per million tokens, og se om beslutningen fortsatt står. Dokumenter resultatet i noen få avsnitt: hva ble testet, hva ble målt, hva ble konklusjonen. Det dokumentet er verdt mer neste gang enn selve konklusjonen, fordi neste test da tar to dager i stedet for fem.

    Sett til slutt en dato for revurdering. 31. desember 2026 er en naturlig kandidat, siden det er da prisen endrer seg. Legg gjerne inn en tidligere sjekk også, gitt tempoet i utgivelsene.

    Regnestykket for et norsk utviklingsteam

    Det er ikke mulig å oppgi en meningsfull månedskostnad uten å kjenne teamets faktiske token-forbruk, og de fleste anslag på nettet er gjetning forkledd som analyse. Det dere trenger er ikke et tall fra en artikkel, men en modell dere fyller med egne målinger.

    PostSlik regner dereMerknad
    Input-tokensMålt volum fra loggen ganget med 1,50 dollar per millionBruk 2027-prisen, ikke introduksjonsprisen
    Output-tokensMålt volum ganget med 7,50 dollar per millionDette er som regel den dominerende posten
    AgentoverheadMål separat: agenter gjør flere kall per oppgaveFlertrinnsplanlegging og verktøykall øker forbruket
    ValutaPrisene er i dollar, budsjettet i kronerKursrisiko kommer i tillegg til prisrisiko
    BufferLegg inn margin for volumvekstBruken øker når verktøyet fungerer

    Regn i tokens, ikke i lisenser

    API-bruk skalerer med forbruk, ikke med antall ansatte. Det er en fordel når bruken er lav og en risiko når den tar av. Et team som får en kodeassistent til å fungere godt, bruker den mer, og forbruket vokser raskere enn hodetellingen. Budsjetter for at vellykket innføring koster mer enn mislykket.

    Legg inn et forbrukstak eller varsling fra dag en. Det er den billigste forsikringen mot at en agent i en løkke genererer en regning ingen har godkjent.

    Tre grep som demper prishoppet

    Det første er å redusere output. Be om differ, ikke hele filer, og be om kortere forklaringer. Siden output er priset høyere enn input, gir dette raskest effekt. Det andre er å rute oppgaver: enkle oppgaver til en billigere modell, vanskelige til arbeidshesten. Det tredje er å måle før prisen endrer seg, slik at dere vet hva som faktisk driver forbruket når regningen dobles.

    Ingen av grepene krever at dere har bestemt dere for leverandør. De hører hjemme i en AI-strategi uansett hvilken modell dere lander på.

    Hvor modellen faktisk er tilgjengelig

    Tilgangen er ujevn, og det påvirker hvem i organisasjonen som kan delta i en test. Gemini 3.7 Flash er tilgjengelig i Gemini API, AI Studio og Gemini Enterprise, mens enkeltpersoner bare får tilgang gjennom Gemini Spark-agenten, og da kun som AI Pro- eller Ultra-abonnenter (Ars Technica, 2026).

    API, AI Studio og Gemini Enterprise

    For et utviklingsteam er API-et det som betyr noe. Det er der token-prisen gjelder, der loggingen kan settes opp, og der modellvalget kan gjøres til konfigurasjon. AI Studio er nyttig for rask prøving, men er ikke stedet å måle kostnad fra.

    Gemini Enterprise er den relevante kanalen hvis dere allerede har et forhold til Google Cloud. Er dere derimot forankret i en annen skyplattform, er det verdt å sammenligne mot alternativene der, for eksempel MAI-Thinking-1 i Azure, før dere flytter integrasjoner.

    Gemini Spark og abonnementene

    Gemini Spark er en abonnementsbasert AI-agenttjeneste som bruker Gemini 3.7 Flash fra lanseringsdagen, og tjenesten er tilgjengelig i over 160 land (Google DeepMind, 2026). Til sammenligning oppgir Google at Gemini-appen har over 950 millioner månedlige brukere, som er et helt annet volum enn abonnementstjenestene.

    Konsekvensen for en test er praktisk: hvis bare abonnenter kan bruke modellen i grensesnittet, må resten av teamet delta via API-et eller via de som har lisens. Planlegg det inn, ellers blir testen en enkeltpersons inntrykk. Bakgrunnen for hvordan de ulike Gemini-produktene henger sammen er beskrevet i vår gjennomgang av Gemini-plattformen.


    Les også: Muse Spark 1.1 koster en brøkdel av Claude og GPT. Meta lanserte Muse Spark 1.1 til 1,25 dollar per million input-tokens, en brøkdel av Claude og GPT.


    Konkurransebildet og prispresset nedenfra

    Google håper å motvirke lavere kostnader fra konkurrerende modeller med en lavere introduksjonspris (Ars Technica, 2026). Det er en åpen erkjennelse av at prisen ikke settes av Google alene. Rapporter tyder samtidig på at Geminis kodeegenskaper ikke har holdt tritt med nyere fremskritt fra andre AI-laboratorier.

    ModellInput per million tokensOutput per million tokens
    Gemini 3.7 Flash, til 31.12.20260,75 dollar3,75 dollar
    Gemini 3.7 Flash, fra 20271,50 dollar7,50 dollar
    OpenAI GPT 5.6 Luna0,20 dollar1,20 dollar

    OpenAI ligger lavere på pris

    OpenAIs Flash-lignende modell GPT 5.6 Luna er priset på 0,20 dollar per million input-tokens og 1,20 dollar for output (Ars Technica, 2026). Det er under Geminis introduksjonspris, og altså langt under prisen som gjelder fra 2027. Prissammenligning alene avgjør ingenting, siden modellene ikke nødvendigvis leverer likt på de samme oppgavene.

    Men det forklarer hvorfor Google gir rabatt. Når en direkte konkurrent ligger vesentlig lavere på listepris, er en tidsbegrenset halvering en måte å kjøpe seg oppmerksomhet fra utviklere som ellers ville testet noe annet.

    Åpne modeller setter et gulv

    Under de kommersielle API-ene ligger et voksende lag av åpne modeller som kan kjøres på egen eller leid infrastruktur. Qwen3-familien fra Alibaba omfatter blant annet en MoE-modell på 235B-A22B, og Microsoft Phi er en familie av små språkmodeller som gjør det godt på matematisk resonnering og kodegenerering (NVIDIA). Kimi K2 er en MoE-modell med 32 milliarder aktiverte parametere.

    For de fleste norske SMB-er er egen drift av slike modeller ikke veien å gå. Betydningen er indirekte: så lenge det finnes brukbare åpne alternativer, er det vanskelig for leverandørene å heve prisene på arbeidshestsegmentet uten motstand.

    AI Act og åpenhetskravene som gjelder generativ AI

    EUs AI Act er verdens første omfattende AI-lov, og ble foreslått av EU-kommisjonen i april 2021 (EU-kommisjonen). Regelverket er risikobasert. AI-systemer med uakseptabel risiko er forbudt, og forbudet begynte å gjelde 2. februar 2025. Høyrisikosystemer må vurderes før de settes på markedet og gjennom hele livssyklusen.

    Kodeassistanse er ikke høyrisiko, men ikke uregulert

    Generativ AI av ChatGPT-typen klassifiseres ikke som høyrisiko, men må overholde åpenhetskrav og EUs opphavsrettslovgivning (EU-kommisjonen). En kodeassistent brukt internt havner normalt i denne kategorien. Det senker terskelen for å ta modellen i bruk, men fjerner ikke dokumentasjonsplikten.

    Opphavsrett fortjener særlig oppmerksomhet i kodesammenheng. Generert kode som havner i et produkt dere selger, er deres ansvar. Gjennomgang av generert kode er ikke bare kvalitetssikring, det er etterlevelse.

    Tidslinjen dere planlegger mot

    Regelverket fases inn trinnvis etter ikrafttredelse: 9 måneder for atferdskodekser, 12 måneder for regler om generelle AI-systemer med åpenhetskrav, 24 måneder før loven er fullt anvendelig og 36 måneder før forpliktelsene for høyrisikosystemer gjelder (EU-kommisjonen). Trinnene er verdt å kjenne fordi de bestemmer når kravene til leverandøren deres skjerpes.

    For norske virksomheter som leverer inn i EU-markedet, er det praktiske rådet det samme uansett hvor i tidslinjen dere står: hold oversikt over hvilke AI-systemer dere bruker, hva de brukes til, og hvem som er leverandør. Den oversikten er billig å lage nå og dyr å rekonstruere senere.

    Markedsobservasjon: ny modell hver tredje uke

    Utgivelsestempoet er den viktigste strukturelle opplysningen i denne saken, og den varer lenger enn selve modellen. Gemini 3.7 Flash erstattet en modell som var tre uker gammel (VentureBeat). Det betyr at modellvalg ikke lenger er en engangsbeslutning, men en løpende driftsoppgave.

    Pensjonering skjer med kort varsel

    Dette er ikke unikt for Google. OpenAI pensjonerte GPT-4o, GPT-4.1, GPT-4.1 mini og o4-mini fra ChatGPT 13. februar 2026, og GPT-5.1-modellene forsvant 11. mars 2026 (OpenAI, 2026). o3 pensjoneres 26. august 2026 med en 90 dagers nedtrappingsperiode, mens GPT-4.5 fikk 30 dager.

    En nedtrappingsperiode på 30 dager er kortere enn mange innkjøpsprosesser. Hvis systemet deres har hardkodet et modellnavn, er det en oppgave som kan lande på pulten uten forvarsel.

    Abstraksjonslaget er den billigste forsikringen

    Alura mener at når en leverandør erstatter modellen sin etter tre uker, er det billigere å bygge et abstraksjonslag rundt modellvalget enn å binde arkitekturen til en bestemt versjon. Kostnaden er noen dagers arbeid. Gevinsten er at både prisendringer, pensjoneringer og nye modeller blir en konfigurasjonsendring i stedet for et prosjekt.

    Det gir også forhandlingsmakt. En kunde som kan bytte på en dag, er en kunde leverandøren må konkurrere om hver måned. En kunde som ikke kan bytte, betaler listepris.

    Vanlige feil når team bytter modell midt i et prosjekt

    Feilene som koster mest er sjelden tekniske. De handler om at beslutningen tas på feil grunnlag, eller på riktig grunnlag til feil tidspunkt. Her er de fire som går igjen.

    Å bytte uten baseline

    Uten målinger på dagens løsning har dere ingen måte å vite om den nye modellen faktisk er bedre. Inntrykk av ny teknologi er systematisk for positive de første ukene. Baselinen trenger ikke være avansert, men den må eksistere før byttet, ikke rekonstrueres etterpå.

    Å bygge budsjettet på introduksjonsprisen

    Introduksjonsprisen utløper 31. desember 2026 (Google DeepMind, 2026). Et budsjett som bare går opp på 0,75 dollar per million input-tokens, går ikke opp i 2027. Dette er den enkleste feilen å unngå og en av de vanligste å gjøre, fordi rabatterte priser er det som står i dokumentasjonen når man leser den.

    Å teste på oppgaver som ikke ligner arbeidet

    Demonstrasjonsoppgaver er valgt for å vise fram teknologien. Modellen bygger en fungerende app på ti minutter, alle blir enige om at dette er fremtiden, og så viser det seg at den sliter med det gamle integrasjonslaget som faktisk står for arbeidsmengden. Test på det kjedelige, for det er der volumet ligger.

    Å undervurdere hva agenter koster

    Agentiske arbeidsflyter gjør mange kall per oppgave. Google oppgir selv at modellen legger mer innsats i flertrinnsplanlegging og verktøykall (VentureBeat). Et forbruk som er behagelig når en utvikler skriver kode med assistanse, ser annerledes ut når en agent kjører femti steg uten tilsyn. Mål agentbruk separat fra interaktiv bruk.

    Ofte stilte spørsmål om Gemini 3.7 Flash

    De spørsmålene vi oftest får fra ledere og produktansvarlige som vurderer modellen nå.

    Bør vi bytte fra dagens modell nå?

    Bare hvis en test på egne oppgaver viser gevinst regnet på full pris. Kodetallene har flyttet seg reelt mellom versjonene, med DeepSWE v1.1 fra 49 til 65,3 prosent (Ars Technica, 2026). Det er godt nok til å begrunne en fem dagers test, ikke til å begrunne et bytte i seg selv.

    Hva skjer med prisen etter 2026?

    Introduksjonsprisen gjelder til 31. desember 2026. Fra 2027 er prisen 1,50 dollar per million input-tokens og 7,50 dollar per million output-tokens (VentureBeat). Det tilsvarer det forgjengeren kostet, så dette er en tilbakevending til normalpris, ikke en økning.

    Kan alle i teamet bruke modellen?

    Ikke uten videre. Via API, AI Studio og Gemini Enterprise er den bredt tilgjengelig, men enkeltpersoner får den kun gjennom Gemini Spark og bare med AI Pro- eller Ultra-abonnement (Ars Technica, 2026). Planlegg lisenser før testen starter.

    Hva sier regelverket om bruk i utvikling?

    Generativ AI klassifiseres ikke som høyrisiko under AI Act, men omfattes av åpenhetskrav og opphavsrettsregler (EU-kommisjonen). I praksis betyr det at dere må vite hvilke systemer som er i bruk, hva de gjør, og kunne stå for koden som havner i produktet.

    Hvor lenge varer denne modellversjonen?

    Ingen vet, og det er poenget. Forgjengeren varte tre uker (Google DeepMind, 2026). Konkurrenten har pensjonert flere modellgenerasjoner i løpet av 2026, noen med bare 30 dagers nedtrapping (OpenAI, 2026). Bygg for bytte, ikke for varighet.

    Oppsummering og neste steg

    Gemini 3.7 Flash er en reell forbedring på koding og agentiske oppgaver, priset lavere frem til 31. desember 2026 og til forgjengerens nivå etter det. Det gjør den verdt en strukturert test nå, og verdt et budsjett regnet på 1,50 og 7,50 dollar per million tokens.

    Tre ting å gjøre denne uken. Mål dagens token-forbruk og sett en baseline på ti til femten reelle oppgaver. Sjekk hvor mange steder i kodebasen et modellnavn er hardkodet. Sett 31. desember 2026 i kalenderen som revurderingsdato, sammen med et forbrukstak som varsler før regningen overrasker noen.

    Det korte svaret

    Test den, budsjetter den til full pris, og ikke bygg noe som forutsetter at den er der om et halvt år. Modellmarkedet flytter seg raskere enn de fleste innkjøpsprosesser, og den eneste holdbare strategien er å gjøre byttekostnaden lav nok til at hastigheten blir en fordel i stedet for en risiko.

    I Alura bygger vi AI-infrastruktur for norske virksomheter, fra dataplattformer til agentiske systemer i produksjon. Vi er ikke en SaaS-leverandør. Vi er håndverkere som setter sammen byggesteinene som faktisk fungerer for din situasjon.

    Bestill en arkitektur-samtale: vi går gjennom din nåværende infrastruktur, identifiserer integrasjonspunkter, og foreslår en pragmatisk vei videre. Uforpliktende, 45 minutter.

    Kilder

    A

    Alura

    Praktisk kunnskap om AI-automatisering og effektivisering for norske bedrifter.