24 min

    Åpen vekt AI gir frihet men 975 milliarder krever tung drift

    Thinking Machines' Inkling er åpen vekt og gratis å laste ned, men 975 milliarder parametere krever tung infrastruktur. Hva betyr det for norske SMB-er som vurderer egen AI?

    Teknologi & Verktøyåpen vekt AI-modellbygge egen AI-modellfinjustere AI-modellAI-infrastruktur for SMBopen-weight modell
    Åpen vekt AI gir frihet men 975 milliarder krever tung drift

    Åpen vekt mot åpen kildekode: hva forskjellen faktisk betyr

    Da Thinking Machines Lab slapp Inkling i juli 2026, kunne hvem som helst laste ned vektene til en modell med 975 milliarder parametere. For en norsk SMB-leder høres det ut som en gavepakke: en modell i frontier-skala, gratis å bruke, uten API-avtale. Men åpen vekt betyr ikke det mange tror det betyr, og forskjellen mellom åpen vekt og åpen kildekode avgjør hva du faktisk kan gjøre med modellen.

    Denne artikkelen tar for seg hva en åpen vekt AI-modell er, hva infrastrukturen krever, og når det lønner seg å finjustere en slik modell fremfor å betale for et lukket API. Vi bruker Inkling som gjennomgående eksempel fordi den er fersk, stor og godt dokumentert, men poengene gjelder hele feltet av open-weight modeller.

    Hva vekt betyr i en språkmodell

    Vektene er tallene modellen har lært under trening: styrken på koblingene mellom de kunstige nevronene. Det er disse tallene som utgjør modellens kunnskap. Når AI21 definerer en åpen-vekt-modell, er det nettopp de trente parametrene som gjøres offentlig tilgjengelige. Du får altså det ferdige resultatet av treningen, ikke oppskriften på hvordan det ble laget.

    Det praktiske skillet er dette: med vektene i hånden kan du kjøre modellen på egne servere, inspisere den, og finjustere den på dine egne data. Du slipper å be en leverandør om tilgang, og du er ikke bundet av bruksvilkårene i et API. Åpen-vekt-betegnelsen lar ingeniører laste ned, inspisere, finjustere og selvhoste modellen uten å forhandle om API-tilgang.

    Åpen vekt gir tilgang, ikke oppskrift

    Her ligger den viktigste nyansen. En open-weight modell deler vanligvis ikke treningskoden, datasettene eller de fullstendige arkitekturdetaljene. AI21 er tydelig på at åpne vekter typisk ikke inkluderer treningskode, datasett eller full arkitekturbeskrivelse. Åpen kildekode er noe mer: der gjøres både modellarkitekturen og koden offentlig tilgjengelig.

    Inkling illustrerer grensen godt. Simon Willison påpeker at dokumentasjonen av treningsdata er minimal, og sier bare at datasettene inkluderer offentlig eiendom og muligens opphavsrettsbeskyttet innhold. Du får vektene, men ikke innsyn i nøyaktig hva modellen så under trening. For en SMB som skal vurdere juridisk risiko rundt treningsdata, er det en reell begrensning.

    Rammeverk for å måle åpenhet finnes: White et al. publiserte Model Openness Framework i 2024 nettopp fordi begrepene brukes upresist. Poenget for beslutningstakere er å ikke lese ordet åpen som en garanti for full transparens.

    Apache 2.0 og hva lisensen tillater

    Inkling er sluppet under Apache 2.0-lisensen, som Willison bekrefter. Det er en av de mest tillatende lisensene som finnes: kommersiell bruk, endring og videredistribusjon er tillatt, uten krav om at du deler dine egne endringer tilbake. For en bedrift som vil bygge et produkt oppå modellen, fjerner det mye juridisk friksjon.

    En kuratert oversikt over åpen-vekt-modeller med kommersielt utnyttbare lisenser viser at lisensbildet varierer kraftig mellom modeller. Noen har geografiske restriksjoner eller begrensninger på bruksområde. Apache 2.0 er blant de reneste, og det er en del av grunnen til at Inkling-lanseringen fikk oppmerksomhet.

    Inkling i korte trekk: 975 milliarder parametere og 1 million tokens kontekst

    Inkling er den første modellen fra Thinking Machines Lab, selskapet grunnlagt av tidligere OpenAI-teknologidirektør Mira Murati. Selskapet ble grunnlagt i 2026, har rundt 200 ansatte, og hentet 2 milliarder dollar i 2025 til en verdivurdering på 12 milliarder dollar. En senere runde rapportert til 50 milliarder dollar ble omtalt i november 2025.

    975 milliarder parametere, 41 milliarder aktive

    Inkling er en Mixture-of-Experts-transformer med 975 milliarder totale parametere og 41 milliarder aktive. Arkitekturen er poenget: selv om modellen er enorm, aktiverer den bare 41 milliarder parametere per oppgave, slik TechCrunch beskriver. Det gjør kjøringen billigere enn tallet 975 milliarder skulle tilsi, men det fjerner ikke behovet for å laste hele modellen i minnet.

    Under panseret er dette en Mixture-of-Experts med 256 rutede eksperter per lag. Modellen ble pretrent på 45 billioner tokens med tekst, bilder, lyd og video, og finjustert gjennom 30 millioner RL-rollouts. Til sammenligning har DeepSeek V3/R1 671 milliarder totale parametere, så Inkling ligger et hakk over selv de store kinesiske modellene i ren størrelse.

    Thinking Machines lover også en mindre variant. Inkling-Small er en 276 milliarder-modell med 12 milliarder aktive parametere, men vektene er ikke sluppet ennå. For SMB-er som synes 975 milliarder er uhåndterlig, kan den mindre varianten bli mer interessant når den kommer.

    Kontekst, multimodalitet og kontrollerbar tankeinnsats

    Inkling støtter et kontekstvindu på opptil 1 million tokens. Det plasserer den blant de romsligere modellene, men ikke i toppen: grok-4.20 har opptil 2 millioner tokens, og Llama 4 Scout har publisert et vindu på 10 millioner tokens. For de fleste forretningsoppgaver, som å analysere lange dokumenter eller hele kodebaser, holder 1 million godt.

    Modellen er naturlig multimodal og tar imot tekst, bilder og lyd. En interessant driftsfunksjon er kontrollerbar tankeinnsats: utvikleren kan justere hvor mye modellen resonnerer, med en innstilling som spenner fra 0,2 til 0,99. Det er en direkte kostnadsknott: mer tankeinnsats gir bedre svar, men bruker flere tokens.

    Effektiviteten er reell. Inkling matcher Nemotron 3 Ultra på Terminal Bench 2.1 med omtrent en tredjedel av tokenene, og bruker en tredjedel så mange tokens som Nvidias Nemotron 3 Ultra for samme kodeytelse. Færre tokens per oppgave betyr lavere driftskostnad når du kjører modellen i stor skala.

    Hvor Inkling står mot lukkede modeller

    Thinking Machines hevder ikke at Inkling er best i klassen. Willison beskriver den som en sterk basismodell for finjustering, ikke en frontier-modell. Benchmark-tallene bekrefter et solid, ikke ledende, nivå. Tabellen under samler de publiserte resultatene.

    BenchmarkInkling-scoreKilde
    SWE-bench Verified77,6%koding
    VoiceBench91,4%tale
    GPQA Diamond87,2%resonnering
    AIME 202697,1%matematikk
    Bridgewater finansresonnering84,7%domene
    StrongREJECT98,6%sikkerhet

    På koding scorer Inkling 77,6% på SWE-bench Verified og 91,4% på VoiceBench. På resonnering ligger den på 87,2% på GPQA Diamond og 97,1% på AIME 2026. I et samarbeid med Bridgewater Associates nådde modellen 84,7% på finansielle resonnementstester.

    Til perspektiv: på GPQA Diamond leder Gemini 3.1 Pro med 94,3%, og på SWE-bench Pro leder Claude Opus 4.7 med 64,3%. De lukkede frontier-modellene ligger foran, men gapet er ikke stort nok til å diskvalifisere en finjustert Inkling for de fleste forretningsoppgaver.

    Byggekloss eller ferdigvare: to måter en SMB kan bruke modellen

    En åpen-vekt-modell kan brukes på tre nivåer, med svært ulik ressursbruk. Du kan bruke den som ferdigvare gjennom noen andres API, du kan bruke den som byggekloss ved å finjustere den på en plattform, eller du kan selvhoste den fra bunnen av. For en norsk SMB er valget mellom disse tre nivåene den viktigste beslutningen, langt viktigere enn hvilken modell du lander på.

    Thinking Machines er selv tydelige på hva de tror: selskapet markedsfører Inkling som et utgangspunkt for organisasjoner å finjustere via Tinker-plattformen, ikke som en ferdig sluttbruker-tjeneste.

    Ferdigvare via API

    Den enkleste veien er å bruke modellen gjennom en tredjepart som allerede hoster den. Åpen vekt betyr at flere leverandører kan tilby samme modell, noe som presser prisene ned. OpenRouter samler mange åpne modeller på ett API, og du betaler per token uten å eie noe infrastruktur.

    Fordelen er at du kommer i gang på minutter og ikke trenger GPU-kompetanse. Ulempen er at du sender data til en ekstern tjeneste, og at du ikke kan endre selve modellen. For mange SMB-er er dette likevel det riktige startpunktet, fordi det gir samme funksjon som et lukket API til lavere pris.

    Byggekloss via finjustering

    Her ligger den reelle grunnen til at Inkling finnes. Modellen er tilgjengelig for finjustering på Tinker i dag, og Willison beskriver den eksplisitt som en basismodell å finjustere på. Å finjustere en AI-modell betyr å trene den videre på dine egne data, slik at den blir god på akkurat din bransje, dine dokumenter og din tone.

    Et konkret eksempel: Bridgewater Associates brukte Tinker til å lage en tilpasset versjon av Alibabas Qwen-modell. Poenget er at du beholder en generell, sterk basismodell, men gir den spesialistkunnskap. Resultatet kan slå en større generell modell på din spesifikke oppgave.

    Vår erfaring i Alura er at dette er det mest relevante nivået for norske SMB-er. En modell på 975 milliarder parametere er mest interessant som plattform for finjustering og videreutvikling, ikke som noe en SMB skal drifte selv. Det er der åpen vekt gir en gevinst du ikke får fra et lukket API: modellen kan læres opp på dine data uten at dataene forlater et miljø du kontrollerer.

    Selvhosting: den tunge veien

    Å selvhoste Inkling betyr å kjøre alle 975 milliarder parametrene på egen maskinvare. Det er teknisk mulig, men kravene er betydelige. Ved 975 milliarder parametere krever inferens flere GPU-er eller distribuerte oppsett for rimelig gjennomstrømning, og de fleste åpen-vekt-utgivelser ligger godt under denne skalaen.

    Konklusjonen fra samme kilde er nøktern: for solo-grundere og små team er Inkling ikke en drop-in-erstatning for administrert API-inferens med mindre skyleverandører plukker den opp. Nettopp derfor mener Alura at gevinsten fra åpen vekt først materialiseres når en skyleverandør hoster modellen. Kontrollen og fleksibiliteten er reell, men infrastrukturkravet gjør selvhosting til feil vei for de aller fleste.

    Rammeverk for å velge mellom åpen vekt og lukket API

    Valget mellom en åpen-vekt-modell og et lukket API er ikke et spørsmål om hvilken teknologi som er finest. Det er en avveining mellom datakontroll, totalkostnad og hvilken kompetanse du har internt. Alura mener SMB-er bør veie totalkostnad og datakontroll opp mot hverandre, ikke la lisensen alene avgjøre. En Apache 2.0-lisens er verdiløs hvis du ikke har folk som kan drifte modellen.

    Tabellen under setter de vanligste beslutningskriteriene opp mot hverandre. Bruk den som en sjekkliste, ikke som en fasit: vekten på hvert kriterium avhenger av bransjen din.

    KriteriumÅpen vekt (finjustert eller selvhostet)Lukket API
    DatakontrollData kan holdes i eget eller valgt miljøData sendes til leverandøren
    OppstartstidDager til ukerMinutter
    TilpasningFull: finjustering på egne dataBegrenset til prompt og verktøy
    DriftskompetanseKrever ML- og infrastrukturkunnskapNesten ingen
    KostnadsprofilHøy fast kostnad, lav marginalkostnadLav fast kostnad, betal per token
    LeverandørbindingLav: modellen er din å flytteHøy: bundet til ett API

    Datakontroll som utgangspunkt

    For bransjer med sensitive data, som helse, finans og offentlig sektor, er datakontroll ofte det avgjørende. Åpen-vekt-modeller gir bedriftsteam større kontroll, tilpasningsevne og transparens. Med en finjustert eller selvhostet modell kan du holde dataene innenfor en grense du selv definerer.

    Motstykket er at et lukket API sender dataene dine til leverandøren. Noen API-er lagrer heller ikke data, men du må ta det på tro. Verdt å merke er også at ikke alle åpne modeller er trygge her: DeepSeeks førsteparts-API beholder data for treningsformål. Åpen vekt gir muligheten til datakontroll, men bare hvis du hoster modellen et sted du stoler på.

    Totalkostnad framfor lisenspris

    En gratis lisens forleder mange. Den reelle regningen for en åpen-vekt-modell er GPU-timer, ML-kompetanse og drift, ikke lisensen. Et lukket API har motsatt profil: ingen fast kostnad, men du betaler per token så lenge du bruker det. Ved lavt til middels volum vinner ofte API-et. Ved høyt, jevnt volum kan en hostet åpen modell bli billigere per oppgave.

    Bildet kompliseres av at frontier-modeller nå er dyre per token mens åpne modeller er billige. Frontier-modeller ligger på 2,50 til 5 dollar input og 15 til 30 dollar output per million tokens, mens DeepSeek V4 Flash koster 0,14 dollar input og 0,28 dollar output per million tokens. Regn på ditt faktiske volum før du bestemmer deg.

    Første steg mot finjustering på en plattform som Tinker

    Finjustering høres avansert ut, men plattformer som Tinker senker terskelen kraftig. Du trenger ikke sette opp GPU-klynger selv. Du leverer treningsdata og en oppgavebeskrivelse, plattformen håndterer resten. Inkling er tilgjengelig for finjustering på Tinker fra lansering.

    Hva Tinker er

    Tinker er Thinking Machines sin treningsplattform. Modellen er tilgjengelig for finjustering på Tinker i dag, og selskapet markedsfører Inkling som et utgangspunkt organisasjoner kan finjustere via plattformen. Tanken er at en sterk basismodell kan bli mange spesialiserte modeller, en per kunde eller bruksområde.

    At Bridgewater brukte Tinker til å lage en egen versjon av Qwen viser at plattformen er modellagnostisk i praksis. Du er ikke låst til Inkling, men Inkling er nå det ferskeste alternativet med en ren Apache 2.0-lisens.

    Når finjustering lønner seg

    Finjustering lønner seg når du har en avgrenset, repeterende oppgave og data som er spesifikke for din virksomhet. Klassifisering av kundehenvendelser på norsk, uttrekk fra egne kontrakter, eller svar i en bestemt faglig tone er gode kandidater. Da kan en finjustert mellomstor modell slå en større generell modell, og til lavere kostnad per kjøring.

    Finjustering lønner seg ikke når oppgaven er bred og skiftende, eller når volumet er lavt. Skal du bare ha en generell assistent noen ganger om dagen, er et lukket API både billigere og enklere. Vurder også om problemet egentlig løses med bedre prompt og kontekst før du trener noe. For flere avveininger rundt modellvalg har vi skrevet om hvordan norske bedrifter velger mellom GPT, Claude, Gemini og lokale modeller.

    Praktisk på mandag

    Start i det små. Definer en oppgave, samle 200 til 1000 gode eksempler på ønsket input og output, og kjør en pilot på en plattform før du binder deg til noe. Mål resultatet mot et lukket API på samme oppgave. Hvis den finjusterte modellen ikke slår API-et tydelig på kvalitet eller pris, har du fått svaret uten å ha bygget noe stort.

    Sørg for at datakvaliteten er høyere prioritet enn datamengden. En finjustert modell arver feilene i treningsdataene. Rydd, anonymiser og kvalitetssikre eksemplene, og hold en holdout-mengde du ikke trener på, slik at du kan måle ærlig. Skal resultatet ende i en kundeflate, se hvordan vi tenker rundt å bygge og implementere AI-chatboter for bedrifter.

    Markedet for åpne modeller: Kina, USA og europeiske alternativer

    Åpen vekt er ikke et nisjefenomen lenger. Åpne modeller har holdt et konsistent gap på 3 til 6 måneder bak frontier-labene i over 18 måneder. For en SMB betyr det at du sjelden er mer enn et halvår unna toppen når du velger åpen vekt, mot en brøkdel av prisen.

    Tabellen under sammenligner de mest aktuelle åpne modellene på størrelse og kontekst, med Inkling som referanse.

    ModellTotale parametereAktive parametereKontekst
    Inkling975B41B1M
    DeepSeek V4 Pro1,6T49B
    DeepSeek V4 Flash284B13B1M
    GLM 5.2744B~40B1M
    Nemotron 3 Ultra550B55B
    Qwen3 Coder Next80B3B
    Devstral 2123B256K

    Kinesiske modeller leder åpen vekt

    Tyngdepunktet i åpen vekt ligger i Kina. Det vestlige åpen-kildekode-økosystemet henger etter de kinesiske motstykkene etter at Meta forlot sin åpne strategi. Modellene bekrefter det: DeepSeek V4 Pro har 1,6 billioner totale parametere og 49 milliarder aktive, mens DeepSeek V4 Flash har 284 milliarder totale og 13 milliarder aktive.

    På kvalitet holder de mål. DeepSeek V4 Pro scorer 80,6% på SWE-bench Verified og DeepSeek V4 Flash 79,0%, og DeepSeek V4 Flash omtales som den første åpen-vekt-modellen brukt som troverdig erstatning for frontier-modeller i agent-pipelines. Z.ai sin GLM 5.2 er en stor-skala resonneringsmodell med 1 million tokens kontekst som scorer 62,1% på SWE-bench Pro, det høyeste av noen åpen-vekt-modell.

    USAs comeback med Inkling og Nemotron

    Inkling er en del av et amerikansk motsvar. Willison beskriver lanseringen som konkurransedyktig med kinesiske åpne modeller og et levedyktig amerikansk alternativ. NVIDIA er den andre tunge aktøren: Nemotron 3 Ultra er den sterkeste amerikanske åpen-vekt-modellen, med 55 milliarder aktive parametere av 550 milliarder totale.

    På kvalitetsindeksen ligger de kinesiske og amerikanske alternativene tett. Nemotron 3 Ultra scorer 48 og MiniMax M3 scorer 44 på Artificial Analysis Intelligence Index v4.1. At Inkling matcher Nemotron 3 Ultra med en tredjedel av tokenene er dens tydeligste konkurransefortrinn.

    Europa: Mistral og Cohere-Aleph Alpha

    Europa er svakere representert, men ikke fraværende. Franske Mistral hadde rundt 400 millioner dollar i årlig gjentakende inntekt i midten av 2025 og en betydelig post-money-verdivurdering etter Series C i september 2025. Selskapet hentet 830 millioner dollar i gjeld til et datasenter i Bruyeres-le-Chatel.

    Konsolidering preger bildet. Fusjonen mellom Cohere og Aleph Alpha reformer den europeiske fortellingen, men er ennå ikke lukket. Den samlede enheten verdsettes til 20 milliarder dollar, med en Schwarz Series E-investering på 600 millioner dollar. For en norsk SMB med krav om europeisk datahåndtering er dette segmentet verdt å følge, selv om modellene ikke er størst.

    Hva det koster: GPU-infrastruktur og token-priser

    Kostnaden ved åpen vekt deler seg i to helt ulike scenarier. Kjøper du modellen som en tjeneste per token, er den billig og forutsigbar. Hoster du den selv, betaler du for maskinvare, minne og drift uansett om du bruker modellen mye eller lite. Å blande de to sammen er den vanligste tabben i budsjettering.

    Token-priser: åpen mot frontier

    Prisgapet mellom åpne og lukkede modeller er stort og økende. Tabellen under viser vektede snittpriser der de finnes.

    ModellInput per 1M tokensOutput per 1M tokens
    Frontier (GPT-5.5, Opus, Gemini 3 Pro)$2,50-5$15-30
    DeepSeek V4 Flash$0,14$0,28
    DeepSeek V3.2$0,28$0,42
    MiniMax M3$0,098$1,21
    Nemotron 3 Ultra$0,423$2,61
    GLM 5.2$0,447$3,31

    Frontier-modeller ligger på 2,50 til 5 dollar input og 15 til 30 dollar output per million tokens. De åpne modellene ligger langt under: DeepSeek V4-Flash er prisgulv-leder på 0,14 dollar input og 0,28 dollar output, MiniMax M3 på 0,098 og 1,21 dollar, og GLM 5.2 på 0,447 og 3,31 dollar. Thinking Machines hevder Inkling koster en fjortendedel av topp proprietære modeller.

    GPU og VRAM ved selvhosting

    Hoster du Inkling selv, er minne den harde grensen. En kuratert liste over praktisk kjørbare åpen-vekt-modeller setter grensen ved 128 GB VRAM for hovednivået og 256 GB for det utvidede nivået. Inkling på 975 milliarder parametere ligger langt over selv det utvidede nivået, og krever derfor flere GPU-er eller distribuerte oppsett.

    Det er her drømmen om gratis AI møter virkeligheten. Mindre modeller kan kjøres på beskjeden maskinvare, som Bonsai-8B på 1,15 GB diskplass, men de leverer ikke Inkling-kvalitet. Forsøk på å trene store modeller uten datasenter finnes, som Covenant-72B som nådde 94,5% databehandlingsutnyttelse til tross for nettverksbegrensninger, men dette er forskning, ikke noe en SMB bør basere drift på.

    Skyhosting som mellomvei

    Den praktiske veien for de fleste er å la en skyleverandør hoste modellen. Da får du åpen-vekt-fordelene, kontroll over hvor dataene ligger og mulighet for finjustering, uten å eie GPU-ene. Alura mener dette er punktet der gevinsten fra åpen vekt faktisk materialiseres. Uten en skyleverandør som tar driften, blir en 975 milliarder-modell mer en byrde enn en fordel for en SMB.

    At compute i det hele tatt er tilgjengelig, drives av enorm etterspørsel. NVIDIAs datasenterinntekt fortsetter å vokse kraftig, og selskapet guidet 91 milliarder dollar for Q2 FY27. GPU-markedet er stramt, og det påvirker prisen du betaler for hosting.

    Lisens og regulering: Apache 2.0, EU-restriksjoner og datakontroll

    Lisensen forteller hva du har lov til å gjøre med modellen. Reguleringen forteller hva du faktisk får lov til der du opererer. For en norsk SMB innenfor EØS er begge deler relevante, og de trekker ikke alltid i samme retning.

    Apache 2.0 i praksis

    Inkling under Apache 2.0 gir deg lov til kommersiell bruk, endring og distribusjon uten å måtte dele endringene dine. Det er en styrke for en bedrift som vil bygge et produkt uten å avsløre hvordan. En kuratert oversikt over modeller med kommersielt utnyttbare lisenser viser at ikke alle åpne modeller er så rene, så les alltid lisensen for den konkrete modellen.

    Merk at Inkling har egenskaper som kan skape debatt. Modellen er designet for å være motstandsdyktig mot sensur, og viser sterke mønstre av sensur-manglende-etterlevelse på en egen evaluering. Samtidig scorer den 98,6% på StrongREJECT og har ifølge Thinking Machines de sterkeste innebygde sikkerhetstiltakene av noen åpen-vekt-modell målt på FORTRESS.

    EU-restriksjoner og geografiske sperrer

    Regulering kan gjøre en teknisk tilgjengelig modell utilgjengelig i praksis. Den kuraterte listen ekskluderer eksplisitt Llama 4 multimodal på grunn av EU-eksklusjon. Det er et konkret eksempel på at en modell kan være åpen, men likevel ikke lovlig å bruke i din region.

    Eksportkontroll rammer også fra andre kanten. GLM 5.2 ble sluppet dager etter et amerikansk eksportkontroll-direktiv som tvang Anthropic til å deaktivere Fable 5 og Mythos 5. For en SMB betyr dette at leverandørvalg må tåle at det geopolitiske bildet endrer seg raskt. En åpen-vekt-modell du har lastet ned, kan du beholde, men tilgang til den nyeste versjonen er ikke garantert.

    Datakontroll og GDPR

    Datakontroll er ofte hovedargumentet for åpen vekt i EØS. Åpne vekter gir enterprise-team mer kontroll, tilpasningsevne og transparens, og lar deg holde persondata innenfor en grense du kan dokumentere overfor tilsynet. Men fordelen forsvinner hvis du sender dataene til feil sted.

    Advarselen er konkret: DeepSeeks førsteparts-API beholder data for treningsformål. Å bruke en åpen modell gjennom et vilkårlig API kan altså gi dårligere datakontroll enn et seriøst lukket API. Poenget er at kontroll følger av hvor og hvordan du hoster, ikke av at modellen kalles åpen.

    Markedsobservasjon: åpen vekt presser prisene mens frontier stabiliserer

    Et av de tydeligste mønstrene i markedet nå er at prisfallet har flyttet seg fra frontier til åpen vekt. Frontier-prisene har sluttet å falle, og det er åpenheten som gjør prisreduksjonsarbeidet. For en SMB betyr det at de billigste kvalitetsforbedringene fremover trolig kommer fra åpne modeller, ikke fra de lukkede toppmodellene.

    Frontier-priser har stoppet å falle

    Frontier-labene har lite press på å kutte priser, fordi etterspørselen overgår tilbudet. Selve utviklingstakten har roet seg: mai 2026 var uvanlig stille ved frontier sammenlignet med den raske kadensen fra januar til april. Toppmodellene forbedrer seg fortsatt, men i mindre sprang, og prisene holder seg oppe i båndet på 2,50 til 5 dollar input og 15 til 30 dollar output.

    Samtidig er inntektene i toppen enorme. De fire største leverandørene har rundt 50 milliarder dollar i samlet rapportert løpende inntekt og 1 billion dollar i samlede forpliktede compute-kjøp gjennom 2032. Med den kapitalbasen har de ingen grunn til å utløse en priskrig.

    Compute er flaskehalsen, ikke evne

    Rapporten fra Information Matters slår fast at compute-tilgang, ikke kapabilitet, er den bindende begrensningen ved frontier. Kohorten er todelt, ikke sammenlignbar på tvers av ni aktører, med de største på en strukturell skala andre ikke når. For SMB-er er dette godt nytt: når toppen er begrenset av maskinvare, får de åpne modellene rom til å ta igjen på pris og tilgjengelighet.

    Kapitalstrømmene understreker skalaen. Anthropics runde 28. mai på 65 milliarder dollar til 965 milliarder dollar post-money passerte OpenAIs verdivurdering på 852 milliarder dollar. ChatGPT hadde 800 millioner ukentlige aktive brukere i oktober 2025. Dette er et marked der de største kjemper om compute, mens de åpne modellene konkurrerer på pris.

    Vanlige feil når SMB-er vurderer å bygge egen AI-modell

    Å bygge en egen AI-modell høres strategisk ut, men de fleste SMB-er som prøver, snubler i de samme fire feilene. Alle handler om å forveksle tilgang med kapasitet.

    Å tro at åpen vekt betyr gratis

    Den vanligste feilen er å lese Apache 2.0 som gratis drift. Lisensen er gratis, kjøringen er ikke. En modell på 975 milliarder parametere krever flere GPU-er eller distribuerte oppsett, og GPU-timer koster penger uansett hvor lite du bruker modellen. Regn på total eierkostnad, ikke lisensprisen.

    Sammenlign alltid mot alternativet. Med DeepSeek V4-Flash til 0,14 og 0,28 dollar per million tokens gjennom et API, må selvhostingen din generere svært høyt volum før den lønner seg. Mange oppdager at API-et er billigere selv ved betydelig bruk.

    Å undervurdere driftskompetansen

    Å drifte en stor modell krever ML-ingeniører, ikke bare utviklere. Du må håndtere minne, gjennomstrømning, oppdateringer og overvåking. For små team er Inkling ikke en drop-in-erstatning for administrert API-inferens med mindre skyleverandører plukker den opp. Undervurderer du dette, ender du med en modell som står stille fordi ingen kan holde den i gang.

    En nyttig test: har du folk internt som kan feilsøke en GPU-out-of-memory-feil klokken to om natten? Hvis ikke, hør på markedet og la noen andre ta driften. Kontrollen fra åpen vekt er verdiløs hvis systemet ikke kjører.

    Å velge på lisens eller benchmark alene

    En ren lisens og en høy benchmark-score frister, men ingen av delene garanterer verdi for din oppgave. Benchmarks som GLM-5.2 sine 62,1% på SWE-bench Pro eller DeepSeek V4 Pro sine 80,6% på SWE-bench Verified måler generelle oppgaver, ikke din spesifikke bruk. Kjør din egen test på dine egne data før du velger.

    Alura mener valget bør avgjøres av totalkostnad og datakontroll sammen, ikke av lisensen isolert. En dyrere modell med bedre datahåndtering kan være det riktige valget for en helse- eller finansaktør, selv om en billigere modell scorer høyere på en offentlig benchmark.

    Ofte stilte spørsmål om åpen vekt AI for norske SMB-er

    De vanligste spørsmålene vi får fra norske ledere som vurderer en åpen-vekt-modell, med korte og konkrete svar.

    Kan vi kjøre Inkling på våre egne servere?

    Teknisk ja, praktisk sjelden. 975 milliarder parametere krever flere GPU-er eller distribuerte oppsett, og modellen ligger langt over det utvidede nivået på 256 GB VRAM som kuraterte lister setter for praktisk kjørbare modeller. For de fleste SMB-er er skyhosting eller et API riktig vei.

    Når lønner en åpen modell seg fremfor et lukket API?

    Når du har høyt, jevnt volum, en avgrenset oppgave som tjener på finjustering, eller strenge krav til datakontroll. Ved lavt volum og brede oppgaver vinner et lukket API på både pris og enkelhet, særlig med åpne modeller tilgjengelig via API til 0,14 og 0,28 dollar per million tokens uansett.

    Er åpne modeller like gode som de lukkede?

    Nesten, med et lite etterslep. Åpne modeller har holdt et gap på 3 til 6 måneder bak frontier i over 18 måneder. På koding er avstanden liten: GLM-5.2 scorer 62,1% på SWE-bench Pro, det høyeste av noen åpen modell, mens GPT-5.5 leder Terminal-Bench 2.0 med 82,7%.

    Hva er forskjellen på Inkling og en tjeneste som Dropstone?

    Inkling er en modell, Dropstone er et kjøremiljø rundt en modell. Dropstone er en runtime som gjør en åpen-vekt-modell til en agent, versjonert på integrasjon, ikke på modellvekter. Prismodellen illustrerer poenget: Dropstone Pro koster 15 dollar i måneden og Max 75 dollar, mot Claude Code på 20 og 100 dollar. Du betaler for pakking og drift, ikke for selve vektene.

    Hvor mye kompetanse trenger vi for å finjustere?

    Mindre enn før, takket være plattformer. Inkling er tilgjengelig for finjustering på Tinker, som håndterer treningsjobben for deg. Du trenger folk som kan strukturere gode treningsdata og evaluere resultatet, men ikke et helt ML-team med egne GPU-klynger. Start med en liten pilot og mål mot et lukket API.

    Oppsummering og anbefaling for norske SMB-er

    Inkling gjorde en modell i frontier-skala fritt tilgjengelig, med 975 milliarder totale parametere, 41 milliarder aktive og 1 million tokens kontekst under Apache 2.0. Det er en reell åpning, men frihet på papiret er ikke det samme som drift i praksis.

    For de aller fleste norske SMB-er er en 975 milliarder-modell mest relevant som plattform for finjustering og videreutvikling, ikke som noe de drifter selv. Åpen vekt gir reell kontroll og fleksibilitet, men infrastrukturkravet gjør at gevinsten først materialiseres når en skyleverandør hoster modellen. Det er Aluras posisjon, og den følger direkte av tallene: selvhosting krever flere GPU-er eller distribuerte oppsett, mens de samme modellene finnes via API til 0,14 og 0,28 dollar per million tokens.

    Slik bør du gå frem

    Start med et lukket eller åpent API for å bevise verdien billig og raskt. Vurder finjustering på en plattform som Tinker først når du har en avgrenset oppgave, gode data og et volum som forsvarer innsatsen. Reserver selvhosting til de tilfellene der datakontroll er absolutt og du har driftskompetansen internt. Og når du velger, vei totalkostnad og datakontroll sammen, ikke lisensen alene.

    Markedet flytter seg raskt: frontier-prisene har stoppet å falle mens åpenheten driver prisreduksjonen, og åpne modeller ligger bare 3 til 6 måneder bak toppen. For en norsk SMB betyr det at du har råd til å vente med de tunge investeringene og heller la markedet gjøre arbeidet, helt til en konkret oppgave gir deg en klar grunn til å bygge selv.

    I Alura bygger vi AI-infrastruktur for norske virksomheter, fra dataplattformer til agentiske systemer i produksjon. Vi er ikke en SaaS-leverandør. Vi er håndverkere som setter sammen byggesteinene som faktisk fungerer for din situasjon.

    Bestill en arkitektur-samtale: vi går gjennom din nåværende infrastruktur, identifiserer integrasjonspunkter, og foreslår en pragmatisk vei videre. Uforpliktende, 45 minutter.

    A

    Alura

    Praktisk kunnskap om AI-automatisering og effektivisering for norske bedrifter.