Åpen vekt AI gir frihet men 975 milliarder krever tung drift
Thinking Machines' Inkling er åpen vekt og gratis å laste ned, men 975 milliarder parametere krever tung infrastruktur. Hva betyr det for norske SMB-er som vurderer egen AI?

Åpen vekt mot åpen kildekode: hva forskjellen faktisk betyr
Da Thinking Machines Lab slapp Inkling i juli 2026, kunne hvem som helst laste ned vektene til en modell med 975 milliarder parametere. For en norsk SMB-leder høres det ut som en gavepakke: en modell i frontier-skala, gratis å bruke, uten API-avtale. Men åpen vekt betyr ikke det mange tror det betyr, og forskjellen mellom åpen vekt og åpen kildekode avgjør hva du faktisk kan gjøre med modellen.
Denne artikkelen tar for seg hva en åpen vekt AI-modell er, hva infrastrukturen krever, og når det lønner seg å finjustere en slik modell fremfor å betale for et lukket API. Vi bruker Inkling som gjennomgående eksempel fordi den er fersk, stor og godt dokumentert, men poengene gjelder hele feltet av open-weight modeller.
Hva vekt betyr i en språkmodell
Vektene er tallene modellen har lært under trening: styrken på koblingene mellom de kunstige nevronene. Det er disse tallene som utgjør modellens kunnskap. Når AI21 definerer en åpen-vekt-modell, er det nettopp de trente parametrene som gjøres offentlig tilgjengelige. Du får altså det ferdige resultatet av treningen, ikke oppskriften på hvordan det ble laget.
Det praktiske skillet er dette: med vektene i hånden kan du kjøre modellen på egne servere, inspisere den, og finjustere den på dine egne data. Du slipper å be en leverandør om tilgang, og du er ikke bundet av bruksvilkårene i et API. Åpen-vekt-betegnelsen lar ingeniører laste ned, inspisere, finjustere og selvhoste modellen uten å forhandle om API-tilgang.
Åpen vekt gir tilgang, ikke oppskrift
Her ligger den viktigste nyansen. En open-weight modell deler vanligvis ikke treningskoden, datasettene eller de fullstendige arkitekturdetaljene. AI21 er tydelig på at åpne vekter typisk ikke inkluderer treningskode, datasett eller full arkitekturbeskrivelse. Åpen kildekode er noe mer: der gjøres både modellarkitekturen og koden offentlig tilgjengelig.
Inkling illustrerer grensen godt. Simon Willison påpeker at dokumentasjonen av treningsdata er minimal, og sier bare at datasettene inkluderer offentlig eiendom og muligens opphavsrettsbeskyttet innhold. Du får vektene, men ikke innsyn i nøyaktig hva modellen så under trening. For en SMB som skal vurdere juridisk risiko rundt treningsdata, er det en reell begrensning.
Rammeverk for å måle åpenhet finnes: White et al. publiserte Model Openness Framework i 2024 nettopp fordi begrepene brukes upresist. Poenget for beslutningstakere er å ikke lese ordet åpen som en garanti for full transparens.
Apache 2.0 og hva lisensen tillater
Inkling er sluppet under Apache 2.0-lisensen, som Willison bekrefter. Det er en av de mest tillatende lisensene som finnes: kommersiell bruk, endring og videredistribusjon er tillatt, uten krav om at du deler dine egne endringer tilbake. For en bedrift som vil bygge et produkt oppå modellen, fjerner det mye juridisk friksjon.
En kuratert oversikt over åpen-vekt-modeller med kommersielt utnyttbare lisenser viser at lisensbildet varierer kraftig mellom modeller. Noen har geografiske restriksjoner eller begrensninger på bruksområde. Apache 2.0 er blant de reneste, og det er en del av grunnen til at Inkling-lanseringen fikk oppmerksomhet.
Inkling i korte trekk: 975 milliarder parametere og 1 million tokens kontekst
Inkling er den første modellen fra Thinking Machines Lab, selskapet grunnlagt av tidligere OpenAI-teknologidirektør Mira Murati. Selskapet ble grunnlagt i 2026, har rundt 200 ansatte, og hentet 2 milliarder dollar i 2025 til en verdivurdering på 12 milliarder dollar. En senere runde rapportert til 50 milliarder dollar ble omtalt i november 2025.
975 milliarder parametere, 41 milliarder aktive
Inkling er en Mixture-of-Experts-transformer med 975 milliarder totale parametere og 41 milliarder aktive. Arkitekturen er poenget: selv om modellen er enorm, aktiverer den bare 41 milliarder parametere per oppgave, slik TechCrunch beskriver. Det gjør kjøringen billigere enn tallet 975 milliarder skulle tilsi, men det fjerner ikke behovet for å laste hele modellen i minnet.
Under panseret er dette en Mixture-of-Experts med 256 rutede eksperter per lag. Modellen ble pretrent på 45 billioner tokens med tekst, bilder, lyd og video, og finjustert gjennom 30 millioner RL-rollouts. Til sammenligning har DeepSeek V3/R1 671 milliarder totale parametere, så Inkling ligger et hakk over selv de store kinesiske modellene i ren størrelse.
Thinking Machines lover også en mindre variant. Inkling-Small er en 276 milliarder-modell med 12 milliarder aktive parametere, men vektene er ikke sluppet ennå. For SMB-er som synes 975 milliarder er uhåndterlig, kan den mindre varianten bli mer interessant når den kommer.
Kontekst, multimodalitet og kontrollerbar tankeinnsats
Inkling støtter et kontekstvindu på opptil 1 million tokens. Det plasserer den blant de romsligere modellene, men ikke i toppen: grok-4.20 har opptil 2 millioner tokens, og Llama 4 Scout har publisert et vindu på 10 millioner tokens. For de fleste forretningsoppgaver, som å analysere lange dokumenter eller hele kodebaser, holder 1 million godt.
Modellen er naturlig multimodal og tar imot tekst, bilder og lyd. En interessant driftsfunksjon er kontrollerbar tankeinnsats: utvikleren kan justere hvor mye modellen resonnerer, med en innstilling som spenner fra 0,2 til 0,99. Det er en direkte kostnadsknott: mer tankeinnsats gir bedre svar, men bruker flere tokens.
Effektiviteten er reell. Inkling matcher Nemotron 3 Ultra på Terminal Bench 2.1 med omtrent en tredjedel av tokenene, og bruker en tredjedel så mange tokens som Nvidias Nemotron 3 Ultra for samme kodeytelse. Færre tokens per oppgave betyr lavere driftskostnad når du kjører modellen i stor skala.
Hvor Inkling står mot lukkede modeller
Thinking Machines hevder ikke at Inkling er best i klassen. Willison beskriver den som en sterk basismodell for finjustering, ikke en frontier-modell. Benchmark-tallene bekrefter et solid, ikke ledende, nivå. Tabellen under samler de publiserte resultatene.
| Benchmark | Inkling-score | Kilde |
|---|---|---|
| SWE-bench Verified | 77,6% | koding |
| VoiceBench | 91,4% | tale |
| GPQA Diamond | 87,2% | resonnering |
| AIME 2026 | 97,1% | matematikk |
| Bridgewater finansresonnering | 84,7% | domene |
| StrongREJECT | 98,6% | sikkerhet |
På koding scorer Inkling 77,6% på SWE-bench Verified og 91,4% på VoiceBench. På resonnering ligger den på 87,2% på GPQA Diamond og 97,1% på AIME 2026. I et samarbeid med Bridgewater Associates nådde modellen 84,7% på finansielle resonnementstester.
Til perspektiv: på GPQA Diamond leder Gemini 3.1 Pro med 94,3%, og på SWE-bench Pro leder Claude Opus 4.7 med 64,3%. De lukkede frontier-modellene ligger foran, men gapet er ikke stort nok til å diskvalifisere en finjustert Inkling for de fleste forretningsoppgaver.
Byggekloss eller ferdigvare: to måter en SMB kan bruke modellen
En åpen-vekt-modell kan brukes på tre nivåer, med svært ulik ressursbruk. Du kan bruke den som ferdigvare gjennom noen andres API, du kan bruke den som byggekloss ved å finjustere den på en plattform, eller du kan selvhoste den fra bunnen av. For en norsk SMB er valget mellom disse tre nivåene den viktigste beslutningen, langt viktigere enn hvilken modell du lander på.
Thinking Machines er selv tydelige på hva de tror: selskapet markedsfører Inkling som et utgangspunkt for organisasjoner å finjustere via Tinker-plattformen, ikke som en ferdig sluttbruker-tjeneste.
Ferdigvare via API
Den enkleste veien er å bruke modellen gjennom en tredjepart som allerede hoster den. Åpen vekt betyr at flere leverandører kan tilby samme modell, noe som presser prisene ned. OpenRouter samler mange åpne modeller på ett API, og du betaler per token uten å eie noe infrastruktur.
Fordelen er at du kommer i gang på minutter og ikke trenger GPU-kompetanse. Ulempen er at du sender data til en ekstern tjeneste, og at du ikke kan endre selve modellen. For mange SMB-er er dette likevel det riktige startpunktet, fordi det gir samme funksjon som et lukket API til lavere pris.
Byggekloss via finjustering
Her ligger den reelle grunnen til at Inkling finnes. Modellen er tilgjengelig for finjustering på Tinker i dag, og Willison beskriver den eksplisitt som en basismodell å finjustere på. Å finjustere en AI-modell betyr å trene den videre på dine egne data, slik at den blir god på akkurat din bransje, dine dokumenter og din tone.
Et konkret eksempel: Bridgewater Associates brukte Tinker til å lage en tilpasset versjon av Alibabas Qwen-modell. Poenget er at du beholder en generell, sterk basismodell, men gir den spesialistkunnskap. Resultatet kan slå en større generell modell på din spesifikke oppgave.
Vår erfaring i Alura er at dette er det mest relevante nivået for norske SMB-er. En modell på 975 milliarder parametere er mest interessant som plattform for finjustering og videreutvikling, ikke som noe en SMB skal drifte selv. Det er der åpen vekt gir en gevinst du ikke får fra et lukket API: modellen kan læres opp på dine data uten at dataene forlater et miljø du kontrollerer.
Selvhosting: den tunge veien
Å selvhoste Inkling betyr å kjøre alle 975 milliarder parametrene på egen maskinvare. Det er teknisk mulig, men kravene er betydelige. Ved 975 milliarder parametere krever inferens flere GPU-er eller distribuerte oppsett for rimelig gjennomstrømning, og de fleste åpen-vekt-utgivelser ligger godt under denne skalaen.
Konklusjonen fra samme kilde er nøktern: for solo-grundere og små team er Inkling ikke en drop-in-erstatning for administrert API-inferens med mindre skyleverandører plukker den opp. Nettopp derfor mener Alura at gevinsten fra åpen vekt først materialiseres når en skyleverandør hoster modellen. Kontrollen og fleksibiliteten er reell, men infrastrukturkravet gjør selvhosting til feil vei for de aller fleste.
Rammeverk for å velge mellom åpen vekt og lukket API
Valget mellom en åpen-vekt-modell og et lukket API er ikke et spørsmål om hvilken teknologi som er finest. Det er en avveining mellom datakontroll, totalkostnad og hvilken kompetanse du har internt. Alura mener SMB-er bør veie totalkostnad og datakontroll opp mot hverandre, ikke la lisensen alene avgjøre. En Apache 2.0-lisens er verdiløs hvis du ikke har folk som kan drifte modellen.
Tabellen under setter de vanligste beslutningskriteriene opp mot hverandre. Bruk den som en sjekkliste, ikke som en fasit: vekten på hvert kriterium avhenger av bransjen din.
| Kriterium | Åpen vekt (finjustert eller selvhostet) | Lukket API |
|---|---|---|
| Datakontroll | Data kan holdes i eget eller valgt miljø | Data sendes til leverandøren |
| Oppstartstid | Dager til uker | Minutter |
| Tilpasning | Full: finjustering på egne data | Begrenset til prompt og verktøy |
| Driftskompetanse | Krever ML- og infrastrukturkunnskap | Nesten ingen |
| Kostnadsprofil | Høy fast kostnad, lav marginalkostnad | Lav fast kostnad, betal per token |
| Leverandørbinding | Lav: modellen er din å flytte | Høy: bundet til ett API |
Datakontroll som utgangspunkt
For bransjer med sensitive data, som helse, finans og offentlig sektor, er datakontroll ofte det avgjørende. Åpen-vekt-modeller gir bedriftsteam større kontroll, tilpasningsevne og transparens. Med en finjustert eller selvhostet modell kan du holde dataene innenfor en grense du selv definerer.
Motstykket er at et lukket API sender dataene dine til leverandøren. Noen API-er lagrer heller ikke data, men du må ta det på tro. Verdt å merke er også at ikke alle åpne modeller er trygge her: DeepSeeks førsteparts-API beholder data for treningsformål. Åpen vekt gir muligheten til datakontroll, men bare hvis du hoster modellen et sted du stoler på.
Totalkostnad framfor lisenspris
En gratis lisens forleder mange. Den reelle regningen for en åpen-vekt-modell er GPU-timer, ML-kompetanse og drift, ikke lisensen. Et lukket API har motsatt profil: ingen fast kostnad, men du betaler per token så lenge du bruker det. Ved lavt til middels volum vinner ofte API-et. Ved høyt, jevnt volum kan en hostet åpen modell bli billigere per oppgave.
Bildet kompliseres av at frontier-modeller nå er dyre per token mens åpne modeller er billige. Frontier-modeller ligger på 2,50 til 5 dollar input og 15 til 30 dollar output per million tokens, mens DeepSeek V4 Flash koster 0,14 dollar input og 0,28 dollar output per million tokens. Regn på ditt faktiske volum før du bestemmer deg.
Første steg mot finjustering på en plattform som Tinker
Finjustering høres avansert ut, men plattformer som Tinker senker terskelen kraftig. Du trenger ikke sette opp GPU-klynger selv. Du leverer treningsdata og en oppgavebeskrivelse, plattformen håndterer resten. Inkling er tilgjengelig for finjustering på Tinker fra lansering.
Hva Tinker er
Tinker er Thinking Machines sin treningsplattform. Modellen er tilgjengelig for finjustering på Tinker i dag, og selskapet markedsfører Inkling som et utgangspunkt organisasjoner kan finjustere via plattformen. Tanken er at en sterk basismodell kan bli mange spesialiserte modeller, en per kunde eller bruksområde.
At Bridgewater brukte Tinker til å lage en egen versjon av Qwen viser at plattformen er modellagnostisk i praksis. Du er ikke låst til Inkling, men Inkling er nå det ferskeste alternativet med en ren Apache 2.0-lisens.
Når finjustering lønner seg
Finjustering lønner seg når du har en avgrenset, repeterende oppgave og data som er spesifikke for din virksomhet. Klassifisering av kundehenvendelser på norsk, uttrekk fra egne kontrakter, eller svar i en bestemt faglig tone er gode kandidater. Da kan en finjustert mellomstor modell slå en større generell modell, og til lavere kostnad per kjøring.
Finjustering lønner seg ikke når oppgaven er bred og skiftende, eller når volumet er lavt. Skal du bare ha en generell assistent noen ganger om dagen, er et lukket API både billigere og enklere. Vurder også om problemet egentlig løses med bedre prompt og kontekst før du trener noe. For flere avveininger rundt modellvalg har vi skrevet om hvordan norske bedrifter velger mellom GPT, Claude, Gemini og lokale modeller.
Praktisk på mandag
Start i det små. Definer en oppgave, samle 200 til 1000 gode eksempler på ønsket input og output, og kjør en pilot på en plattform før du binder deg til noe. Mål resultatet mot et lukket API på samme oppgave. Hvis den finjusterte modellen ikke slår API-et tydelig på kvalitet eller pris, har du fått svaret uten å ha bygget noe stort.
Sørg for at datakvaliteten er høyere prioritet enn datamengden. En finjustert modell arver feilene i treningsdataene. Rydd, anonymiser og kvalitetssikre eksemplene, og hold en holdout-mengde du ikke trener på, slik at du kan måle ærlig. Skal resultatet ende i en kundeflate, se hvordan vi tenker rundt å bygge og implementere AI-chatboter for bedrifter.
Markedet for åpne modeller: Kina, USA og europeiske alternativer
Åpen vekt er ikke et nisjefenomen lenger. Åpne modeller har holdt et konsistent gap på 3 til 6 måneder bak frontier-labene i over 18 måneder. For en SMB betyr det at du sjelden er mer enn et halvår unna toppen når du velger åpen vekt, mot en brøkdel av prisen.
Tabellen under sammenligner de mest aktuelle åpne modellene på størrelse og kontekst, med Inkling som referanse.
| Modell | Totale parametere | Aktive parametere | Kontekst |
|---|---|---|---|
| Inkling | 975B | 41B | 1M |
| DeepSeek V4 Pro | 1,6T | 49B | — |
| DeepSeek V4 Flash | 284B | 13B | 1M |
| GLM 5.2 | 744B | ~40B | 1M |
| Nemotron 3 Ultra | 550B | 55B | — |
| Qwen3 Coder Next | 80B | 3B | — |
| Devstral 2 | 123B | — | 256K |
Kinesiske modeller leder åpen vekt
Tyngdepunktet i åpen vekt ligger i Kina. Det vestlige åpen-kildekode-økosystemet henger etter de kinesiske motstykkene etter at Meta forlot sin åpne strategi. Modellene bekrefter det: DeepSeek V4 Pro har 1,6 billioner totale parametere og 49 milliarder aktive, mens DeepSeek V4 Flash har 284 milliarder totale og 13 milliarder aktive.
På kvalitet holder de mål. DeepSeek V4 Pro scorer 80,6% på SWE-bench Verified og DeepSeek V4 Flash 79,0%, og DeepSeek V4 Flash omtales som den første åpen-vekt-modellen brukt som troverdig erstatning for frontier-modeller i agent-pipelines. Z.ai sin GLM 5.2 er en stor-skala resonneringsmodell med 1 million tokens kontekst som scorer 62,1% på SWE-bench Pro, det høyeste av noen åpen-vekt-modell.
USAs comeback med Inkling og Nemotron
Inkling er en del av et amerikansk motsvar. Willison beskriver lanseringen som konkurransedyktig med kinesiske åpne modeller og et levedyktig amerikansk alternativ. NVIDIA er den andre tunge aktøren: Nemotron 3 Ultra er den sterkeste amerikanske åpen-vekt-modellen, med 55 milliarder aktive parametere av 550 milliarder totale.
På kvalitetsindeksen ligger de kinesiske og amerikanske alternativene tett. Nemotron 3 Ultra scorer 48 og MiniMax M3 scorer 44 på Artificial Analysis Intelligence Index v4.1. At Inkling matcher Nemotron 3 Ultra med en tredjedel av tokenene er dens tydeligste konkurransefortrinn.
Europa: Mistral og Cohere-Aleph Alpha
Europa er svakere representert, men ikke fraværende. Franske Mistral hadde rundt 400 millioner dollar i årlig gjentakende inntekt i midten av 2025 og en betydelig post-money-verdivurdering etter Series C i september 2025. Selskapet hentet 830 millioner dollar i gjeld til et datasenter i Bruyeres-le-Chatel.
Konsolidering preger bildet. Fusjonen mellom Cohere og Aleph Alpha reformer den europeiske fortellingen, men er ennå ikke lukket. Den samlede enheten verdsettes til 20 milliarder dollar, med en Schwarz Series E-investering på 600 millioner dollar. For en norsk SMB med krav om europeisk datahåndtering er dette segmentet verdt å følge, selv om modellene ikke er størst.
Hva det koster: GPU-infrastruktur og token-priser
Kostnaden ved åpen vekt deler seg i to helt ulike scenarier. Kjøper du modellen som en tjeneste per token, er den billig og forutsigbar. Hoster du den selv, betaler du for maskinvare, minne og drift uansett om du bruker modellen mye eller lite. Å blande de to sammen er den vanligste tabben i budsjettering.
Token-priser: åpen mot frontier
Prisgapet mellom åpne og lukkede modeller er stort og økende. Tabellen under viser vektede snittpriser der de finnes.
| Modell | Input per 1M tokens | Output per 1M tokens |
|---|---|---|
| Frontier (GPT-5.5, Opus, Gemini 3 Pro) | $2,50-5 | $15-30 |
| DeepSeek V4 Flash | $0,14 | $0,28 |
| DeepSeek V3.2 | $0,28 | $0,42 |
| MiniMax M3 | $0,098 | $1,21 |
| Nemotron 3 Ultra | $0,423 | $2,61 |
| GLM 5.2 | $0,447 | $3,31 |
Frontier-modeller ligger på 2,50 til 5 dollar input og 15 til 30 dollar output per million tokens. De åpne modellene ligger langt under: DeepSeek V4-Flash er prisgulv-leder på 0,14 dollar input og 0,28 dollar output, MiniMax M3 på 0,098 og 1,21 dollar, og GLM 5.2 på 0,447 og 3,31 dollar. Thinking Machines hevder Inkling koster en fjortendedel av topp proprietære modeller.
GPU og VRAM ved selvhosting
Hoster du Inkling selv, er minne den harde grensen. En kuratert liste over praktisk kjørbare åpen-vekt-modeller setter grensen ved 128 GB VRAM for hovednivået og 256 GB for det utvidede nivået. Inkling på 975 milliarder parametere ligger langt over selv det utvidede nivået, og krever derfor flere GPU-er eller distribuerte oppsett.
Det er her drømmen om gratis AI møter virkeligheten. Mindre modeller kan kjøres på beskjeden maskinvare, som Bonsai-8B på 1,15 GB diskplass, men de leverer ikke Inkling-kvalitet. Forsøk på å trene store modeller uten datasenter finnes, som Covenant-72B som nådde 94,5% databehandlingsutnyttelse til tross for nettverksbegrensninger, men dette er forskning, ikke noe en SMB bør basere drift på.
Skyhosting som mellomvei
Den praktiske veien for de fleste er å la en skyleverandør hoste modellen. Da får du åpen-vekt-fordelene, kontroll over hvor dataene ligger og mulighet for finjustering, uten å eie GPU-ene. Alura mener dette er punktet der gevinsten fra åpen vekt faktisk materialiseres. Uten en skyleverandør som tar driften, blir en 975 milliarder-modell mer en byrde enn en fordel for en SMB.
At compute i det hele tatt er tilgjengelig, drives av enorm etterspørsel. NVIDIAs datasenterinntekt fortsetter å vokse kraftig, og selskapet guidet 91 milliarder dollar for Q2 FY27. GPU-markedet er stramt, og det påvirker prisen du betaler for hosting.
Lisens og regulering: Apache 2.0, EU-restriksjoner og datakontroll
Lisensen forteller hva du har lov til å gjøre med modellen. Reguleringen forteller hva du faktisk får lov til der du opererer. For en norsk SMB innenfor EØS er begge deler relevante, og de trekker ikke alltid i samme retning.
Apache 2.0 i praksis
Inkling under Apache 2.0 gir deg lov til kommersiell bruk, endring og distribusjon uten å måtte dele endringene dine. Det er en styrke for en bedrift som vil bygge et produkt uten å avsløre hvordan. En kuratert oversikt over modeller med kommersielt utnyttbare lisenser viser at ikke alle åpne modeller er så rene, så les alltid lisensen for den konkrete modellen.
Merk at Inkling har egenskaper som kan skape debatt. Modellen er designet for å være motstandsdyktig mot sensur, og viser sterke mønstre av sensur-manglende-etterlevelse på en egen evaluering. Samtidig scorer den 98,6% på StrongREJECT og har ifølge Thinking Machines de sterkeste innebygde sikkerhetstiltakene av noen åpen-vekt-modell målt på FORTRESS.
EU-restriksjoner og geografiske sperrer
Regulering kan gjøre en teknisk tilgjengelig modell utilgjengelig i praksis. Den kuraterte listen ekskluderer eksplisitt Llama 4 multimodal på grunn av EU-eksklusjon. Det er et konkret eksempel på at en modell kan være åpen, men likevel ikke lovlig å bruke i din region.
Eksportkontroll rammer også fra andre kanten. GLM 5.2 ble sluppet dager etter et amerikansk eksportkontroll-direktiv som tvang Anthropic til å deaktivere Fable 5 og Mythos 5. For en SMB betyr dette at leverandørvalg må tåle at det geopolitiske bildet endrer seg raskt. En åpen-vekt-modell du har lastet ned, kan du beholde, men tilgang til den nyeste versjonen er ikke garantert.
Datakontroll og GDPR
Datakontroll er ofte hovedargumentet for åpen vekt i EØS. Åpne vekter gir enterprise-team mer kontroll, tilpasningsevne og transparens, og lar deg holde persondata innenfor en grense du kan dokumentere overfor tilsynet. Men fordelen forsvinner hvis du sender dataene til feil sted.
Advarselen er konkret: DeepSeeks førsteparts-API beholder data for treningsformål. Å bruke en åpen modell gjennom et vilkårlig API kan altså gi dårligere datakontroll enn et seriøst lukket API. Poenget er at kontroll følger av hvor og hvordan du hoster, ikke av at modellen kalles åpen.
Markedsobservasjon: åpen vekt presser prisene mens frontier stabiliserer
Et av de tydeligste mønstrene i markedet nå er at prisfallet har flyttet seg fra frontier til åpen vekt. Frontier-prisene har sluttet å falle, og det er åpenheten som gjør prisreduksjonsarbeidet. For en SMB betyr det at de billigste kvalitetsforbedringene fremover trolig kommer fra åpne modeller, ikke fra de lukkede toppmodellene.
Frontier-priser har stoppet å falle
Frontier-labene har lite press på å kutte priser, fordi etterspørselen overgår tilbudet. Selve utviklingstakten har roet seg: mai 2026 var uvanlig stille ved frontier sammenlignet med den raske kadensen fra januar til april. Toppmodellene forbedrer seg fortsatt, men i mindre sprang, og prisene holder seg oppe i båndet på 2,50 til 5 dollar input og 15 til 30 dollar output.
Samtidig er inntektene i toppen enorme. De fire største leverandørene har rundt 50 milliarder dollar i samlet rapportert løpende inntekt og 1 billion dollar i samlede forpliktede compute-kjøp gjennom 2032. Med den kapitalbasen har de ingen grunn til å utløse en priskrig.
Compute er flaskehalsen, ikke evne
Rapporten fra Information Matters slår fast at compute-tilgang, ikke kapabilitet, er den bindende begrensningen ved frontier. Kohorten er todelt, ikke sammenlignbar på tvers av ni aktører, med de største på en strukturell skala andre ikke når. For SMB-er er dette godt nytt: når toppen er begrenset av maskinvare, får de åpne modellene rom til å ta igjen på pris og tilgjengelighet.
Kapitalstrømmene understreker skalaen. Anthropics runde 28. mai på 65 milliarder dollar til 965 milliarder dollar post-money passerte OpenAIs verdivurdering på 852 milliarder dollar. ChatGPT hadde 800 millioner ukentlige aktive brukere i oktober 2025. Dette er et marked der de største kjemper om compute, mens de åpne modellene konkurrerer på pris.
Vanlige feil når SMB-er vurderer å bygge egen AI-modell
Å bygge en egen AI-modell høres strategisk ut, men de fleste SMB-er som prøver, snubler i de samme fire feilene. Alle handler om å forveksle tilgang med kapasitet.
Å tro at åpen vekt betyr gratis
Den vanligste feilen er å lese Apache 2.0 som gratis drift. Lisensen er gratis, kjøringen er ikke. En modell på 975 milliarder parametere krever flere GPU-er eller distribuerte oppsett, og GPU-timer koster penger uansett hvor lite du bruker modellen. Regn på total eierkostnad, ikke lisensprisen.
Sammenlign alltid mot alternativet. Med DeepSeek V4-Flash til 0,14 og 0,28 dollar per million tokens gjennom et API, må selvhostingen din generere svært høyt volum før den lønner seg. Mange oppdager at API-et er billigere selv ved betydelig bruk.
Å undervurdere driftskompetansen
Å drifte en stor modell krever ML-ingeniører, ikke bare utviklere. Du må håndtere minne, gjennomstrømning, oppdateringer og overvåking. For små team er Inkling ikke en drop-in-erstatning for administrert API-inferens med mindre skyleverandører plukker den opp. Undervurderer du dette, ender du med en modell som står stille fordi ingen kan holde den i gang.
En nyttig test: har du folk internt som kan feilsøke en GPU-out-of-memory-feil klokken to om natten? Hvis ikke, hør på markedet og la noen andre ta driften. Kontrollen fra åpen vekt er verdiløs hvis systemet ikke kjører.
Å velge på lisens eller benchmark alene
En ren lisens og en høy benchmark-score frister, men ingen av delene garanterer verdi for din oppgave. Benchmarks som GLM-5.2 sine 62,1% på SWE-bench Pro eller DeepSeek V4 Pro sine 80,6% på SWE-bench Verified måler generelle oppgaver, ikke din spesifikke bruk. Kjør din egen test på dine egne data før du velger.
Alura mener valget bør avgjøres av totalkostnad og datakontroll sammen, ikke av lisensen isolert. En dyrere modell med bedre datahåndtering kan være det riktige valget for en helse- eller finansaktør, selv om en billigere modell scorer høyere på en offentlig benchmark.
Ofte stilte spørsmål om åpen vekt AI for norske SMB-er
De vanligste spørsmålene vi får fra norske ledere som vurderer en åpen-vekt-modell, med korte og konkrete svar.
Kan vi kjøre Inkling på våre egne servere?
Teknisk ja, praktisk sjelden. 975 milliarder parametere krever flere GPU-er eller distribuerte oppsett, og modellen ligger langt over det utvidede nivået på 256 GB VRAM som kuraterte lister setter for praktisk kjørbare modeller. For de fleste SMB-er er skyhosting eller et API riktig vei.
Når lønner en åpen modell seg fremfor et lukket API?
Når du har høyt, jevnt volum, en avgrenset oppgave som tjener på finjustering, eller strenge krav til datakontroll. Ved lavt volum og brede oppgaver vinner et lukket API på både pris og enkelhet, særlig med åpne modeller tilgjengelig via API til 0,14 og 0,28 dollar per million tokens uansett.
Er åpne modeller like gode som de lukkede?
Nesten, med et lite etterslep. Åpne modeller har holdt et gap på 3 til 6 måneder bak frontier i over 18 måneder. På koding er avstanden liten: GLM-5.2 scorer 62,1% på SWE-bench Pro, det høyeste av noen åpen modell, mens GPT-5.5 leder Terminal-Bench 2.0 med 82,7%.
Hva er forskjellen på Inkling og en tjeneste som Dropstone?
Inkling er en modell, Dropstone er et kjøremiljø rundt en modell. Dropstone er en runtime som gjør en åpen-vekt-modell til en agent, versjonert på integrasjon, ikke på modellvekter. Prismodellen illustrerer poenget: Dropstone Pro koster 15 dollar i måneden og Max 75 dollar, mot Claude Code på 20 og 100 dollar. Du betaler for pakking og drift, ikke for selve vektene.
Hvor mye kompetanse trenger vi for å finjustere?
Mindre enn før, takket være plattformer. Inkling er tilgjengelig for finjustering på Tinker, som håndterer treningsjobben for deg. Du trenger folk som kan strukturere gode treningsdata og evaluere resultatet, men ikke et helt ML-team med egne GPU-klynger. Start med en liten pilot og mål mot et lukket API.
Oppsummering og anbefaling for norske SMB-er
Inkling gjorde en modell i frontier-skala fritt tilgjengelig, med 975 milliarder totale parametere, 41 milliarder aktive og 1 million tokens kontekst under Apache 2.0. Det er en reell åpning, men frihet på papiret er ikke det samme som drift i praksis.
For de aller fleste norske SMB-er er en 975 milliarder-modell mest relevant som plattform for finjustering og videreutvikling, ikke som noe de drifter selv. Åpen vekt gir reell kontroll og fleksibilitet, men infrastrukturkravet gjør at gevinsten først materialiseres når en skyleverandør hoster modellen. Det er Aluras posisjon, og den følger direkte av tallene: selvhosting krever flere GPU-er eller distribuerte oppsett, mens de samme modellene finnes via API til 0,14 og 0,28 dollar per million tokens.
Slik bør du gå frem
Start med et lukket eller åpent API for å bevise verdien billig og raskt. Vurder finjustering på en plattform som Tinker først når du har en avgrenset oppgave, gode data og et volum som forsvarer innsatsen. Reserver selvhosting til de tilfellene der datakontroll er absolutt og du har driftskompetansen internt. Og når du velger, vei totalkostnad og datakontroll sammen, ikke lisensen alene.
Markedet flytter seg raskt: frontier-prisene har stoppet å falle mens åpenheten driver prisreduksjonen, og åpne modeller ligger bare 3 til 6 måneder bak toppen. For en norsk SMB betyr det at du har råd til å vente med de tunge investeringene og heller la markedet gjøre arbeidet, helt til en konkret oppgave gir deg en klar grunn til å bygge selv.
I Alura bygger vi AI-infrastruktur for norske virksomheter, fra dataplattformer til agentiske systemer i produksjon. Vi er ikke en SaaS-leverandør. Vi er håndverkere som setter sammen byggesteinene som faktisk fungerer for din situasjon.
Bestill en arkitektur-samtale: vi går gjennom din nåværende infrastruktur, identifiserer integrasjonspunkter, og foreslår en pragmatisk vei videre. Uforpliktende, 45 minutter.
Alura
Praktisk kunnskap om AI-automatisering og effektivisering for norske bedrifter.
Les neste
DiffusionGemma firedobler hastigheten på lokal AI
Google DiffusionGemma genererer tekst opp til fire ganger raskere enn autoregressive modeller og kjører på en RTX 5090. Her er hva norske SMB-er bør vurdere før de flytter AI lokalt.
AI-brikker uten NVIDIA-lås gir SMB-er billigere AI-drift
Den franske startupen ZML lar AI-modeller kjøre på brikker fra fem produsenter gratis. Vi ser på hva det betyr for norske SMB-ers kostnader og NVIDIA-avhengighet.
Muse Spark 1.1 koster en brøkdel av Claude og GPT
Meta lanserte Muse Spark 1.1 til 1,25 dollar per million input-tokens, en brøkdel av Claude og GPT. Vi ser på hva den billige kodemodellen betyr for norske utviklingsteam.
Open source AI kutter prisen men krever teknisk kompetanse
Tencent slapp nettopp Hy3, en 295B-modell gratis under Apache 2.0. Men lav lisenspris er ikke lav totalkostnad. Slik vurderer en norsk SMB om open source AI faktisk lønner seg.