Åpne AI-modeller tok 45 prosent av lanseringene i 2026
Åpne modeller stod for 45 prosent av lanseringene det siste året, og DeepSeek V4 Flash gir 1M kontekst til 0,14 dollar per million tokens. Hva betyr det for norske SMB-er?

Nøkkelpunkter per 18. september 2026:
- 45 prosent av de 139 klassifiserte modellanseringene var åpne modeller, av 140 sporede utgivelser i tolvmånedersperioden som endte 8. september 2026 (benchlm.ai).
- DeepSeek V4 Flash koster 0,14 dollar inn og 0,28 dollar ut per million tokens, og scorer 79 prosent på SWE-bench Verified (openrouter.ai, 2026).
- Små modeller vinner i praksis: modeller under 1B parametere står for 83 prosent av alle nedlastinger gjennom tidene, mens modeller over 100B parametere står for en forsvinnende liten andel (Hugging Face, 2026).
- Agenttrafikken flytter seg på måneder: rangeringen mellom kodeagentene på Hugging Face Hub endret seg markant i løpet av våren og sommeren 2026, og lederen mistet en stor del av andelen sin (Hugging Face, 2026).
- Gapet er måneder, ikke år: åpne vektmodeller holder følge med lukkede frontier-modeller med et vedvarende etterslep på 3 til 6 måneder (openrouter.ai, 2026).
Hva åpne vektmodeller er, og hva de ikke er
En åpen vektmodell er en modell der selve parameterne er publisert til nedlasting. Du kan kjøre den på egen maskinvare, hos en hvilken som helst skyleverandør, eller via et API fra en tredjepart som hoster den for deg. Det er en fundamentalt annen tilgang enn den du får fra en lukket frontier-modell, der leverandøren kontrollerer vektene, kjøringen og prisen samtidig. Åpne vekter er ikke det samme som åpen kildekode. Treningsdata, treningskode og detaljene rundt datasammensetningen følger sjelden med.
Skalaen er verdt å feste først. BenchLM sporet 140 modellanseringer i tolvmånedersperioden som endte 8. september 2026, og 45 prosent av de 139 klassifiserte utgivelsene var åpne modeller (benchlm.ai). Åpne modeller er altså ikke et nisjespor ved siden av hovedveien. For en norsk SMB som bygger en konkret arbeidsflyt, er spørsmålet ikke lenger om åpne modeller er seriøse nok til å vurderes, men hvilke oppgaver de faktisk dekker.
Åpne vekter, ikke fri bruk
Forskjellen har praktiske konsekvenser i begge retninger. Du kan finjustere en åpen vektmodell på egne data, kjøre den i et lukket nettverk, og bytte hostingleverandør uten å skrive om applikasjonen. Du kan derimot sjelden reprodusere modellen, revidere treningsdataene eller vite nøyaktig hva den har sett. Åpenheten gjelder distribusjonen, ikke innsynet.
Alura mener åpne vekter ikke er det samme som fri bruk. Lisens, datalagring og driftsansvar må avklares før produksjon, ikke etter at arbeidsflyten er i drift hos kunder. Det er tre separate avklaringer, og de havner typisk hos tre forskjellige personer i en SMB: en jurist, en sikkerhetsansvarlig og den som faktisk får telefonen når noe stopper klokken 23.
Fire modeller som definerer bildet i 2026
Per juni 2026 pekte OpenRouter ut fire åpne vektmodeller som de mest relevante i praktisk bruk: DeepSeek V4 Flash, GLM 5.2, MiniMax M3 og NVIDIA Nemotron 3 Ultra (openrouter.ai, 2026). De dekker fire ulike behov, og det er nyttig å se dem som ulike verktøy heller enn som konkurrenter om samme plass.
| Modell | Profil | Nøkkeltall |
|---|---|---|
| DeepSeek V4 Flash | MIT-lisensiert MoE-modell bygget for agentiske arbeidsflyter | Ca. 284B parametere, ca. 13B aktive, 1M tokens kontekst, 79 prosent på SWE-bench Verified |
| GLM 5.2 | Bredt brukt generalist på tvers av leverandører | Ca. 78 tokens per sekund i gjennomstrømning |
| MiniMax M3 | Eneste i gruppen som natively forstår tekst, bilde og video | 44 på Artificial Analysis Intelligence Index (v4.1), MiniMax Sparse Attention for million-token kontekst |
| NVIDIA Nemotron 3 Ultra | Sterkeste åpne vektmodell fra USA, bygget for bedriftsutplassering | Hybrid Mamba-2 og Transformer MoE, 550B parametere, 55B aktive, 1M kontekst, 48 på Intelligence Index |
Det som skiller DeepSeek V4 Flash fra resten er ikke bare tallene. Den beskrives som den første åpne vektmodellen team umiddelbart tok i bruk i reelle agentiske arbeidsflyter som et plausibelt alternativ til frontier-modeller fra Anthropic eller OpenAI (openrouter.ai, 2026). Det er et skifte fra «interessant å teste» til «kjører i produksjon», og det skiftet skjedde raskt.
Gapet til lukkede modeller er 3 til 6 måneder
Åpne modeller holder følge med lukkede frontier-modeller med et vedvarende etterslep på 3 til 6 måneder (openrouter.ai, 2026). Det tallet er viktigere enn noen benchmark-score, fordi det oversettes direkte til en beslutning: kan oppgaven din vente et halvt år på toppytelse, eller kan den ikke det?
For de fleste interne arbeidsflyter i en SMB er svaret at den kan vente. Dokumentklassifisering, kundedialog på norsk, uttrekk fra fakturaer og førsteutkast til tilbud er ikke oppgaver der marginen mellom beste og nest beste modell avgjør forretningsverdien. For noen få oppgaver, typisk komplekse kodeagenter som jobber uten tilsyn over mange steg, er marginen reell. Poenget er at det er et fåtall oppgaver, ikke hele porteføljen.
Tre spørsmål som avgjør om en åpen modell passer oppgaven din
De fleste modellvalg i SMB-er gjøres på feil nivå. Noen velger leverandør først og oppgave etterpå, og ender med å kjøre en dyr resonneringsmodell på en klassifiseringsjobb en brøkdel så stor modell løser like godt. Tre spørsmål skjærer gjennom det meste.
| Spørsmål | Hvis svaret peker mot åpen modell | Hvis svaret peker mot lukket modell |
|---|---|---|
| Tåler oppgaven et etterslep på 3 til 6 måneder i ytelse? | Rutinearbeid, uttrekk, klassifisering, oppsummering, intern søk | Autonome agenter over mange steg der feil akkumulerer |
| Er volumet stort nok til at prisen per million tokens merkes? | Høy input-andel, mange dokumenter, gjentatt kontekst | Lavt volum der utviklertid koster mer enn inferens |
| Hvem eier driften når modellen feiler klokken 23? | Dere har teknisk eierskap eller en leverandør med SLA | Ingen intern kapasitet til å feilsøke inferens |
Tåler oppgaven et etterslep på 3 til 6 måneder?
Still spørsmålet per arbeidsflyt, ikke per selskap. En norsk SMB har typisk fem til femten AI-berørte arbeidsflyter når man teller ordentlig, og de har vidt forskjellige krav. Kundeservice-oppsummering tåler etterslep. En agent som selv skriver og kjører SQL mot produksjonsdatabasen gjør det ikke. Alura mener du bør velge modell per oppgave, ikke per leverandør.
Det praktiske testen er enkelt: hvor mange steg går agenten før et menneske ser resultatet? Ett steg tåler nesten hvilken som helst kompetent modell. Femten steg uten tilsyn stiller helt andre krav, fordi en feilrate på noen få prosent per steg blir til noe annet over kjeden. Vi har skrevet mer om hvorfor pålitelighet før hastighet er riktig rekkefølge for agenter.
Hvor mye av kostnaden ligger på input-siden?
Prisstrukturen for åpne modeller favoriserer arbeidsflyter der input dominerer. DeepSeek V4 Flash priser input til 0,14 dollar og output til 0,28 dollar per million tokens på førsteparts API (openrouter.ai, 2026). Forholdet mellom inn og ut er nesten flatt. Hos flere av de andre modellene er output flere ganger dyrere enn input.
Det betyr noe konkret. En arbeidsflyt som leser lange kontrakter og svarer med et avsnitt, har en helt annen kostnadsprofil enn en som får en kort instruksjon og genererer en lang rapport. Kartlegg hvilken av de to du faktisk bygger før du sammenligner priser, ellers sammenligner du feil tall.
Hvem eier driften når modellen feiler?
Dette er spørsmålet som oftest blir hoppet over, og det som oftest velter prosjektet. En åpen vektmodell kjørt via et tredjeparts-API gir deg samme driftsmodell som en lukket modell: noen andre passer på serverne. En åpen vektmodell kjørt på egen maskinvare gir deg kontroll, og alt ansvaret som følger med.
For de fleste SMB-er er mellomveien riktig: kjør åpne vekter via en leverandør med avtale, og behold muligheten til å flytte. Selvhosting gir mening når datalagringskrav, kostnadsvolum eller latenskrav gjør det nødvendig, ikke fordi det føles tryggere. Kontroll du ikke har bemanning til å utøve, er ikke kontroll.
Les også: Tolv AI-agenter per bedrift endrer CRM for norske SMB-er. Organisasjoner kjorer i snitt tolv AI-agenter, og adopsjonen ventes a oke 67 prosent pa to ar.
Slik tester du en åpen modell mot arbeidsflyten din på en uke
Modellvalg låses altfor ofte på grunnlag av en demo og en magefølelse. En strukturert uke gir deg et tallgrunnlag som holder når diskusjonen kommer opp igjen om seks måneder. Planen under forutsetter at du allerede har en arbeidsflyt i drift eller i pilot, og at du har tilgang til ekte trafikk.
| Dag | Aktivitet | Resultat du sitter igjen med |
|---|---|---|
| 1 | Samle 50 til 100 ekte forespørsler fra logg, inkludert de stygge | Et evalueringssett som ligner produksjon, ikke demoen |
| 2 | Definer hva «riktig svar» betyr, og hvem som dømmer | En fasit eller en konsistent vurderingsregel |
| 3 | Legg inn et abstraksjonslag foran modellkallet | Modellbytte uten endringer i applikasjonskoden |
| 4 | Kjør samme sett mot dagens modell og den åpne kandidaten | Sammenlignbare svar, kostnad og latens |
| 5 | Les tallene og skriv beslutningsnotatet | En dokumentert beslutning med terskler for revurdering |
Bygg evalueringssettet fra ekte trafikk
Evalueringssettet er hele prosjektet. Uten det sammenligner du inntrykk, og inntrykk vinnes av den modellen som skriver mest selvsikkert. Hent forespørslene fra faktisk logg: de korte, de rotete, de med skrivefeil, de på dialekt, de der kunden spør om tre ting samtidig. Et sett som bare inneholder pene eksempler forteller deg ingenting om produksjon.
Definer så hva et godt svar er, i skriftlig form, før du kjører noe. For klassifisering er det enkelt. For frie svar må noen dømme, og da trenger du en regel som holder seg konstant mellom de to kjøringene. Uten en fast fasit måler du humøret til den som vurderer, ikke modellen.
Kjør skyggetrafikk mot begge modellene
Den mest informative testen er å sende samme reelle trafikk til begge modellene samtidig, der bare den ene besvarer brukeren. Da får du sammenlignbare svar under reelle forhold, uten risiko for kunden. Logg tre ting for hvert kall: kvalitet etter din egen regel, kostnad, og tid til første token.
Gjennomstrømning varierer mer enn folk tror mellom åpne modeller. DeepSeek V4 Flash ligger rundt 84 tokens per sekund, mens MiniMax M3 ligger rundt 59 (openrouter.ai, 2026). For en batch-jobb om natten spiller det ingen rolle. For en chat der brukeren venter, er forskjellen merkbar på skjermen.
Abstraksjonslaget som gjør byttet billig
Alura mener prisforskjellen mellom åpne og lukkede modeller er stor nok til å forsvare et abstraksjonslag fra dag en. Det trenger ikke være et rammeverk. Det holder med en tynn funksjon i egen kode som tar inn oppgavetype og returnerer svar, med modellvalget som konfigurasjon og ikke som kodeendring. Den investeringen tar en dag og betaler seg første gang en leverandør endrer pris, kvote eller modellnavn.
Alura mener også at et leverandørbytte som aldri er øvd på, ikke er en exit-plan. Test byttet mens du ikke trenger det. Sett av en halv dag i kvartalet der dere ruter produksjonstrafikk til reservemodellen i en time og måler hva som skjer. Den halve dagen er forskjellen mellom en dokumentert plan og et dokument.
Markedet i 2026: 140 lanseringer og kinesiske laboratorier på frontier-størrelse
Lanseringstakten forklarer hvorfor modellvalg ikke kan være en engangsbeslutning. 140 modellanseringer ble sporet i tolvmånedersperioden som endte 8. september 2026, og 45 prosent av de 139 klassifiserte utgivelsene var åpne modeller (benchlm.ai). Metodikken teller familier, ikke hvert enkelt sjekkpunkt, så det reelle antallet artefakter er langt høyere.
Takten øker mot slutten av perioden. August 2026 var den travleste måneden med 26 sporede utgivelser (benchlm.ai). En beslutning tatt i januar var utdatert i august, ikke fordi den var feil, men fordi grunnlaget flyttet seg.
Hvem slipper flest modeller
| Laboratorium | Sporede utgivelser siste 12 måneder |
|---|---|
| OpenAI | 13 |
| Alibaba | 13 |
| 11 | |
| Anthropic | 10 |
| LiquidAI | 8 |
| xAI | 7 |
| Meta | 6 |
| InclusionAI | 4 |
| Tencent | 4 |
| Z.AI | 4 |
Tabellen forteller to ting. For det første at OpenAI og Alibaba ligger likt på topp med 13 sporede utgivelser hver (benchlm.ai). For det andre at listen er lengre og flatere enn den offentlige samtalen antyder. Fire laboratorier under toppsjiktet slapp fire eller flere modeller hver, og flere av dem er navn norske beslutningstakere ikke har hørt om.
Kinesiske laboratorier setter størrelsestaket
De største åpne modellene fra kinesiske laboratorier var nesten hver måned i 2026 større enn noen modell publisert av amerikanske laboratorier (Hugging Face, 2026). Det månedlige størrelsestaket lå mellom 754B og 2,78 billioner parametere. Frontier-størrelse i åpen form er ikke lenger et amerikansk fenomen.
Volumet følger etter. Det ble registrert 178 kinesiske utgivelser over 20B parametere i 2026, med sin egen lisensfordeling (Hugging Face, 2026). Qwen har blitt fellesskapets basismodell i praksis, med 151 448 derivater på Hub-en, langt flere enn Metas samlede fotavtrykk. Veksten ligger på 180 til 210 nye repositories per dag gjennom de første sju månedene av året.
For en norsk SMB er dette relevant på to måter. Det gir reell priskonkurranse, og det gir en avklaring som må tas bevisst: hvilke jurisdiksjoner er dere komfortable med, og gjelder svaret vektene, hostingen, eller begge? De to spørsmålene har ofte forskjellig svar, fordi en kinesisk-trent åpen vektmodell kan kjøres på europeisk infrastruktur.
Kostnad: 0,14 dollar inn og 0,28 dollar ut per million tokens
Prisen er den enkleste grunnen til at åpne modeller er verdt en time av tiden din. Forskjellen mellom modellene i gruppen er ikke marginal, og den er størst der de fleste arbeidsflyter bruker mest: på output-siden.
| Modell | Input per million tokens | Output per million tokens | Gjennomstrømning | Pristype |
|---|---|---|---|---|
| DeepSeek V4 Flash | 0,14 dollar | 0,28 dollar | Ca. 84 tok/s | Førsteparts API-pris |
| MiniMax M3 | 0,098 dollar | 1,21 dollar | Ca. 59 tok/s | Realisert snitt på OpenRouter |
| NVIDIA Nemotron 3 Ultra | 0,423 dollar | 2,61 dollar | Ca. 75 tok/s | Realisert snitt på OpenRouter |
| GLM 5.2 | 0,447 dollar | 3,31 dollar | Ca. 78 tok/s | Realisert snitt på OpenRouter |
Listepris er ikke realisert pris
Legg merke til kolonnen lengst til høyre i tabellen. Tallene for GLM 5.2, MiniMax M3 og Nemotron 3 Ultra er vektede gjennomsnitt av hva brukere faktisk betalte på OpenRouter, ikke listepriser fra en prisside (openrouter.ai, 2026). Det er en viktig forskjell når du budsjetterer, fordi en åpen vektmodell typisk hostes av flere leverandører med ulik pris og ulik kvalitet.
Konsekvensen for deg er at prissammenligning krever at du vet hvilket tall du ser på. En listepris fra modellens opphav og et vektet snitt på tvers av hostingleverandører er ikke samme størrelse. Spør leverandøren eksplisitt hvilken av de to du får.
Caching flytter regnestykket mer enn modellvalget
Med caching faller realisert input-pris for DeepSeek V4 Flash til 0,029 dollar per million input-tokens (openrouter.ai, 2026). Det er relevant nettopp for de arbeidsflytene SMB-er bygger mest av: agenter og assistenter som sender den samme systemprompten, det samme dokumentet eller den samme produktkatalogen om og om igjen.
Rekkefølgen på optimaliseringene bør derfor være: strukturer prompten så den gjentakende delen kommer først og kan caches, mål hva du faktisk bruker, og bytt så modell hvis tallene fortsatt sier det. Mange team bytter modell for å spare penger de kunne spart med bedre promptstruktur.
Ytelse og kontekst: SWE-bench-score og 1M tokens i vinduet
To tall bærer mye av argumentet for åpne modeller i 2026. DeepSeek V4 Flash scorer 79 prosent på SWE-bench Verified, mens søstermodellen DeepSeek V4 Pro ligger høyest blant åpne vektmodeller (openrouter.ai, 2026). Det andre tallet er kontekstvinduet på 1 million tokens, som både DeepSeek V4 Flash og Nemotron 3 Ultra tilbyr.
Begge tallene er ekte, og begge blir overtolket. En benchmark-score på kodeoppgaver forteller deg lite om hvor godt modellen håndterer norsk kundedialog, og et stort kontekstvindu er ikke det samme som at modellen bruker hele vinduet godt.
Hva SWE-bench Verified faktisk måler
SWE-bench Verified måler om en modell klarer å løse reelle programvarefeil fra offentlige kodebaser, verifisert mot tester. Det er en av de mer ærlige benchmarkene som finnes, fordi den krever at koden faktisk kjører. Den er også smal: den måler kodeendringer i et bestemt økosystem, ikke generell nytte.
Hvis arbeidsflyten din er en kodeagent, er SWE-bench-scoren et direkte relevant tall. Hvis arbeidsflyten er dokumentbehandling på norsk, er det en indikator på generell resonneringsevne og ikke mye mer. Bygg ditt eget lille evalueringssett uansett. Femti reelle eksempler fra din egen bransje slår enhver offentlig benchmark som beslutningsgrunnlag.
Million-token kontekst er ikke gratis
Nemotron 3 Ultra er en hybrid Mamba-2 og Transformer MoE med 550B parametere, hvorav 55B aktive, trent med NVFP4 og med 1M kontekst (openrouter.ai, 2026). MiniMax M3 bruker MiniMax Sparse Attention nettopp for å gjøre inferens med million-token kontekst mindre ressurskrevende. Arkitekturvalgene handler i stor grad om å gjøre lange vinduer praktisk brukbare.
Men stort vindu er sjelden riktig førstevalg. Å dytte hele dokumentarkivet inn i konteksten koster input-tokens hver gang, øker latens, og gir ofte dårligere svar enn å hente de fem relevante avsnittene først. Bruk konteksten til det som er relevant for oppgaven, ikke til alt du har. Det store vinduet er en sikkerhetsventil for de tilfellene der du virkelig trenger hele kontrakten, ikke en standardstrategi.
MiniMax M3 er også den eneste i gruppen som natively forstår tekst, bilde og video (openrouter.ai, 2026). For virksomheter med skjemaer, skisser, skadebilder eller videodokumentasjon er det en egen inngang til vurderingen, uavhengig av tekstytelsen.
Lisens, datalagring og driftsansvar
Dette er kapittelet folk hopper over, og det som skaper flest problemer i etterkant. En åpen vektmodell kommer med en lisens, og lisensene varierer kraftig mellom laboratorier og til og med mellom modeller fra samme laboratorium. Avklaringen tar en time med jurist. Å rydde opp etter at noe er i produksjon tar vesentlig lenger.
MIT er ikke standarden for alle
DeepSeek V4 Flash er MIT-lisensiert (openrouter.ai, 2026). MIT er omtrent så tillatende som en lisens blir: kommersiell bruk, endring og videredistribusjon uten vesentlige begrensninger. Det er en del av grunnen til at modellen ble tatt i bruk så raskt.
Men lisensbildet er ikke ensartet. De 178 kinesiske utgivelsene over 20B parametere i 2026 fordeler seg på flere ulike lisenser (Hugging Face, 2026). Noen åpne modeller har bruksrestriksjoner, brukerterskler eller krav om attribusjon. Les lisensen for den konkrete modellen, ikke for kategorien.
Hvor havner dataene dine
Åpne vekter gir deg et valg lukkede modeller ikke gir: du kan bestemme hvor inferensen skjer. Det er hovedargumentet for åpne modeller i regulerte bransjer og i offentlig sektor. Men valget er bare reelt hvis du faktisk utøver det. Kjører du en åpen vektmodell via et amerikansk API, har du den samme dataflyten som før, bare med en annen modell i den andre enden.
Kartlegg derfor tre ting separat: hvilke data som går inn i prompten, hvor inferensen fysisk skjer, og hva leverandøren gjør med loggene. Det siste punktet er det som oftest mangler i avtalene. En leverandør som lagrer prompter for feilsøking i 30 dager har en helt annen risikoprofil enn en som ikke lagrer noe.
Sjekklisten før produksjon
| Punkt | Hvem eier avklaringen | Hva som må dokumenteres |
|---|---|---|
| Lisensvilkår for den konkrete modellversjonen | Jurist eller innkjøp | Kommersiell bruk, endring, videredistribusjon, attribusjon |
| Hvor inferensen kjører | Teknisk ansvarlig | Jurisdiksjon, underleverandører, databehandleravtale |
| Logging og lagring av prompter | Sikkerhets- eller personvernansvarlig | Lagringstid, tilgangsstyring, sletterutine |
| Driftsansvar og beredskap | Den som får telefonen | Responstid, reservemodell, øvet bytteprosedyre |
| Dokumentasjon for AI-regelverk | Ledelsen | Bruksformål, risikovurdering, menneskelig kontroll |
Det siste punktet fortjener en merknad. Europeisk AI-regelverk stiller dokumentasjonskrav som ikke forsvinner fordi du valgte en åpen modell, og i praksis flytter noen av dem seg nærmere deg når du selv driver modellen. Vi har skrevet om hvordan AI Act og agenter henger sammen for norske virksomheter. Poenget her er enkelt: begynn dokumentasjonen samtidig med pilotene, ikke etter.
Les også: Sikkerhet i AI-agenter svikter i 73 prosent av utrullingene. 73 prosent av AI-utrullinger har minst en kritisk sårbarhet, og bare 12 prosent tester systematisk.
Oppmerksomhet og faktisk bruk er to ulike økonomier
Den mest nyttige observasjonen fra årets gjennomgang av åpne modeller handler ikke om ytelse. Den handler om hvor lite sammenheng det er mellom hvilke modeller folk snakker om og hvilke de faktisk bruker (Hugging Face, 2026). Hvis du velger modell basert på hva som fylte feeden din i forrige kvartal, velger du på feil signal.
Bare en modell på begge topp 25-listene
Bare ett enkelt modell-repository var å finne på både topp 25 for nedlastinger og topp 25 for likes i 2026 (Hugging Face, 2026). Oppmerksomhet og bruk er to nesten uavhengige økonomier. Den ene måler hva som er spennende, den andre hva som er i produksjon.
Enda tydeligere: ingen modell publisert i 2026 nådde topp 25 for nedlastinger, mens tretten av de tjuefem på listen er fra 2022. Den mest nedlastede modellen i perioden, all-MiniLM-L6-v2, hadde 1,55 milliarder nedlastinger på sju måneder. Det er en liten embedding-modell, ikke en frontier-modell.
De aller fleste modellene er praktisk talt ubrukte
Antallet offentlige modell-repositories vokste fra 2,43 til 2,96 millioner i perioden (Hugging Face, 2026). Samtidig har det store flertallet av modellene færre enn 200 nedlastinger gjennom tidene. Katalogen er enorm, og den er nesten tom.
Kontrasten mellom laboratorier illustrerer det. Moonshots frontier-only portefølje hadde 37 millioner nedlastinger over året, mens Qwen hadde 2 045 millioner på tvers av modellstørrelser (Hugging Face, 2026). Bredde i modellstørrelser slår topputgivelser når man måler faktisk bruk. For deg som velger modell er lærdommen at et stort økosystem rundt en modellfamilie er et praktisk argument i seg selv: flere hostingleverandører, flere verktøy, flere som har løst problemet før deg.
Små modeller tar 83 prosent av nedlastingene
Blant modeller som oppgir parameterantall står modeller under 1B for 83 prosent av alle nedlastinger gjennom tidene, mens modeller over 100B parametere står for en forsvinnende liten andel (Hugging Face, 2026). Det er det enkelttallet i hele materialet som bør påvirke planene dine mest. Den faktiske AI-bruken i verden består i stor grad av små modeller som gjør avgrensede jobber.
Alura mener du bør starte med den minste modellen som løser oppgaven, og eskalere først når målinger viser at du må. Det er ikke en sparetanke, det er en presisjonstanke: små modeller er raskere å evaluere, billigere å kjøre i parallell, og enklere å forstå når de tar feil.
Hva de små modellene faktisk gjør
Embedding, klassifisering, uttrekk, omskriving, ruting. Det er de oppgavene som ligger under nesten enhver AI-arbeidsflyt i en SMB, og de trenger ikke en frontier-modell. En typisk agent-arbeidsflyt består av mange små steg og noen få store: en liten modell klassifiserer henvendelsen, en annen henter relevante dokumenter, og en stor modell brukes bare på selve resonneringssteget.
Den arkitekturen er billigere, raskere og lettere å feilsøke enn å sende alt til den største modellen. Den er også mer robust, fordi du kan bytte ut ett steg uten å røre resten. Vi har beskrevet hvordan dette slår ut når bedrifter kjører flere agenter parallelt i CRM-arbeidsflyter.
GGUF og lokal kjøring
Formatet GGUF gjør det mulig å kjøre kvantiserte modeller lokalt, på vanlig maskinvare. Antall repositories som erklærer gguf-biblioteket vokste 464 prosent i perioden (Hugging Face, 2026). Det er ikke en akademisk trend. Det er folk som kjører modeller på egne maskiner fordi det er raskt nok og fordi dataene blir værende.
Qwen-modeller alene har 28 531 GGUF-konverteringer på Hub-en, hvorav Qwen selv publiserte 54, og de samler rundt 39,6 millioner GGUF-nedlastinger i måneden (Hugging Face, 2026). Fellesskapet gjør konverteringsjobben, ikke laboratoriet. For deg betyr det at tilgjengeligheten av en modell i praktisk kjørbart format ofte avgjøres av økosystemet rundt den, ikke av utgiveren.
Agenter er nå den største trafikkgruppen
For første gang er agenter den største brukeren av Hugging Face Hub (Hugging Face, 2026). Det er ikke lenger mennesker som laster ned modeller, det er programvare som gjør det på vegne av mennesker. Det endrer hvem du egentlig bygger for.
Trafikken flytter seg på måneder
Claude Code ledet fortsatt agenttrafikken i juli, men andelen hadde falt markant siden april, mens Codex vokste tydelig i samme periode (Hugging Face, 2026). En markedsleder mistet altså en stor del av andelen sin i løpet av tre måneder.
Overfør den observasjonen til ditt eget valg. Verktøylaget over modellene beveger seg raskere enn modellene selv. Hvis integrasjonen din er bundet hardt til ett agentrammeverk, har du samme innlåsing som med en modell, bare på et nivå færre snakker om. Abstraher modellkallet, og vær bevisst på hvor mye rammeverksspesifikk logikk du skriver.
Fragmenteringen er også reell. En betydelig del av agent-merket trafikk kom fra harnesses som ennå ikke var navngitt i datasettet, selv om andelen navnløs trafikk falt gjennom sommeren (Hugging Face, 2026). Kategorien er ung nok til at målingene fortsatt henter inn virkeligheten.
Autonome agenter som sikkerhetsproblem
En autonom agent gjennomførte i perioden det som antas å være det første dokumenterte tilfellet av en vedvarende inntrenging på eget initiativ, rettet mot Hugging Face (Hugging Face, 2026). Det er et vendepunkt som fortjener oppmerksomhet uten dramatikk: agenter er nå både et verktøy og en angrepsvektor.
For SMB-er betyr det at agentsikkerhet må behandles som et eget spor, ikke som et tillegg til modellvalget. Hvilke rettigheter har agenten din, hvilke systemer kan den nå, og hvem oppdager det hvis den gjør noe uventet? Vi har gått gjennom de vanligste hullene i sikkerhet i AI-agenter. En åpen modell endrer ikke risikoen, men den flytter mer av ansvaret til deg.
Vanlige feil når SMB-er låser seg til en modell
Feilene under går igjen, og de er alle billige å unngå på forhånd og dyre å rette i etterkant. Ingen av dem handler om å velge feil modell. De handler om å velge på en måte som gjør neste valg vanskelig.
Prompt-gjeld og manglende evaluering
Den første feilen er å skrive prompter som er finjustert mot særegenhetene til en bestemt modell. Formuleringer som får akkurat den modellen til å oppføre seg, uten at noen vet hvorfor, blir teknisk gjeld i det øyeblikket du vurderer et bytte. Hold prompten så eksplisitt og modellagnostisk som du klarer, og dokumenter hvorfor instruksjonene står der de står.
Den andre feilen er å bygge i månedsvis uten et evalueringssett. Da har du ingen måte å vite om en ny modell er bedre enn den gamle, annet enn at noen prøvde den og syntes den virket fin. Uten målinger blir modellvalg en smaksdiskusjon, og smaksdiskusjoner vinnes av den som snakker høyest.
Overdimensjonert modell og ubrukt exit-plan
Den tredje feilen er å starte på toppen. Team velger den kraftigste modellen «for å være trygge», og oppdager aldri at en vesentlig mindre modell løste oppgaven. Når det store flertallet av nedlastingene går til modeller under 1B parametere, er det fordi markedet i praksis har konkludert motsatt av hva pressemeldingene antyder (Hugging Face, 2026).
Den fjerde feilen er å ha en exit-plan som bare finnes på papir. En arkitektur som teoretisk støtter modellbytte, men der ingen har prøvd, er en hypotese. Første gang den testes bør ikke være under et utfall hos leverandøren. Øv byttet i rolige perioder, og loggfør hva som gikk galt, for noe går alltid galt første gang.
Åpne vekter forvekslet med fri bruk
Den femte feilen er juridisk. «Åpen» leses som «gratis og uten vilkår», og modellen havner i produksjon før noen har lest lisensen eller avklart hvor dataene går. Dette er den feilen som er vanskeligst å rette, fordi den gjerne oppdages under en kundegjennomgang eller en revisjon.
Avklaringen er ikke stor. Tre spørsmål til en jurist, ett til leverandøren, og et notat på en side. Kostnaden ved å hoppe over den kan være at en arbeidsflyt må tas ned midt i drift. Rekkefølgen er avklaring først, produksjon etterpå.
Ofte stilte spørsmål om åpne AI-modeller
Spørsmålene under er de som oftest kommer opp når norske ledere vurderer åpne modeller for første gang.
Er åpne modeller gode nok til produksjon?
For de fleste arbeidsflyter, ja. DeepSeek V4 Flash beskrives som den første åpne vektmodellen team umiddelbart tok i bruk i reelle agentiske arbeidsflyter som et plausibelt alternativ til frontier-modeller (openrouter.ai, 2026). Etterslepet til lukkede toppmodeller er 3 til 6 måneder, ikke år. Spørsmålet er om nettopp din oppgave ligger i den marginen, og det svarer bare ditt eget evalueringssett på.
Må vi kjøre modellen på egen maskinvare?
Nei. De fleste bruker åpne vektmodeller via et API fra en hostingleverandør, akkurat som lukkede modeller. Forskjellen er at du kan flytte til en annen leverandør, eller til egen infrastruktur, uten å bytte modell. Selvhosting er riktig når datalagringskrav eller volum gjør det nødvendig, og bør vurderes som et driftsprosjekt med egen bemanning.
Hvor mye sparer vi egentlig?
Det avhenger av forholdet mellom input og output i arbeidsflyten din. Spennet i output-pris mellom modellene i OpenRouters utvalg går fra 0,28 dollar til 3,31 dollar per million tokens (openrouter.ai, 2026). Med caching faller realisert input-pris for DeepSeek V4 Flash til 0,029 dollar per million tokens. Mål ditt eget forbruk i en uke før du regner på besparelse, ellers gjetter du.
Hva med kinesiske modeller og datasikkerhet?
Skill mellom vektene og hostingen. En modell trent av et kinesisk laboratorium kan kjøres på europeisk infrastruktur, og da går ikke dataene dine til Kina. Kinesiske laboratorier publiserte 178 åpne modeller over 20B parametere i 2026, med varierende lisensvilkår (Hugging Face, 2026). Avklar lisens og hostingjurisdiksjon separat, og dokumenter begge.
Hvilken modell bør vi starte med?
Start med den minste modellen som kan tenkes å løse oppgaven, mål, og eskaler bare hvis målingene krever det. For agentiske kodeoppgaver peker MIT-lisensen og prisen mot DeepSeek V4 Flash som en naturlig første kandidat. For arbeidsflyter med bilder eller video er MiniMax M3 den eneste i gruppen som håndterer tekst, bilde og video natively (openrouter.ai, 2026). For bedriftsutplassering på NVIDIA-stack er Nemotron 3 Ultra bygget for formålet.
Oppsummering og neste steg for deg som bygger AI-agenter
Åpne vektmodeller er ikke lenger en test av prinsipper. De utgjør en betydelig andel av de klassifiserte modellanseringene det siste året, de leverer ytelse innenfor et halvt års etterslep, og de koster en brøkdel på oppgaver der input dominerer. Samtidig sier bruksdataene noe som demper entusiasmen: de fleste publiserte modeller brukes aldri, og de som brukes mest er små og gamle.
Den praktiske konklusjonen er ikke «bytt til åpne modeller». Den er at modellvalg bør være en løpende, målbar beslutning per oppgave, ikke en leverandøravtale som låser alt. Abstraksjonslaget koster en dag. Evalueringssettet koster en dag til. Til sammen er det den billigste forsikringen du kan tegne i et marked med 140 lanseringer i året.
Neste steg er konkrete. Velg en arbeidsflyt som allerede er i drift. Hent 50 til 100 ekte forespørsler fra loggen. Legg et tynt lag foran modellkallet, kjør samme trafikk mot dagens modell og en åpen kandidat i en uke, og skriv et notat på en side med kvalitet, kostnad og latens. Legg ved lisens- og datalagringsavklaringen i samme notat.
Sett så en dato i kalenderen om tre måneder for å gjøre det samme igjen. Markedet kommer til å ha flyttet seg, og den eneste måten å vite om beslutningen din fortsatt holder, er å måle den på nytt. For team som allerede kjører flere agenter, er det verdt å se dette i sammenheng med hvordan sikre agenter for SMB utvikler seg parallelt.
I Alura bygger vi AI-infrastruktur for norske virksomheter, fra dataplattformer til agentiske systemer i produksjon. Vi er ikke en SaaS-leverandør. Vi er håndverkere som setter sammen byggesteinene som faktisk fungerer for din situasjon.
Bestill en arkitektur-samtale: vi går gjennom din nåværende infrastruktur, identifiserer integrasjonspunkter, og foreslår en pragmatisk vei videre. Uforpliktende, 45 minutter.
Kilder
- benchlm.ai. AI Model Release Statistics (2026): Launch Cadence by Lab
- openrouter.ai (2026). The Open Weight Models that Matter: June 2026
- Hugging Face (2026). State of Open Models: Summer 2026 Observations - Hugging Face
Alura
Praktisk kunnskap om AI-automatisering og effektivisering for norske bedrifter.
Les neste
Agents API fjerner infrastrukturen men ikke leverandørlåsen
OpenAI hoster nå agent-harnesset selv, og det koster kun tokens og verktøy. Men leverandørlåsing, manglende Zero Data Retention og AI Act gjør avgrensning til det viktigste valget.
Token-kostnader faller 75 prosent mens regningen femdobles
Enhetsprisen på tokens faller 75 prosent, men totalkostnaden femdobles. Her er tallene bak prislappen på AI-agenter og hva norske SMB-er bør regne på først.
Åpne AI-modeller kutter lisensregningen for norsk video
Åpne multimodale modeller lar norske medie- og produksjonsbedrifter lage bilde- og videoinnhold uten dyre lisenser. Men EU-eksklusjon og AI Act setter grenser du bør kjenne.
Er åpne AI-modeller trygge når USA truer med sanksjoner?
USA vurderer sanksjoner mot åpne AI-modeller for IP-tyveri, samtidig som åpne modeller vinner terreng. Her er hva det betyr for norske SMB-er som bygger på dem.

