Åpne AI-modeller kutter lisensregningen for norsk video
Åpne multimodale modeller lar norske medie- og produksjonsbedrifter lage bilde- og videoinnhold uten dyre lisenser. Men EU-eksklusjon og AI Act setter grenser du bør kjenne.

Hva åpne multimodale modeller er
En multimodal AI-modell kombinerer data fra flere kilder som tekst, bilder, lyd og video for å bygge en dypere forståelse av informasjon, i motsetning til en modell som bare leser tekst. Det er dette som gjør teknologien interessant for medie- og produksjonsbransjen: en modell som forstår både et manus og en videosekvens kan gjøre arbeid som tidligere krevde flere separate verktøy. I løpet av 2026 har feltet utviklet seg fra eksperimentell teknologi til produksjonsklar infrastruktur, der visjon-språk-modeller tolker bilder, videoer, dokumenter og UI-grensesnitt med nesten menneskelig nøyaktighet.
For en norsk produksjonsleder er det viktige skillet ikke bare hva modellene kan, men hvordan du får tilgang til dem. Noen leveres som lukkede API-er du betaler per bruk. Andre leveres som åpne vekter du kan laste ned og kjøre selv. Denne artikkelen handler om den andre kategorien, og om hvorfor den ofte er den billigste veien inn for et team som skal produsere mye bilde- og videoinnhold. Vi har skrevet mer utfyllende om grunnprinsippene i vår gjennomgang av multimodal AI som forstår tekst, bilde, lyd og video samtidig.
Fra unimodal til multimodal
Tradisjonelle modeller var unimodale: de behandler kun en datatype om gangen. En multimodal modell har typisk en arkitektur med encoder, fusjonsmekanisme og dekoder, der de ulike datatypene oversettes til et felles representasjonsrom modellen kan resonnere over. Det er den fusjonen som lar en modell koble en setning i et manus til en konkret ramme i en video.
Utviklingen har gått raskt. I 2021 lanserte OpenAI CLIP-modellen og DALL-E, som var viktige gjennombrudd. I 2023 fikk GPT-4V synsevne, og Google lanserte Gemini med multimodal prosessering innebygd i kjernearkitekturen. I 2024 kom GPT-4o, som behandler tekst, bilder og lyd i sanntid med lav latens. Poenget for en innkjøper i dag er at multimodalitet ikke lenger er en nyhet, men en standard forventning til enhver seriøs modell.
Hva åpen faktisk betyr
Ordet åpen dekker to ulike ting. Åpen kildekode i streng forstand betyr at både vekter, treningskode og ofte data er tilgjengelig under en fri lisens. Åpne vekter betyr noe smalere: du får selve modellfilen og kan kjøre den, men ikke nødvendigvis se hvordan den ble trent. For praktisk bruk er det åpne vekter som teller, fordi de lar deg hoste modellen selv. Meta Llama 4 Scout er et eksempel på en åpen-vekter multimodal AI-modell som kan hostes på egne private servere.
Den viktigste maktforskyvningen i 2026 er hvem som slipper disse modellene. Kinesiske laboratorier dominerer nå open-weight-utgivelser med MIT- og Apache-lisenser, de mest tillatelige lisensene som finnes. Det er dette som driver prisfallet vi kommer tilbake til, og det er også derfor lisenslesing har blitt en kjernedisiplin og ikke en formalitet.
Hvorfor bilde og video er tyngst
Ikke alle modaliteter koster det samme å behandle. Tekst er lett, bilde tyngre, video tyngst, fordi video i praksis er mange bilder i sekundet pluss lyd. I markedsanalysene reflekteres dette i at bildedatasegmentet forventes å dominere blant modalitetene i 2026. Preprosessering av tunge input tar tid: 100 til 500 millisekunder bare for å gjøre bilder og lyd klare før modellen begynner å tenke.
For et produksjonsteam betyr dette to ting. For det første at maskinvarekravene er reelle når du jobber med visuelt innhold. For det andre at valget av modellstørrelse blir et direkte kostnadsvalg. En liten modell som gjør 80 prosent av jobben på egen maskin kan slå en frontier-modell som gjør 95 prosent, hvis de siste prosentene ikke betyr noe for arbeidsflyten din.
Åpne vekter versus lukkede API-er
Valget mellom en åpen modell du kjører selv og et lukket API du betaler per kall er den mest konsekvensrike beslutningen i denne artikkelen. Det handler ikke bare om pris, men om kontroll, forutsigbarhet og hvem som eier dataene dine. Tabellen under oppsummerer de praktiske forskjellene før vi går inn i hver dimensjon.
| Dimensjon | Åpne vekter (selvhostet) | Lukket API |
|---|---|---|
| Kostnadsmodell | Fast maskinvare, ingen per-kall-regning | Betaling per token, skalerer med bruk |
| Datakontroll | Data forlater aldri egen infrastruktur | Data sendes til ekstern leverandør |
| Ytelse på toppnivå | Bak frontier på de tyngste oppgavene | Ledende på de vanskeligste oppgavene |
| Vedlikehold | Du drifter selv | Leverandøren drifter |
| EU-tilgang | Varierer med lisens | Varierer med leverandør |
Kontroll over data og drift
Den sterkeste grunnen til å velge en åpen modell er ikke prisen, men kontrollen. Når du kjører modellen på egen maskinvare, forlater aldri manus, råopptak eller kundedata din egen infrastruktur. For medieteam som jobber med embargobelagt materiale eller personsensitivt innhold er dette ofte et krav, ikke en preferanse. At lokal inferens har blitt arkitekturmessig viktig, med modeller som kjører på forbrukerhardware, gjør denne veien reell også for mindre selskaper.
Alura mener at lokal inferens på egen maskinvare er realistisk for mindre modeller, og gir norske team kontroll over data uten API-avhengighet. Det samme prinsippet ligger bak fremveksten av Edge AI, der intelligensen flyttes ut på enheter og sensorer i stedet for å ligge i en fjern sky.
Kostnadsmodellen skiller lag
Det er her åpne modeller virkelig gjør et innhugg. Alura mener at åpne modeller med MIT- eller Apache-lisens ofte er den mest kostnadseffektive inngangen for norske medie- og produksjonsbedrifter, siden kinesiske åpne modeller ligger fire til ti ganger under lukkede frontier-modeller på pris. Det er ikke en løs påstand: bransjeoversiktene tallfester en faktor på fire til ti i prisforskjell mellom kinesiske open-weight-modeller og lukkede frontier-modeller.
Forskjellen forsterkes av volum. Et lukket API tar betalt per token, så kostnaden vokser lineært med hvor mye innhold du produserer. En selvhostet modell har en fast maskinvarekostnad uansett hvor mange bilder eller videoklipp du kjører gjennom den. For et team som produserer mye, tipper regnestykket raskt i favør av åpne vekter.
Når lukket API vinner
Åpne modeller er ikke svaret på alt. På de aller vanskeligste oppgavene ligger de lukkede frontier-modellene fortsatt foran. GPT-5.5 er OpenAIs nåværende frontlinjemodell for komplekst profesjonelt arbeid, og lignende toppmodeller er ofte verdt prisen når feilmarginen er lav. Vår gjennomgang av valg av språkmodell for norsk bedrift går grundigere inn i denne avveiningen.
Det lukkede API-et sparer deg også for drift. Baksiden er at markedet er ustabilt. En flaggskipmodell forblir flaggskip i gjennomsnitt bare ti uker før den avløses, og leverandørene gir typisk 60 dager deprecation-varsel før en modell trekkes. Bygger du hele arbeidsflyten på ett bestemt lukket endepunkt, kjøper du deg inn i en tredemølle av migrering. En selvhostet modell blir liggende der du satte den.
Modellene som dominerer åpen kildekode i 2026
Feltet av åpne modeller er stort og skiftende, men noen familier bærer mesteparten av bruken. Llama-familien passerte 1,2 milliarder nedlastinger innen tidlig 2026, mens Qwen-familien nådde 700 millioner nedlastinger på Hugging Face i januar 2026. Til sammenligning sporer aggregatorer som llm-stats.com over 500 språkmodeller, så utvalget er stort selv om noen få dominerer.
| Modell | Type | Størrelse | Utvikler |
|---|---|---|---|
| Llama 4 Scout | Åpne vekter, MoE | 17B aktive parametere | Meta |
| Qwen3-VL-235B | Visjon-språk | 235B parametere | Alibaba Cloud |
| DeepSeek-OCR 2 | Visjon-språk | 3B parametere | DeepSeek |
| GLM-5.2 | Stor MoE | 744B parametere | Zhipu |
| InternVL3-78B | Visjon-språk | 78B parametere | InternVL |
| MiniCPM-V | Kompakt VLM | 8B parametere | OpenBMB |
Llama 4-familien
Metas Llama 4 er referansepunktet mange andre måles mot. Llama 4 Scout har 17 milliarder aktive parametere og et kontekstvindu på 10 millioner tokens, og kjører på en enkelt H100 GPU. Den bruker en Mixture-of-Experts-arkitektur med 16 eksperter, mens den større Llama 4 Maverick har 128 eksperter og overgår GPT-4o på ChartQA og DocVQA.
På toppen sitter Llama 4 Behemoth med 2 billioner parametere, fortsatt under utvikling. Men her ligger den store fellen for norske team, og vi bruker et helt kapittel på den senere: Llama 4-modellene er ekskludert for EU-borgere og selskaper. Åpne vekter til tross, lisensen holder Europa ute.
Qwen, DeepSeek og de kinesiske utfordrerne
De kinesiske laboratoriene er der de mest tillatelige lisensene finnes. Qwen3-VL-serien er utviklet av Alibaba Cloud, og den største varianten er Qwen3-VL-235B som scorer svært høyt på DocVQA, en tett dokumentforståelses-benchmark. For ren dokumentbehandling er DeepSeek-OCR 2, en 3B-parameter visjon-språk-modell optimalisert for dokumentforståelse utgitt i januar 2026, et lettvekter-alternativ.
På den store enden finner du modeller som DeepSeek V4 Pro med 1,6 billioner totale parametere og GLM-5.2 med 744 milliarder totale parametere. Fra Moonshot kommer Kimi K2, en trillion-parameter MoE-modell utviklet i Kina, spesialisert på kundeserviceautomatisering. Poenget er at bredden i kinesisk åpen kildekode dekker alt fra 3B til over en billion parametere.
De små modellene som endrer regnestykket
For et produksjonsteam er det ofte de små modellene som avgjør om lokal drift er realistisk. MiniCPM-V er en 8B-modell, og Kimi-VL-A3B er en 16B-modell med bare 2,8B aktive parametere, som betyr at den kjører langt lettere enn størrelsen antyder. Fra Microsoft finnes Phi-4-multimodal med 5,6 milliarder parametere og et kontekstvindu på 128K, som oppnår en lav word error rate på OpenASR-leaderboardet for tale.
I mellomsjiktet ligger modeller som InternVL3-78B, LLaVA-OV-72B og Molmo 72B. Navnet LLaVA står for Large Language-and-Vision Assistant, en av grunnpilarene i åpen visjon-språk-forskning. For de fleste team er det ikke den største modellen som vinner, men den minste som gjør jobben godt nok.
Hvorfor åpne modeller koster en brøkdel av de lukkede
Prisgapet er ikke et tilfeldig utslag av markedet, men et resultat av arkitektur og forretningsmodell. Alura mener at kinesiske åpne modeller ligger fire til ti ganger under lukkede frontier-modeller på pris, og at dette gjør dem til den mest kostnadseffektive inngangen for norske medie- og produksjonsbedrifter. Under ser vi på de tre mekanismene som driver forskjellen.
MoE-arkitektur senker regnestykket
Den viktigste tekniske grunnen er Mixture-of-Experts. MoE-arkitektur gjør at AI-modeller kan skalere opp parameterantallet uten å kreve massiv datakraft for hver spørring, fordi bare en delmengde av modellen aktiveres per token. Mistral Large 3 er en sparse mixture-of-experts-modell med 675 milliarder totale parametere, men bruker bare 41 milliarder aktive parametere per token.
Samme prinsipp gjør at Llama 4 Scout kan operere med 17 milliarder aktive parametere selv om totalen er langt høyere. Du betaler for beregning på de aktive parameterne, ikke på totalen, og det er derfor en stor MoE-modell kan være billigere å kjøre enn en mindre tett modell.
Ingen per-token-regning
Med en selvhostet åpen modell forsvinner hele per-token-fakturaen. Kostnaden din er maskinvaren og strømmen, og den er den samme enten du kjører hundre bilder eller hundre tusen. For et lukket API vokser regningen med hvert eneste kall. For volumdrevet innhold, som er selve definisjonen av videoproduksjon, er dette skillet avgjørende.
Denne dynamikken er en av grunnene til at åpne modeller har fått fotfeste så raskt. Aktiviteten i det åpne økosystemet er enorm: antall AI-relaterte prosjekter på GitHub har økt til 5,58 millioner innen 2025. Verktøyene rundt selvhosting modnes i samme tempo som modellene selv.
Frontier-priskrigen du slipper
Prisen på lukkede modeller reflekterer en kapitalkrig du ikke trenger å finansiere. Globale AI-investeringer nådde en ny topp i 2025 med over 581 milliarder dollar. Metas capex-guiding for 2026 ligger på 115 til 135 milliarder dollar, og et joint venture mellom OpenAI, SoftBank og Oracle planlegger å investere opptil 500 milliarder USD i AI-infrastruktur.
| Faktor | Selvhostet åpen modell | Lukket frontier-API |
|---|---|---|
| Prisnivå | Fire til ti ganger lavere | Referansepris |
| Marginal kostnad per kall | Tilnærmet null | Betaling per token |
| Aktive parametere (MoE) | 17B for Llama 4 Scout | Ofte ikke oppgitt |
| Kapitalavhengighet | Ingen | Milliardinvesteringer i bakgrunnen |
Den fulle prisen på en lukket frontier-modell må dekke disse investeringene. Når du velger en åpen modell fra et laboratorium som gir vekter bort under en fri lisens, arver du kapasiteten uten å betale ned kapitalregningen. Det er kjernen i hvorfor faktoren fire til ti holder.
Å kjøre modellen lokalt på egen maskinvare
Lokal drift høres teknisk ut, men regnestykket er overraskende konkret. Lokal inferens har blitt arkitekturmessig viktig, med modeller som kjører på forbrukerhardware. Alura mener lokal inferens på egen maskinvare er realistisk for mindre modeller, og gir norske team kontroll over data uten API-avhengighet. Tabellen under viser hva du faktisk trenger.
Kvantisering og minne
Nøkkelen til lokal drift er kvantisering, som komprimerer modellens vekter. Ved 4-bit kvantisering trenger du 0,5 bytes per parameter. Det gir konkrete tall: en 27B-modell krever rundt 14 GB minne ved 4-bit, og en 7B-modell krever rundt 4 GB ved 4-bit. En 7B-modell passer altså på maskinvare de fleste kontorer allerede har.
I tillegg kommer minnet til selve konteksten. For mellomstore modeller må du regne med 1 til 2 GB KV-cache-minne per 32K tokens. Jobber du med lange dokumenter eller mange videorammer samtidig, vokser dette raskt, og det er en av de vanligste tabbene folk gjør når de dimensjonerer maskinvare.
Hastigheten du kan forvente
Hastighet måles i tokens per sekund, og den avhenger av modellstørrelse. På en maskin med 8 GB minne kan du forvente 15 til 20 tokens per sekund for små modeller. De minste, 3B til 4B-modeller på forbrukerhardware, kjører på 40 til 80 tokens per sekund.
| Modellstørrelse | Minnebehov (4-bit) | Hastighet |
|---|---|---|
| 3B til 4B | Under 4 GB | 40 til 80 tokens/sek |
| 7B til 8B | Rundt 4 GB | 30 til 50 tokens/sek |
| 27B til 32B | Rundt 14 GB | 10 til 25 tokens/sek |
Som tabellen viser faller 7B til 8B-modeller på 30 til 50 tokens per sekund, mens 27B til 32B-modeller kjører på 10 til 25 tokens per sekund. For batchjobber der du ikke venter på svar i sanntid, som å tagge et helt videoarkiv over natten, er selv de laveste hastighetene mer enn nok.
H100 og skygrensen
For de større multimodale modellene beveger du deg over i datasenter-maskinvare. At Llama 4 Scout kjører på en enkelt H100 GPU er et salgspunkt nettopp fordi det holder maskinvarekravet nede til en kraftig GPU i stedet for en klynge. For team som ikke vil eie maskinvaren, kan du leie tilsvarende kapasitet i skyen og fortsatt kjøre en åpen modell du selv kontrollerer.
Poenget er ikke at alt kan kjøres på en bærbar PC. Poenget er at det finnes en trapp: de minste VLM-ene kjører på en vanlig arbeidsstasjon, mellomklassen på en enkelt god GPU, og bare de aller største krever klynge. De fleste medieoppgaver løses lenge før du når toppen av trappen.
EU-eksklusjonen og hva den betyr for norske team
Her ligger den mest oversette fellen. En modell kan være åpen og likevel forbudt å bruke i Norge. Alura mener du må lese lisensvilkårene før du bygger på en åpen modell, fordi Metas beslutning om ikke å tilby multimodale Llama-modeller i EU viser at åpen ikke er det samme som fritt tilgjengelig i Europa. Dette er ikke en teoretisk risiko, men en konkret sperre som allerede har rammet en av de mest populære modellfamiliene.
Hva Meta faktisk gjorde
I 2024 kunngjorde Meta at selskapet ikke vil tilby sine neste multimodale AI-modeller til kunder i EU. Selskapet sa at det vil gi ut en multimodal Llama-modell i løpet av de kommende månedene, men ikke i EU. Da Llama 4 kom, var mønsteret bekreftet: modellene er ekskludert for EU-borgere og selskaper.
Begrunnelsen var regulatorisk usikkerhet. Meta vil ikke lansere multimodale AI-modeller i EU på grunn av uforutsigbare reguleringer, men vil lansere de multimodale modellene i Storbritannia til tross for lignende databeskyttelseslover. Europeiske brukere får en tekst-only versjon av Llama i stedet. Konsekvensen er konkret også for forbrukerprodukter: EU-brukere av Ray-Ban Meta vil ikke kunne bruke bildeforståelsesfunksjonene.
Hvorfor det rammer norske team
Norge er ikke medlem av EU, men gjennom EØS-avtalen følger vi det indre markedets regelverk på dette området, og norske selskaper behandles i praksis som EU-selskaper når leverandører setter geografiske sperrer. Da Metas sjefforsker Yann LeCun kunngjorde at EU-industrien ikke vil få tilgang til fremtidige multimodale versjoner av Llama-3, gjaldt det også norske produksjonsselskaper.
Bakgrunnen er en konkret strid om data. Meta har blitt beordret til å slutte å trene AI-modeller med innlegg fra Facebook- og Instagram-brukere i EU, og Meta ble beordret til å pause treningen på EU-data i juni. Selskapet sendte til og med 2 milliarder varsler til brukere i EU om muligheten til å reservere seg mot trening. LeCuns innlegg utløste en bred debatt, med 633 kommentarer om konsekvensene for europeisk industri.
Eksklusjonen er modellspesifikk, ikke en generell forbudslinje. De kinesiske modellene med MIT- og Apache-lisens har ingen tilsvarende EU-sperre, og det er en av de praktiske grunnene til at et norsk team bør se mot Qwen, DeepSeek og lignende familier heller enn Llama 4 for multimodalt arbeid. Den samme åpne modellen kan være lovlig i Storbritannia og sperret i Norge, så sjekk ikke bare hva lisensen tillater, men hvor den tillater det.
AI Act og lisensvilkårene du må sjekke
Utover leverandørenes egne sperrer setter EU-regelverket rammene. EU AI Act begynte offisielt å gjelde for generelle AI-systemer 2. august 2025. For et norsk team som skal ta i bruk en åpen modell, avgjør detaljene i dette regelverket hvilke plikter du arver når du finjusterer eller distribuerer en modell.
GPAI-terskelen
AI Act skiller mellom vanlige modeller og modeller for generelle formål, GPAI. Terskelen er beregningsbasert. Datagrensen for GPAI-modeller ble økt fra 10^22 til 10^23 FLOPs, et nivå som typisk krever rundt 1 milliard parametere å trene. Over dette gjelder de generelle åpenhetsforpliktelsene.
For de aller største modellene finnes en høyere terskel. Modeller med potensiell systemisk påvirkning kvalifiserer ved 10^25 FLOP, og de får strengere krav. De fleste modeller et medieteam vil kjøre lokalt havner et godt stykke under dette taket, men det er verdt å vite hvor grensene går.
Nedstrøms-ansvar når du finjusterer
Det mange overser er at du kan bli ansvarlig selv om du bare bygger videre på en annens modell. For nedstrømsmodifikasjoner ble terskelen satt til en tredjedel av beregningsressursene som ble brukt til å trene den opprinnelige modellen. Finjusterer du en åpen modell tungt nok, kan du selv bli regnet som leverandør med tilhørende plikter.
Tidsfristene gir litt pusterom. Modeller som allerede er på EU-markedet har frist til august 2027 for å overholde AI Act, og harmoniserte standarder ventes vedtatt i 2026 og 2027. For et team som starter forsiktig i 2026, er det tid til å innrette seg.
Code of Practice og hvem som signerte
EU har laget en frivillig etterlevelsesvei. Code of Practice er frivillig, men de som følger den anses som kompatible med AI Act. Hvem som har signert er opplysende: Microsoft, Google, OpenAI, Anthropic og Mistral har signert, mens Meta, Apple, Baidu, Alibaba og Tencent ikke har signert.
Det bredere AI Pact-initiativet har fått langt flere med seg: over 200 selskaper har signert AI Pact. At både Meta og de kinesiske selskapene står utenfor Code of Practice betyr ikke at modellene deres er ulovlige, men det legger mer av etterlevelsesansvaret på deg som bruker.
Les lisensen før du bygger
Alura mener klart at du må lese lisensvilkårene før du bygger på en åpen modell. En MIT- eller Apache-lisens gir deg svært vide rettigheter, mens en tilpasset leverandørlisens, som Metas Llama-lisens, kan inneholde både geografiske og bruksmessige begrensninger. Forskjellen er ikke akademisk: den avgjør om du lovlig kan sette modellen i produksjon i Norge.
| Sjekkpunkt | Hva du ser etter |
|---|---|
| Lisenstype | MIT eller Apache gir videst frihet |
| Geografi | Er EU/EØS ekskludert, som for Llama 4? |
| Kommersiell bruk | Tillatt uten omsetningsgrense? |
| Finjustering | Utløser du nedstrøms-plikter over en tredjedel? |
| GPAI-status | Passerer modellen 10^23 FLOPs? |
Markedet for multimodal AI og medie-segmentet
Markedstallene forklarer hvorfor både åpne og lukkede leverandører kjemper så hardt. Anslagene spriker fordi analysehusene måler ulikt, men retningen er entydig. SNS Insider venter at markedet vokser kraftig fra 2025 til 2035. Coherent Market Insights venter tilsvarende sterk vekst fra 2026 til 2033. Et tredje anslag fra Kanerika peker samme vei for perioden 2024 til 2030.
| Kilde | Startår | Sluttår | Vekst |
|---|---|---|---|
| SNS Insider | 2025 | 2035 | Høy tosifret CAGR |
| Coherent | 2026 | 2033 | Høy tosifret CAGR |
| Kanerika | 2024 | 2030 | Høy tosifret CAGR |
Vekstratene alle er enige om
Selv om nivåtallene spriker, ligger vekstratene tett. Coherent, Kanerika og SNS Insider lander alle på en høy tosifret årlig vekstrate for det multimodale AI-markedet. Når tre uavhengige anslag lander på nesten samme vekstrate, er signalet tydelig uansett hvilket absolutt tall du stoler på.
Programvare, ikke maskinvare, driver mesteparten av verdien. Programvare-segmentet dominerte markedet med omtrent 68 prosent inntektsandel i 2025, og løsningssegmentet ventes å lede markedet i 2026. Det er verdien i anvendelsene, ikke i chippene, og det er nettopp der et produksjonsteam kan hente gevinst uten store investeringer.
Medie og underholdning
Medie-segmentet er allerede en tung del av dette markedet. Media og underholdning sto for 23 prosent av inntektsandelen i 2025. Kombinert med at bildedatasegmentet ventes å dominere blant modalitetene i 2026, viser tallene at visuelt innhold er der pengene og bruken samler seg.
Bredere adopsjonstall peker samme vei. Ifølge McKinseys State of AI Report 2025 tester eller implementerer 65 prosent av store bedrifter multimodal AI i produksjonsmiljøer. Praktiske gevinster begynner å bli dokumentert: en multimodal tilnærming i kundestøtte reduserer løsningstider med opptil 40 prosent sammenlignet med tekstbaserte kanaler, ifølge Gartner. En egen gjennomgang av hvordan bedrifter bruker AI til videoproduksjon går dypere inn i konkrete arbeidsflyter.
Hvor Norge sitter
Geografisk er tyngdepunktet fortsatt i USA. Nord-Amerika dominerte markedet med omtrent 47 prosent inntektsandel i 2025, og Coherent venter fortsatt nordamerikansk dominans i 2026. Amerikansk lederskap i modellutvikling bekreftes av at USA sto for 50 notable AI-modeller i 2025.
Veksten er raskest i Asia. Asia Pacific ventes å ha høyest vekstrate frem til 2035. For norske SMB-er er et annet forhold mer relevant: SMB-segmentet vokser raskere enn markedet som helhet. Mindre selskaper tar teknologien i bruk fortere enn de store, og åpne modeller er en stor del av grunnen.
Første steg for et norsk medie- og produksjonsteam
Kunnskap om markedet hjelper lite uten en konkret startplan. Her er en rekkefølge som holder risikoen lav og læringskurven bratt, tilpasset et team som produserer bilde- og videoinnhold og ikke har en egen AI-avdeling.
Start med en avgrenset oppgave
Ikke prøv å automatisere hele produksjonen på en gang. Velg en enkelt, godt avgrenset oppgave der volum og repetisjon gjør gevinsten tydelig: automatisk teksting, metadata-tagging av et videoarkiv, eller generering av miniatyrbilder. En modell som DeepSeek-OCR 2 med sine 3 milliarder parametere er skreddersydd for dokumenttunge oppgaver og kjører lett lokalt.
Ved å begynne smalt får du et reelt sammenligningsgrunnlag for kostnad og kvalitet før du forplikter deg. Det er også slik de fleste lykkes: 78 prosent av organisasjoner rapporterte bruk av AI i minst en forretningsfunksjon i 2024, opp fra 55 prosent året før. De som lykkes starter i en funksjon, ikke i alle samtidig.
Bygg en privat evalueringspakke
Før du velger modell, lag et lite testsett fra ditt eget innhold. Bransjepraksisen er en privat evalueringspakke med 20 til 50 oppgaver som speiler jobben modellen skal gjøre. Kjør hver kandidatmodell mot dette settet og mål kvalitet på ditt materiale, ikke på en generisk benchmark.
Dette er billig forsikring mot dyre feilvalg. En modell som scorer høyt på en offentlig benchmark kan prestere svakt på norsk fagterminologi eller på nettopp din type videoinnhold. Din egen evalueringspakke fanger dette før du bygger arbeidsflyten.
Velg maskinvare etter modellstørrelse
Med en oppgave og et testsett på plass, dimensjoner maskinvaren. En 7B-modell trenger rundt 4 GB minne ved 4-bit og kjører på en god arbeidsstasjon. Trenger du en større modell, husker du at en 27B-modell krever rundt 14 GB, og at de aller største krever datasenter-GPU-er som H100.
For de fleste medieteam er poenget at du kan starte med maskinvare du allerede eier. Er batch-hastighet nok for arbeidsflyten din, holder selv 10 til 25 tokens per sekund for en 27B-modell. Du skalerer opp først når volumet krever det, ikke før.
Vanlige feil når bedrifter tar i bruk åpne modeller
De samme tabbene går igjen. Her er de fire vi ser oftest, og hvordan du unngår dem.
Å tro at åpen betyr fritt tilgjengelig
Den dyreste feilen er å anta at en åpen modell kan brukes hvor som helst. Llama 4-modellene er ekskludert for EU-borgere og selskaper til tross for at vektene er åpne. Bygger du en produksjonsflyt på en modell som er sperret i EØS, må du rive den ned igjen. Sjekk geografien først, ikke sist.
Å jage flaggskipet
Mange kaster bort tid på å alltid bruke den nyeste toppmodellen. Men en flaggskipmodell forblir flaggskip i gjennomsnitt bare ti uker, og hver gang du bytter mister du tid: leverandørene gir 60 dager deprecation-varsel, og selve migreringen tar rundt tre uker. En stabil, god-nok åpen modell du eier slår en evig jakt på toppen.
Å hoppe over lisenslesingen
En modell kan være gratis å laste ned og likevel ha begrensninger på kommersiell bruk, geografi eller finjustering. Husk at nedstrømsmodifikasjoner over en tredjedel av opprinnelig treningsberegning kan gjøre deg til leverandør i AI Acts forstand. Les lisensen og AI Act-statusen før du bygger, ikke etterpå. Og husk at konteksten koster minne: 1 til 2 GB KV-cache per 32K tokens kommer i tillegg til modellvektene og kan sprenge budsjettet på lange dokumenter.
Hallusinasjon-fella
Multimodale modeller kan beskrive ting som ikke finnes i bildet. Det er et reelt kvalitetsproblem, men det bedrer seg raskt: i en test ga GPT-5 selvsikre svar om ikke-eksisterende bilder 9 prosent av gangene, en kraftig forbedring fra OpenAIs tidligere o3-modell. Lærdommen er å ha et menneske i loopen på alt publikumsrettet innhold, uansett hvor god modellen er. En oversikt over hvordan de ulike AI-modellene skiller seg hjelper med å velge etter styrker og svakheter.
Ofte stilte spørsmål om åpne multimodale modeller
De spørsmålene vi oftest får fra medie- og produksjonsledere, med korte svar.
Er åpne modeller virkelig billigere?
For volumdrevet arbeid, ja. Kinesiske open-weight-modeller ligger fire til ti ganger under lukkede frontier-modeller på pris, og en selvhostet modell har ingen per-token-regning. Men du betaler i drift og maskinvare, så gevinsten avhenger av volum. Lavt volum kan fortsatt være billigere via et lukket API.
Kan jeg bruke Llama 4 i Norge?
Ikke de multimodale variantene. Llama 4-modellene er ekskludert for EU-borgere og selskaper, og Norge følger EØS-regelverket på området. Meta tilbyr en tekst-only versjon av Llama i Europa, men for multimodalt arbeid bør du se mot kinesiske modeller med MIT- eller Apache-lisens.
Hvilken maskinvare trenger jeg for å starte?
For en liten modell holder en god arbeidsstasjon. En 7B-modell krever rundt 4 GB minne ved 4-bit og kjører på 30 til 50 tokens per sekund. Vil du kjøre en større modell lokalt, trenger du en kraftig GPU, og for de aller største en H100-klasse GPU som Llama 4 Scout kjører på.
Oppsummering og veien videre
Åpne multimodale modeller er en reell, billigere vei til AI-basert bilde- og videoinnhold for norske medie- og produksjonsteam. Prisfordelen er dokumentert: kinesiske open-weight-modeller ligger fire til ti ganger under lukkede frontier-modeller, og med selvhosting forsvinner per-token-regningen helt. For volumdrevet innhold tipper regnestykket tydelig mot åpne vekter.
Men åpen er ikke det samme som fritt tilgjengelig. Llama 4 er sperret for EU-selskaper, og AI Act legger plikter på den som finjusterer tungt. Lisenslesing er derfor ikke en formalitet, men det første steget. Velg kinesiske modeller med MIT- eller Apache-lisens for multimodalt arbeid i Norge, og sjekk geografien før du bygger.
Konkret betyr det tre ting denne uken. Først: velg en enkelt, avgrenset oppgave med høyt volum, som teksting eller arkiv-tagging. Deretter: bygg en privat evalueringspakke på 20 til 50 oppgaver fra ditt eget innhold og test to eller tre åpne modeller mot den. Til slutt: dimensjoner maskinvaren etter den minste modellen som løser oppgaven godt nok, ofte en 7B-modell på rundt 4 GB. Markedet vokser uansett med en høy tosifret årlig vekstrate, og medie og underholdning står allerede for 23 prosent av markedet. Teamene som starter smalt nå, med kontroll over lisens og data, står best rustet når volumet vokser.
I Alura bygger vi AI-infrastruktur for norske virksomheter, fra dataplattformer til agentiske systemer i produksjon. Vi er ikke en SaaS-leverandør. Vi er håndverkere som setter sammen byggesteinene som faktisk fungerer for din situasjon.
Bestill en arkitektur-samtale: vi går gjennom din nåværende infrastruktur, identifiserer integrasjonspunkter, og foreslår en pragmatisk vei videre. Uforpliktende, 45 minutter.
Alura
Praktisk kunnskap om AI-automatisering og effektivisering for norske bedrifter.
Les neste
Er åpne AI-modeller trygge når USA truer med sanksjoner?
USA vurderer sanksjoner mot åpne AI-modeller for IP-tyveri, samtidig som åpne modeller vinner terreng. Her er hva det betyr for norske SMB-er som bygger på dem.
70 agent-systemer viser at harness slår modellvalg
En gjennomgang av 70 agent-systemer peker på fem designvalg i orkestreringslaget. For norske bedrifter kan arkitekturen bety mer for resultatet enn hvilken modell du velger.
AI-assistert utvikling gir 581 sårbarheter per kodebase
Åpen kildekode og AI gjør utvikling raskere, men gjennomsnittlig kodebase har nå 581 sårbarheter. Her er hva norske teknologibedrifter må styre før de skalerer.
Åpen vekt AI gir frihet men 975 milliarder krever tung drift
Thinking Machines' Inkling er åpen vekt og gratis å laste ned, men 975 milliarder parametere krever tung infrastruktur. Hva betyr det for norske SMB-er som vurderer egen AI?