Norske SMB-er kan endelig kjøre AI lokalt med Gemma 4 12B
Gemma 4 12B kjører multimodal AI lokalt på en 16 GB-laptop. Vi ser på hva det betyr for norske SMB-er, og hva åpen lisens forplikter under AI Act og GDPR.

Hva Gemma 4 12B faktisk er
Google DeepMind lanserte Gemma 4 12B som en åpen, multimodal modell designet for å kjøre direkte på en bærbar PC. Modellen har 12 milliarder parametere ifølge Ars Technicas gjennomgang, og krever 16 GB RAM eller VRAM for å kjøre lokalt. Det er først nå nedre del av åpen-modell-stigen treffer maskinvaren norske SMB-er allerede har stående på kontoret.
Familien har passert 150 millioner nedlastinger ifølge Google DeepMinds egen kunngjøring. Det gjør Gemma til en av de mest brukte åpne modellfamiliene på markedet, og betyr at det finnes verktøy, opplæringsmateriell og fellesskap som er klare når du starter en pilot.
Modellen er en del av en bredere bevegelse mot åpne modeller. Hugging Faces State of Open Source-rapport for våren 2026 viser at antallet brukere, modeller og datasett på plattformen nesten har doblet seg det siste året, og at gjennomsnittlig størrelse på nedlastede modeller har vokst markant. Gemma 4 12B sikter midt på den utviklingen.
Spesifikasjonene som teller
Modellen har 256K tokens kontekstvindu ifølge VentureBeat, støtter native funksjonskall og systemprompter, og håndterer tekst, lyd, bilde og video i samme arkitektur. Lydinnganger er begrenset til 30 sekunder og video til 60 sekunder, en designgrense det er verdt å planlegge for tidlig.
Modellvektene er på 18 GB for nedlasting ifølge Ars Technica. Modellen er pretrent på over 100 språk ifølge BentoMLs gjennomgang, og 140 språk ifølge tidlige testrapporter. Det inkluderer norsk i praksis, men kvaliteten varierer fra språk til språk.
Hvor den passer i Gemma-familien
Forrige generasjon, Gemma 3 27B, kjørte ifølge Fireworks AIs oversikt på et enkelt forbruker-GPU med 24 GB VRAM. Gemma 4 12B leverer ifølge Google DeepMind ytelse nær den større 26B MoE-modellen på standard benchmarks, men med vesentlig lavere minneforbruk. Det er en relevant detalj: ytelse er ikke lineær med parametertall.
Det finnes også en større Gemma 4 31B i samme familie, med samme 256K-token kontekstvindu og over 100 språk pretrent, ifølge BentoMLs sammenstilling. For norske SMB-er er det imidlertid 12B-versjonen som flytter terskelen for hva som kan kjøres på eksisterende utstyr.
Hva 12B betyr i praksis
Parametertall er en grov proxy for kapasitet, og Alura mener bedrifter bør vurdere bruksmønster (lyd, video, kontekstlengde) før modellvalg, ikke parametertall isolert. Frontier-modeller på det åpne markedet ligger i en helt annen vektklasse. Kimi K2.5 har 32 milliarder aktive parametere per token og totalstørrelse i serverklasse. DeepSeek V4-Flash har 284 milliarder parametere totalt og 13 milliarder aktive.
Disse er ikke modeller du kjører på en laptop. Gemma 4 12B er den bevisste landingen midt i, der ytelsen er god nok for de fleste hverdagsbruk og maskinvaren er overkommelig. Hvis du trenger frontier-resonnement i den øverste parameter-klassen, må du fortsatt til skyen. Vår oversikt over valg av språkmodell for norske bedrifter går nærmere inn på avveiningene. Vi kommer tilbake til det.
Encoder-free arkitektur og hva som er nytt
Den arkitektoniske nyvinningen i Gemma 4 12B er at den er encoder-free. Tidligere multimodale modeller brukte separate kodere for lyd og video som mellomledd som blåste opp minnebudsjettet, ifølge VentureBeat. Google har erstattet synskoderen med en 35-million-parameter embedding-modul.
For lyd er det enda mer dramatisk: råsignalet projiseres direkte inn i samme vektorer som tekstetokens, ifølge Ars Technica. Det betyr at modellen ikke trenger et eget steg for lydtranskripsjon eller lydforståelse. Latensen går ned, minneforbruket går ned, og enheten du kjører på trenger ikke å være en server.
Hva encoder-free betyr teknisk
Tradisjonelle multimodale modeller har vært en stack: en synskoder genererer embeddings fra bilder, en lydkoder gjør det samme for lyd, og en språkmodell håndterer tekst. Hvert ledd har egne parametere, eget minneforbruk og egen latens. Gemma 4 12B kollapser denne stacken til en enkelt arkitektur ifølge Google DeepMind. Den 35-million-parameter embedding-modulen håndterer bilder, mens lyd projiseres direkte inn i token-rommet.
Multi-Token Prediction og latens
Modellen bruker Multi-Token Prediction ut av boksen, ifølge Ars Technica. I praksis betyr det at modellen forutser flere tokens samtidig under inferens, og det øker effektiv hastighet. Tidlige testere rapporterer ifølge en YouTube-gjennomgang fra Julian Goldie en hastighet på 20 tokens per sekund på en vanlig laptop. Det er langsommere enn skytjenester, men det er fullt brukbart for de fleste arbeidsflyter, og det er gratis per token.
Native funksjonskall og systemprompter
Gemma 4 12B støtter native funksjonskall ifølge VentureBeat. For SMB-er betyr dette at AI-en kan kobles mot interne verktøy, API-er og databaser uten en stor orkestrerings-stack mellom. Du kan eksempelvis la modellen kalle en lokal SQL-database direkte fra prompten. Det reduserer integrasjonsbarrieren og holder mer av arbeidsflyten under bedriftens egen kontroll.
Maskinvarekravet for å kjøre Gemma 4 lokalt
Den praktiske terskelen er 16 GB VRAM eller unified memory, bekreftet av VentureBeat, Google DeepMind og Ars Technica. Modellvektene tar 18 GB i disk, men ved kvantisering og smart minnehåndtering passer modellen innenfor 16 GB i kjøretid.
Tabellen under sammenligner maskinvarekrav for noen kjente åpne modeller.
| Modell | Parametere | Maskinvarekrav | Kilde |
|---|---|---|---|
| Gemma 4 12B | 12B | 16 GB RAM/VRAM | Ars Technica |
| Gemma 3 27B | 27B | 24 GB VRAM (enkelt GPU) | Fireworks AI |
| Gemma 4 26B MoE | 26B MoE | Dobbelt minnefotavtrykk vs 12B | Google DeepMind |
| DeepSeek-V4-Flash | 284B total / 13B aktive | Serverklasse | BentoML |
| Kimi K2.5 | 32B aktive per token | Serverklasse | Fireworks AI |
16 GB-grensen i praksis
Bedriftslaptoper med 16 GB RAM har vært standard i flere år. Det betyr at du sannsynligvis allerede har maskinen som trengs. Ars Technica bemerker at modellen kan kjøres på consumer-laptoper uten at kvaliteten ofres, takket være de arkitektoniske valgene vi diskuterte over. Det er en konkret grense, ikke en omtrentlig anbefaling.
Mac, Windows og Linux
Apple Silicon-laptoper bruker unified memory, der CPU og GPU deler samme minnepool. En MacBook Pro med 16 GB unified memory bør klare Gemma 4 12B uten dedikert GPU. På Windows og Linux trenger du enten en GPU med 16 GB VRAM, eller nok systemminne til å gjøre CPU-inferens. Skal du lese mer om hvordan lokal kjøring fungerer i edge-scenarier, anbefaler vi vår oversikt over Edge AI og IoT.
Hva ytelsen blir i praksis
Du får ikke samme svarhastighet som GPT-4 over API. 20 tokens per sekund ifølge tidlige testere er typisk på rimelig maskinvare. For en kort svarlengde på 200 tokens gir det rundt ti sekunder svartid. For batch-prosessering, intern søk, dokumentanalyse og personlige assistent-flyter er det rikelig. For en chat med kunder i sanntid er det knappere.
Når lokal AI gir mening for norske SMB-er
Alura mener at lokal AI på laptop er en realistisk førstepilot for norske SMB-er, men krever egen plan for modelloppdateringer og sårbarhetshåndtering. Realistisk vil si: terskelen for å starte er lavere enn på flere år. Men førstepilot betyr ikke eneste system. Det skal sette i gang en læringskurve, ikke erstatte hele AI-stacken på dag en.
Beslutningen lokal vs sky er ikke binær. Det er et rammeverk for å velge riktig verktøy for riktig bruk.
| Bruksmønster | Lokal Gemma 4 12B | Sky (GPT-4o, Claude, Gemini) |
|---|---|---|
| Sensitive interne dokumenter | Sterkt egnet | Krever DPA og gjennomgang |
| Hverdagslige tekstoppgaver | God nok ytelse | Overkill, men raskere |
| Lyd opp til 30 sekunder | Innebygd støtte | Krever ekstra API-kall |
| Frontier-koding | Begrenset | Sterkt egnet |
| Kontekster over 256K tokens | Ikke støttet | Egnet (MiniMax M3: 1M) |
| Stor variabel last | Krever skalering | Elastisk |
Beslutnings-rammeverk: lokal eller sky
Tabellen er en startguide. Den dekker ikke alt, og du må selv vurdere personvern, ytelseskrav og driftskostnad. Sky gir lavere brukerterskel. Lokal gir lavere variabel kostnad og høyere kontroll. Vår oversikt over valg av LLM for norske bedrifter går dypere inn på avveiningene mellom proprietære og åpne modeller, og hva som passer for typiske SMB-scenarier.
Bransjer som bør se på det først
Bransjer med sensitive data og forutsigbar belastning bør være først ute: regnskap, juridisk rådgivning, helsesektor og offentlig sektor. En undersøkelse fra American Bar Association i april 2025 viste at 75% av advokater brukte skybaserte løsninger, en figur som speiler en bransje der mange er tvunget mot sky men gjerne skulle hatt mer kontroll. Lokal AI gir et tredje alternativ. For mer om hvordan personvern og AI henger sammen i norsk kontekst, se vår gjennomgang av privacy-first AI i Norge.
Når sky fortsatt er riktig
Skal du gjøre frontier-koding, vinner sky. Kilos benchmarks viser at DeepSeek V4-Pro topper LiveCodeBench med 93,5 og har Codeforces-rating på 3206, men dette er servermodeller. MiniMax M3 ifølge samme kilde topper åpne-vekt SWE-Bench Pro med 59,0% og har 1M-tokens kontekstvindu. For lange juridiske dokumenter, store kodebaser og avansert agentisk arbeid er lokal Gemma 4 12B ikke svaret.
Praktisk oppstart i løpet av en uke
Hva ser en realistisk uke ut som? Vi gir et minimumsløp for å gå fra null til en intern pilot. Det forutsetter en utvikler eller teknisk produktansvarlig som kan drive arbeidet, men er ikke avhengig av eksterne konsulenter.
Ukeplanen forutsetter også at du har en konkret intern oppgave i bakhodet. Generelle vi-vil-bare-prøve-AI-piloter strander oftere enn de leverer. Velg ett dokumentarkiv eller en arbeidsflyt og hold den klar før uken starter. Vil du forankre piloten i en bredere personvern-strategi, har vi skissert mønsteret i vår veileder for privacy-first AI.
Dag 1 og 2: Installasjon og første prompt
Last ned modellvektene, 18 GB ifølge Ars Technica. Bruk et lokalt inferens-verktøy som gjør modellen tilgjengelig over et lokalt API. Test første prompt mot et internt dokument du kjenner svaret på. Mål to ting: kvalitet på svaret og hastighet i tokens per sekund. 20 tokens per sekund som tidlige testere har rapportert er en rimelig referanse. Hvis du ligger langt under, er det maskinvare eller konfigurasjon, ikke modellen.
Dag 3 og 4: RAG mot egne data
Modellen alene er ikke nok. Du må gi den tilgang til egne dokumenter gjennom en RAG-pipeline (retrieval-augmented generation). På dag 3 setter du opp en enkel vektordatabase over et utvalg interne dokumenter. På dag 4 tester du om modellen finner riktig informasjon og om svarene faktisk er forankret i kildene. Dette er der lokal AI ofte feiler i tidlige piloter, ikke fordi modellen er dårlig, men fordi RAG-pipelinen ikke er sjekket godt nok.
Dag 5: Brukerprøve og evaluering
Definer suksesskriterier før uken starter. Eksempler: hvor mange svar er faktisk riktige, hvor lang tid sparte en bruker på en typisk oppgave, hvor ofte trenger personen å verifisere svaret manuelt. Dag 5 er en lukket brukerprøve med to-tre personer, ikke en lansering. Du skal lære, ikke imponere. Skriv ned funn samme dag. Det er fristende å utsette skrivearbeidet, men da forsvinner detaljene.
Multimodale bruksområder for lyd, bilde og video
Gemma 4 12B er ifølge Google DeepMind den første mellomstore modellen i Gemma-familien med native lydinngang. Dette skiller den fra forrige generasjon. Men begrensningene betyr noe. Lyd er kappet til 30 sekunder, video til 60 sekunder, ifølge VentureBeat.
Begrensningene er ikke arbitrære. Lengre opptak må chunkes i biter modellen kan svelge, og det krever logikk på utsiden. Det er gjørlig, men ikke gratis.
Lyd: møtenotater og transkripsjon
Modellens evne til å tolke lyd direkte, uten en separat transkripsjonstjeneste, åpner for use cases som korte taleinstruksjoner, kundekommentarer fra telefon og oppsummering av møte-segmenter. Et helt møtereferat krever at du splitter opptak i 30-sekunders biter, kjører hver bit gjennom modellen, og syr sammen output på utsiden. Det er en arbeidsflyt, ikke en magisk knapp. Råsignalet projiseres direkte inn i samme vektorer som tekstetokens ifølge Ars Technica, så latensen er lav.
Bilde: dokumentforståelse
Den 35-million-parameter embedding-modulen ifølge VentureBeat erstatter en større synskoder. Praktisk relevante use cases er skannede fakturaer, kvitteringer, regnskapsbilag, organisasjonsdiagrammer og produktbilder. Modellen er ikke bedre enn dedikerte OCR-systemer for ren tekstgjenkjenning, men den kan tolke struktur og kontekst i samme prompt. For komplisert bilag-arbeidsflyt vil en kombinasjon av tradisjonell OCR og lokal LLM ofte være riktig. Lokal dokumentanalyse er en kjernebrukstilfelle for edge AI på enheter og sensorer.
Video: korte klipp og analyse
60 sekunder er kort. Det utelukker fullstendige bruksvideoer og lange instruksjonsklipp. Det passer for korte produktanimasjoner, overvåkings-snippets, eller analytiske spørsmål om enkelthandlinger i et klipp. For lange videoer må du segmentere og resonnere på utsiden, eventuelt med separate verktøy for nøkkelbildedeteksjon. Alura mener bedrifter bør vurdere bruksmønster (lyd, video, kontekstlengde) før modellvalg, ikke parametertall isolert. Hvis kjernen i bruken er video over fem minutter, må du tilbake til skybaserte alternativer.
Markedsbildet rundt åpne modeller i 2026
Gemma 4 12B kommer inn i et marked der åpne modeller har tatt en strategisk posisjon. Research and Markets anslår at markedet for åpne AI-modeller var verdt $19,05 milliarder i 2025 og forventes å treffe $23,08 milliarder i 2026, en vekstrate på 21,1%. Innen 2030 forventes markedet å nå $50,03 milliarder med en CAGR på 21,3%.
Driverne er ikke teknologiske alene. State of Open Source-rapporten fra Open Source Initiative peker på leverandørlåsning som hovedsak. 55% av respondentene oppgir det som drivkraft, en 68% årlig økning. Rapporten er produsert i samarbeid med OpenLogic og Eclipse Foundation.
Markedsstørrelsen og veksten
Veksten kommer fra flere kanter. Hugging Face rapporterer at plattformen i 2025 har 13 millioner brukere, 2 millioner offentlige modeller og 500 000 offentlige datasett. Konsentrasjonen er sterk: de 200 mest nedlastede modellene utgjør 49,6% av alle nedlastinger. 30% av Fortune 500-selskaper har verifiserte kontoer på plattformen, ifølge samme kilde.
| Datapunkt | Verdi | Kilde |
|---|---|---|
| Brukere på Hugging Face | 13 millioner | Hugging Face 2026 |
| Offentlige modeller | 2 millioner | Hugging Face 2026 |
| Offentlige datasett | 500 000 | Hugging Face 2026 |
| Andel av Fortune 500 med konto | 30% | Hugging Face 2026 |
| Robotics-datasett 2024 til 2025 | 1 145 til 26 991 | Hugging Face 2026 |
| Markedsverdi 2025 | $19,05 milliarder | Research and Markets |
| Markedsverdi 2030 | $50,03 milliarder | Research and Markets |
Kina mot USA og hva Norge ser
Maktbalansen er i bevegelse. Ifølge Hugging Face har Kina passert USA i månedlige og totale nedlastinger, og kinesiske modeller utgjør 41% av nedlastingene det siste året. Alibaba har flere derivatmodeller enn Google og Meta til sammen, og Qwen-familien alene har 113 000 derivatmodeller.
Industriens andel av utviklingen falt fra 70% før 2022 til 37% i 2025 ifølge samme kilde, mens akademia, individuelle utviklere og myndighetsorganer har vokst som bidragsytere. Hvis du vil forstå hvorfor dette ikke nødvendigvis er dårlig for Norge, har vi skrevet om DeepSeek og kinesisk åpen modell-utvikling i en egen artikkel.
Hva norske bedrifter ser i tallene
For SMB-er er signalet at åpne modeller ikke lenger er marginale. Ifølge State of Open Source 2026 oppgir 63% av organisasjoner i EU og Storbritannia leverandørlåsning som primær motivator, mot 51% i Nord-Amerika. 98% av organisasjoner økte eller opprettholdt OSS-forbruket det siste året, og kun 2% rapporterte nedgang. Det er ikke et nisjefenomen lenger. Veksten i bredden gir også sterkere komponenter, flere fellesskap og raskere oppdateringssykler.
Kostnad sammenlignet med skybaserte alternativer
Den fristende sammenligningen er null kroner per token mot dyre API-kall. Det er feil sammenligning. Lokal kjøring har faste kostnader, og skyen har skalerbare. Riktig sammenligning er total cost of ownership over en realistisk pilotperiode.
La oss ta hver side for seg.
Total cost of ownership for lokal kjøring
Lokal Gemma 4 12B krever en laptop med 16 GB RAM, et lokalt inferens-verktøy, tid fra en utvikler til oppsett, og en vedlikeholdsplan. Hvis maskinen finnes allerede, er marginal kapitalkostnad null. Hvis ikke, snakker vi typisk om en standard bedriftslaptop. Driftstiden inkluderer modelloppdateringer, sikkerhetsovervåking og verifisering at brukerne får riktig kvalitet over tid. Det er disse postene som ofte undervurderes når lokale piloter planlegges.
Skypriser i 2026
For sammenligning, her er hva proprietære og åpne modeller koster over API. En oversikt på r/LLMDevs dokumenterer at åpne modeller er 5-10x billigere enn OpenAI per token. Vi har skrevet mer om hvorfor kinesiske åpen-modell-leverandører som DeepSeek har endret prisstrukturen for norske kjøpere.
| Modell | Input ($/M tokens) | Output ($/M tokens) | Kilde |
|---|---|---|---|
| GPT-4o | $2,50 | $10,00 | r/LLMDevs |
| GPT-4.1 | $2,00 | $8,00 | r/LLMDevs |
| DeepSeek-V3.2 | $0,26 | $0,38 | r/LLMDevs |
| DeepSeek-V3 (SiliconFlow) | $0,27 | $1,13 | SiliconFlow |
| Qwen3.5-27B | $0,26 | $2,60 | r/LLMDevs |
| Qwen3.5-9B | $0,04 | $0,20 | r/LLMDevs |
| MiniMax-M2.5 | $0,27 | $0,95 | r/LLMDevs |
Vedlikeholdsbyrden er den skjulte posten
Tabellen viser at åpne modeller koster en brøkdel av lukkede modeller per token over API. For lokal Gemma 4 12B er kostnaden per token strengt tatt strøm og slitasje på maskinvaren. Spørsmålet er om volumet rettferdiggjør de faste kostnadene, og om du har tid og kompetanse til vedlikeholdet.
Du betaler skyen for å slippe vedlikeholdsbyrden. Du betaler lokalt med tid og kompetanse. State of Open Source 2026 dokumenterer at 60% av store foretak (5000+ ansatte) prioriterer vedlikehold, produksjonsproblemer og feilrettinger fremfor utvikling av nye funksjoner. SMB-er har enda mindre slakke i staben. Vurder realistisk hvilken tid du har før du forplikter deg til en lokal stack.
AI Act og unntaket for åpne modeller
EU AI Act trådte ifølge Linux Foundation Europe i kraft 1. august 2024, og implementeres i faser frem til 2. august 2027. Mange tror at fordi de bruker en åpen modell, slipper de hele regelverket. Det stemmer ikke. Alura mener at åpen lisens ikke fritar fra ansvar under AI Act, særlig når bruken er kommersiell eller berører høyrisikoområder.
Vi tar deg gjennom hva som faktisk gjelder.
Hva åpen lisens fritar deg fra
Ifølge EOLE 2024-gjennomgangen gjelder AI Act ikke for AI-systemer utgitt under frie og åpne lisenser, med mindre de er høyrisiko eller faller under Artikkel 5 eller 50. Linux Foundation bemerker at unntaket i Artikkel 2(12) gjelder kun AI-systemer med minimal eller ingen risiko. Med andre ord: unntakene er ikke blankofullmakter, ifølge samme kilde. En bredere gjennomgang av regulatorisk landskap bekrefter at EU-rammeverket gir åpne modeller noen unntak, men ikke for foundation-modeller eller monetisert programvare.
Hva det IKKE fritar deg fra
Hvis du bruker en åpen modell i en høyrisikoapplikasjon, gjelder de samme reglene som for proprietære modeller. Forpliktelser for leverandører av GPAI-modeller (General Purpose AI) gjelder fra 2. august 2025 ifølge Linux Foundation Europe. GPAI-modeller med systemrisiko defineres ved treningsberegning over 10^25 FLOPs. Per februar 2025 oversteg 25 modeller globalt denne terskelen.
Gemma 4 12B er ikke i den klassen, men leverandører av slike modeller får forpliktelser uavhengig av åpen lisens. Maksimal bot er €35 millioner for forbudte praksiser, ifølge samme kilde. EU-kommisjonens endelige Code of Practice ble publisert 2. mai 2025, og åpen-kildekode-utviklere oppfordres til å følge den.
CRA og produktansvar
EUs Cyber Resilience Act (CRA) er den andre regelmaskinen norske bedrifter må kjenne til. Ifølge EOLE 2024 gjelder CRA for produkter med digitale elementer som gjøres tilgjengelig på markedet, begrenset til versjoner brukt i kommersiell aktivitet. Maksimal bot er €15 millioner eller 2,5% av årlig omsetning. Tilpasningstiden er 24 til 36 måneder etter ikrafttredelse. Hvis du integrerer Gemma 4 12B i et produkt du selger, har du forpliktelser under CRA, ikke bare under AI Act.
Hva som skjer hvis modellen brukes til høyrisiko
EU-kommisjonens retningslinjer for høyrisiko AI-systemer hadde frist 2. februar 2026 ifølge Linux Foundation Europe. Hvis du planlegger å bruke en lokal modell i kreditt-scoring, ansettelsesbeslutninger, helsevurderinger eller andre høyrisikoområder, er det din egen advokat du må snakke med før piloten starter. For mer kontekst om hvordan AI-juss treffer norske bedrifter, se vår gjennomgang av AI og opphavsrett i Norge.
Sikkerhet og oppdateringer er ditt ansvar
Når du laster ned vekter og kjører dem lokalt, har du tatt over en del av leverandørens tidligere rolle: vedlikehold, sikkerhetsoppdateringer og kontroll. Forskning dokumentert på LessWrong viser at safety-fine-tuning kan fjernes fra Llama 2-Chat 13B for $200. Det betyr at åpne modeller kan modifiseres på måter den opprinnelige utgiveren ikke ønsker, og dette er offentlig tilgjengelig informasjon både du og angripere kjenner til.
Det er ikke et argument mot å bruke åpne modeller. Det er et argument for å håndtere dem voksent.
CVE-håndtering for AI-modeller
Tradisjonell sårbarhetshåndtering er en sliten praksis i mange organisasjoner. State of Open Source 2026 dokumenterer at 20% av organisasjoner ikke har noen spesifikk prosess for å respondere på CVE-er, og 39% av store foretak sliter med å møte interne SLA-er for sårbarhetsremediering. 55% av organisasjoner som strøk på en compliance-revisjon i fjor har EOL open source-programvare i stablene sine. For AI-modeller er disse prosessene ennå ikke modne i de fleste SMB-er. Du må bygge dem.
Datadisiplin og personopplysninger
Lokal kjøring betyr ikke automatisk GDPR-compliance. Hvis du sender personopplysninger inn i modellen, har du fortsatt et behandlingsgrunnlag og en dataflyt å dokumentere. Fordelen er at dataene ikke forlater bedriften. Begrensningen er at du fortsatt må vite hvor de er, hvem som har tilgang og hvor lenge de oppbevares. For mer praktisk veiledning, se vår analyse av privacy-first AI for norske selskaper.
Når vekter blir foreldet
Hugging Face dokumenterer at gjennomsnittlig engasjementstid for åpne modeller er 6 uker. Det er ikke at modellen blir ubrukelig etter 6 uker, men at fellesskapet flytter oppmerksomhet videre. Du må ha en plan for å oppgradere når en ny versjon kommer, og en plan for hva du gjør hvis utvikleren slutter å publisere oppdateringer.
31% av enterprise Java-team bruker bare 10-25% av tiden på nye funksjonaliteter ifølge samme rapport. Vedlikehold spiser tid, og lokal AI gir deg en ny portefølje å holde oppdatert. Planlegg for det fra dag en.
Vanlige feil ved første lokale AI-pilot
Vi ser tre fallgruver gå igjen når SMB-er forsøker en første lokal pilot. Ingen er fatale, men alle koster tid og tillit hvis du går i dem.
Velge modell på parametertall alene
Det er fristende å tro at flere parametere alltid er bedre. Det stemmer ikke. Google DeepMind rapporterer at Gemma 4 12B leverer ytelse nær den større 26B MoE-modellen med vesentlig lavere minneforbruk. Kilo dokumenterer at Qwen3.6-27B er en tett 27B-modell som slår den mye større Qwen3.5-397B-A17B MoE på agentisk koding. Arkitektur, treningsdata og inferensoppsett betyr ofte mer enn parametertall.
Glemme RAG-pipelinen
Modellen alene er ikke svaret. Den må kobles til bedriftens egne dokumenter, og kvaliteten på koblingen er like viktig som modellen selv. I lokale piloter undervurderes RAG-arbeidet konsekvent. Du trenger en vektordatabase, en god chunking-strategi for dokumenter, og evalueringsdata som forteller deg om modellen faktisk treffer riktig informasjon. Hvis du vil se hvordan dette ligger i en bredere sammenheng, har vår oversikt over Edge AI og IoT relevante mønstre.
Ikke ha en avviklingsplan
Hva gjør du hvis modellen ikke fungerer? Hvis Google slutter å publisere oppdateringer? Hvis en sårbarhet oppdages? Mange piloter starter uten et tydelig svar. Du må bestemme på forhånd hvilket signal som utløser avvikling og hvor du flytter arbeidsflyten hen. 6 ukers engasjementstid ifølge Hugging Face er ikke selve modellen som dør, men fellesskapets oppmerksomhet. Det betyr at langsiktig støtte er ditt eget ansvar.
Vanlige spørsmål om Gemma 4 12B
Spørsmål vi får oftest fra norske SMB-er som vurderer Gemma 4 12B.
Hvor mye RAM trenger jeg egentlig?
Den offisielle terskelen er 16 GB, bekreftet av VentureBeat, Google DeepMind, Ars Technica og YouTube-testere. Modellvektene tar 18 GB i disk. Hvis du har 16 GB RAM, vil maskinen være travel og du må passe på hva annet som kjører samtidig. 24 GB eller mer gir komfortabel margin.
Hva er forskjellen på Gemma 4 12B og 31B?
Begge har 256K-token kontekstvindu ifølge BentoML. Begge er pretrent på over 100 språk. Hovedforskjellen er størrelsen og dermed maskinvarekravene. 31B krever serverklasse maskinvare, 12B kjører på en laptop. For SMB-er som vil starte uten infrastrukturinvestering, er 12B den eneste praktiske døren inn.
Kan jeg bruke Gemma 4 12B kommersielt?
Gemma har egne lisensvilkår, ikke en standard åpen kildekode-lisens i den klassiske forstanden. Det er forskjellig fra noen alternativer. Fireworks AI bemerker at Qwen3 VL 235B har Apache 2.0-lisens uten kommersielle restriksjoner, mens Gemma-lisensen har visse vilkår om akseptabel bruk. Sjekk lisensen før du integrerer modellen i et produkt du selger. En generell forklaring av åpne modeller peker også på at åpen kildekode-vekter ikke alltid kommer med samme rettigheter som tradisjonell åpen kildekode-programvare.
Hvor godt fungerer modellen på norsk?
Modellen støtter 140 språk ifølge en YouTube-gjennomgang og er pretrent på over 100 språk ifølge BentoML. Norsk er inkludert i praksis, men kvaliteten er ujevn. For sensitive eller publiseringsklare tekster bør du fortsatt verifisere manuelt eller bruke en større modell over API for siste runde.
Bør jeg fortsatt bruke OpenAI eller Claude?
Det er sjelden et enten-eller. Frontier-modeller har ytelsesfortrinn for komplekse oppgaver. Reddit-gjennomgangen noterer at DeepSeek-V3.2 oppnår GPT-5-klasse ytelse med 671 milliarder parametere, men dette er åpne modeller i stor størrelse, ikke det du kjører lokalt. For raske, sensitive, høyfrekvente interne oppgaver er Gemma 4 12B sterk. For lange resonnementer, frontier-koding og elastisk last er sky fortsatt riktig. Vår oversikt over LLM-valg for norske bedrifter går nærmere inn på avveiningene.
Hva med GLM-5 og Kimi K2?
Disse er åpne, men mye større. Fireworks rapporterer at GLM-5 har 128 000 output-tokens per pass, det største i deres oversikt. Kimi K2 Thinking utfører 200-300 sekvensielle verktøykall uten tap av sammenheng. BentoML bekrefter at Kimi-K2.6 har 256K-token kontekstvindu. Begge krever serverklasse maskinvare og er fjernt fra kjøres-på-en-laptop-segmentet Gemma 4 12B treffer.
Oppsummering og veien videre
Gemma 4 12B er ikke et gjennombrudd. Den er en presisering av hvor terskelen for lokal AI ligger i 2026, og hvor mye en SMB realistisk kan få ut av et eksisterende minneklasse-utvalg.
Hovedpunktene
Modellen kjører på 16 GB RAM, har 256K kontekstvindu, håndterer lyd opp til 30 sekunder og video opp til 60 sekunder. Den ligger i et marked verdt $23,08 milliarder i 2026 ifølge Research and Markets, og som forventes å nå $50,03 milliarder innen 2030. AI Act treffer deg uavhengig av om modellen er åpen, hvis bruken faller under høyrisikoområder ifølge Linux Foundation Europe. Vedlikehold, oppdateringer og sårbarhetshåndtering er ditt ansvar.
Hvor du starter på mandag
Velg en konkret intern oppgave. Last ned modellen og verifiser at den kjører på en eksisterende laptop. Lag en RAG-pipeline mot et avgrenset dokumentarkiv. Definer suksesskriterier før du tester. Hold piloten i en lukket gruppe i de første ukene. Bestem på forhånd hvilket signal som utløser overgang til produksjon eller avvikling, og hvem som eier den beslutningen. For en bredere ramme rundt modellvalget, se vår gjennomgang av LLM-valg for norske bedrifter.
I Alura bygger vi AI-infrastruktur for norske virksomheter, fra dataplattformer til agentiske systemer i produksjon. Vi er ikke en SaaS-leverandør. Vi er håndverkere som setter sammen byggesteinene som faktisk fungerer for din situasjon.
Bestill en arkitektur-samtale: vi går gjennom din nåværende infrastruktur, identifiserer integrasjonspunkter, og foreslår en pragmatisk vei videre. Uforpliktende, 45 minutter.
Alura
Praktisk kunnskap om AI-automatisering og effektivisering for norske bedrifter.
Les neste
Open source AI kutter prisen men krever teknisk kompetanse
Tencent slapp nettopp Hy3, en 295B-modell gratis under Apache 2.0. Men lav lisenspris er ikke lav totalkostnad. Slik vurderer en norsk SMB om open source AI faktisk lønner seg.
Komprimerte AI-modeller kjører lokalt på en 24GB GPU
Kvantisering krymper en 80GB-modell til 20GB og lar den kjøre på et forbruker-GPU. Vi forklarer hva det betyr for norske SMB-er som vurderer lokal AI.
DiffusionGemma firedobler hastigheten på lokal AI
Google DiffusionGemma genererer tekst opp til fire ganger raskere enn autoregressive modeller og kjører på en RTX 5090. Her er hva norske SMB-er bør vurdere før de flytter AI lokalt.
AI-kodeagenter kan laste opp hele Git-repoet ditt til skyen
Grok-verktøyet lastet opp hele mapper til skyen. Her er hva norske SMB-er bør sjekke før en AI-kodeagent får tilgang til Git-repoene deres.