24 min

    Fire spørsmål om treningsdata før du signerer AI-avtalen

    Usensurerte rettsdokumenter mot OpenAI og Microsoft viser 91 692 kopier av vernede verk i ett datasett. Her er spørsmålene norske SMB-er bør stille AI-leverandøren sin.

    Juss & Governanceinnsyn i treningsdataAI Act norske bedrifteropphavsrett og AI-modellerTDM-unntak opphavsrettkrav til AI-leverandørAI-anskaffelse sjekkliste
    Fire spørsmål om treningsdata før du signerer AI-avtalen

    Nøkkelpunkter per 23. september 2026:

    • Innsyn i treningsdata hører hjemme i kontrakten. Usensurerte rettsdokumenter beskriver over 91 692 kopier av verk fra tre nyhetsforlag i OpenAIs mellomtreningsdatasett (TechCrunch).
    • AI Act fases inn trinnvis. Loven trådte i kraft 1. august 2024, med 12 måneder til generelle AI-forpliktelser og 24 måneder til høyrisikosystemer (OpenAI).
    • Trening er lovlig som standard i EU med mindre rettighetshaver reserverer seg maskinlesbart, men ingen taggingsprotokoll sporer duplikater pålitelig (arXiv).
    • Ansvaret legges på styre og ledelse. De første bestemmelsene traff norske virksomheter fra februar 2025, og kravsettene fases inn gjennom 2026 (Digi.no).
    • Åpenhetskravene strammes utenfor EU først. California AB 412 gir rettighetshavere 30 dagers svarfrist på innsyn i opphavsrettsbeskyttet treningsmateriale (arXiv).

    Hva treningsdata er, og hvorfor opphavsretten er uavklart

    Når en leverandør skriver at modellen er «trent på et bredt utvalg offentlig tilgjengelige data», har du fått en formulering og ikke et svar. Treningsdata er materialet modellen har lest for å lære språk, mønstre og faktakunnskap. Det er laget i leveransen du har minst innsyn i, og samtidig det laget som bærer mest juridisk usikkerhet. Forskjellen mellom en gjennomtenkt og en naiv AI-anskaffelse ligger ofte i om noen i det hele tatt stilte spørsmålet.

    Europaparlamentets juridiske komite bestilte i 2025 en studie av hvordan generativ AI utfordrer europeisk opphavsrett. Den konkluderer med at dagens unntak ikke er bygget for storskala modelltrening, og at uteblitt reform gir rettslig usikkerhet, markedskonsentrasjon og kulturell homogenisering (EU-kommisjonen, 2025). Det er ikke en fotnote for jurister. Det er en risikofaktor du kjøper inn i.

    Treningsdata, finjusteringsdata og kontekstdata

    Tre datalag blandes systematisk i salgssamtaler, og forvirringen er kostbar. Treningsdata er det grunnmodellen er bygget på, og det kontrollerer du ikke. Finjusteringsdata er materiale brukt til å spesialisere modellen mot en oppgave. Kontekstdata er dine egne dokumenter som hentes inn ved hvert enkelt svar, typisk i et RAG-oppsett. Mange leverandører svarer på spørsmål om lag en ved å beskrive lag tre.

    DatalagHva det erHvem kontrollerer detDitt innsyn
    TreningsdataMaterialet grunnmodellen er bygget påModelleverandørenNesten ingen uten kontraktfestet krav
    FinjusteringsdataData brukt til å spesialisere modellen mot en oppgaveLeverandør eller integratorDelvis, avhenger av avtalen
    KontekstdataEgne dokumenter modellen henter fra ved hvert svarDin bedriftFullt, dette er dine egne systemer

    Poenget med inndelingen er praktisk. Du kan styre lag to og tre med interne rutiner. Lag en kan du bare styre gjennom kontrakten, og derfor må spørsmålene stilles før signering og ikke etter.

    Hvorfor uavklart opphavsrett blir kjøperens problem

    Et opphavsrettskrav rettes normalt mot den som har kopiert. Men når en modell er vevd inn i kundeservice, saksbehandling eller produktutvikling, er det kjøperen som må håndtere konsekvensene av at leveransen stopper, endres eller må skiftes ut. En modell som må trekkes fra markedet, eller retrenes uten et omstridt datasett, er en driftsrisiko uansett hvem som taper rettssaken.

    Studien fra Europaparlamentet beskriver et verdigap mellom skapere og AI-utviklere, og argumenterer for en lovfestet godtgjørelsesordning for å tette det (EU-kommisjonen, 2025). Hvis en slik ordning kommer, blir den en kostnad et sted i verdikjeden. Prisen på modellen du kjøper i dag reflekterer ikke nødvendigvis den kostnaden.

    Europa har ikke landet svaret

    Opphavsrett er harmonisert i EU på papiret, men praktiseres i 27 medlemsstater med egne nasjonale lover (EU-kommisjonen, 2025). Studien beskriver fragmentert styring på tvers av institusjoner og etterlyser mer koherente, tverrsektorielle svar. For en norsk kjøper betyr det at rettstilstanden kan bli tydeligere, men ikke raskt.

    Studien foreslår blant annet en ekspertgruppe på høyt nivå med seks måneders mandat, og skisserer scenarier for europeisk opphavsrettsstyring fram mot 2030. Det er tidshorisonten. Avtalen du signerer i høst vil sannsynligvis reforhandles minst en gang før regelverket har satt seg.

    Microsoft-saken: hva de usensurerte dokumentene viser

    The New York Times saksøkte OpenAI og Microsoft for direkte opphavsrettskrenkelse i desember 2023 (arXiv). Saken ble lenge fulgt som en prinsippsak om amerikansk fair use. Da deler av saksdokumentene ble offentliggjort uten sladd, endret den karakter: den ble et innsyn i hvordan store treningsdatasett faktisk ble satt sammen, beskrevet av folk som satt tett på arbeidet.

    Juridiske dokumenter og spørsmål om AI-treningsdata og opphavsrett
    Juridiske dokumenter og spørsmål om AI-treningsdata og opphavsrett. Foto: Kampus Production / Pexels

    Dette er partsinnlegg i en amerikansk rettssak, ikke rettskraftige funn. Les dem deretter. Men de er det mest detaljerte offentlige materialet som finnes om praksisen, og de forklarer hvorfor spørsmål om treningsdata ikke lenger kan avfeies som teoretiske.

    Det lederne skrev internt

    Ifølge søksmålet beskrev en toppleder i Microsoft selskapenes AI-treningspraksis som «tyveri», omtalt i dokumentene som den største arbeidstyveri-operasjonen i menneskehetens historie (TechCrunch). Et internt Microsoft-dokument beskriver en «reell risiko» for at generativ AI kan forstyrre sysselsettingen til dem som produserte treningsdataene. Notatene knyttes til januar 2023 og en intern presentasjon i januar 2024.

    Fra OpenAI-siden skal ChatGPT-sjef Nick Turley internt ha skrevet at forlag står overfor en «eksistensiell trussel» fra produkter som chatboten (TechCrunch). Det er verdt å merke hvem som sier det. Dette er ikke kritikere utenfra, det er interne vurderinger fra selskapene som bygget modellene.

    Omfanget i tall

    Dokumentene beskriver at OpenAIs mellomtreningsdatasett alene inneholdt mer enn 91 692 kopier av verk fra The New York Times, Daily News og Center for Investigative Reporting. Et Common Crawl-basert datasett skal ha inneholdt rundt 2 millioner dokumenter fra nytimes.com, og treningsdatasettet kalt Project Mango skal ha omfattet 160 903 unike verk fra nyhetsforlag (TechCrunch).

    Skalaen er vanskelig å forestille seg. I søksmålet beskrives det aktuelle treningsdatasettet som tilsvarende et tekstdokument på over 3,7 milliarder sider (arXiv). Når datamengden er så stor, er det ingen som kan svare presist på hva som ligger inne uten systematisk dokumentasjon fra innsamlingstidspunktet. Det er nettopp derfor spørsmål nummer en i denne artikkelen handler om dokumentasjon og ikke om intensjon.

    Nadella om betalingsmurer

    Dokumentene beskriver at selskapene omgikk betalingsmurer, bygde treningsdatasett via massiv skraping og fjernet opphavsrettsmerknader. Samtidig forklarte Microsoft-sjef Satya Nadella i en deponering at alt som ligger bak betalingsmur, bør lisensieres av enhver som vil bruke det til trening (TechCrunch). Avstanden mellom prinsippet og praksisen er sakens kjerne.

    Alura mener rettssakene i USA ikke endrer norsk lov, men de endrer hva en kjøper med rimelighet kan kreve å få vite. En leverandør kan ikke lenger si at spørsmålet om datakilder er umulig å besvare, når konkurrenters interne dokumentasjon nå er offentlig i detalj. Terskelen for hva som regnes som et akseptabelt svar har flyttet seg.


    Les også: Valg av AI-leverandør – Kriterier og fallgruver for norske bedrifter. Norge har over 350 AI-selskaper å velge mellom.


    TDM-unntaket i CDSM artikkel 4 og retten til å reservere seg

    Mye av den norske debatten forutsetter at AI-trening på opphavsrettsbeskyttet materiale er ulovlig i Europa. Utgangspunktet er det motsatte. Artikkel 4 i CDSM-direktivet gir et unntak for tekst- og datautvinning som tillater bruk av opphavsrettsbeskyttet innhold, med mindre rettighetshaveren har reservert seg (EU-kommisjonen, 2025).

    Det er en opt-out-modell, ikke en opt-in-modell. Forskjellen betyr alt for hvordan du vurderer et leverandørsvar.

    Hovedregelen er lovlig bruk med opt-out

    EUs regelverk tillater AI-trening på opphavsrettsbeskyttet innhold som standard, med mindre rettighetshavere aktivt reserverer seg gjennom maskinlesbare midler (arXiv). En leverandør som sier «vi trener bare på lovlig tilgjengelig materiale» kan derfor ha rett i en formell forstand og likevel ikke ha svart på noe som helst.

    Det operative spørsmålet er ikke om trening er tillatt. Det er om leverandøren faktisk registrerte og respekterte reservasjoner på innsamlingstidspunktet, og om de kan vise hvordan.

    Opt-out som ikke virker i praksis

    Reservasjonsretten forutsetter en teknisk mekanisme som fungerer. Den finnes ikke i moden form. Ingen nåværende taggingsprotokoll kan pålitelig spore duplikater eller håndtere utviklende utvinningsmetoder (EU-kommisjonen, 2025). Et verk som er reservert på originalnettstedet, kan ligge ureservert i en kopi et annet sted.

    Konsekvensen er at selv en leverandør med god vilje ikke kan garantere fullstendig etterlevelse av opt-out. Det gjør det viktigere å vite hvilken metode de bruker, hvor ofte den oppdateres, og hva som skjer når en rettighetshaver melder fra i ettertid. Studien fra Europaparlamentet konkluderer for øvrig med at dagens TDM-unntak ikke er designet for generativ AI-trening og risikerer å forvrenge formålet med opphavsrettsunntak.

    Hva Europaparlamentets studie foreslår

    Studien fra juli 2025 lander på fem hovedfunn og foreslår målrettede reformer: forhåndsgodkjenning for visse bruksformer, harmoniserte opt-out-mekanismer, åpenhetskrav og rimelige lisensieringsmodeller (EU-kommisjonen, 2025). Ingen av disse er vedtatt. Alle er retningsgivende for hvor reguleringen beveger seg.

    For en kjøper er dette et argument for fleksibilitet i avtaleverket. Hvis åpenhetskrav og lisensieringsplikt strammes inn i løpet av avtaleperioden, vil du vite om leverandøren kan levere dokumentasjonen uten reforhandling, og hvem som betaler hvis de ikke kan.

    Fire spørsmål du stiller AI-leverandøren før signering

    Alura mener innsyn i treningsdata hører hjemme i kontrakten, ikke i leverandørens markedsmateriell. En compliance-side kan endres uten varsel. En kontraktsklausul kan ikke. Det er hele forskjellen mellom en påstand og en forpliktelse.

    Spørsmålene under er formulert så de kan besvares skriftlig og legges ved avtalen. De er ikke juridisk rådgivning, men en innkjøpsstruktur. Bruk dem sammen med de øvrige kriteriene for leverandørvalg, og still dem tidlig nok til at svarene faktisk kan påvirke prisen.

    Spørsmål 1: Hvilke datakilder er modellen trent på, og hvordan er de dokumentert?

    Du spør ikke etter en fullstendig liste over hvert dokument, for den finnes sannsynligvis ikke i brukbar form. Du spør etter kategorisert oversikt med lisensstatus: hvilke hovedkilder inngår, hvilke er lisensiert, hvilke er skrapet fra åpent nett, hvilke er kjøpt inn fra tredjepart. Be om formatet dokumentasjonen foreligger i, og om den oppdateres ved nye modellversjoner.

    Et godt svar er spesifikt og kjedelig. Et dårlig svar er generisk og entusiastisk. Formuleringen «offentlig tilgjengelige data» forteller deg ingenting om lisensstatus, for offentlig tilgjengelig og fritt anvendelig er to forskjellige ting. Det var nettopp denne distinksjonen Nadella-deponeringen handlet om.

    Spørsmål 2: Hvordan er reservasjoner fra rettighetshavere håndtert?

    Dette er spørsmålet som går rett på artikkel 4. Be leverandøren beskrive hvilken maskinlesbar mekanisme de respekterer, hvor ofte den kontrolleres, og hva rutinen er når en rettighetshaver melder fra etter at treningen er gjennomført. Be også om å få vite om de bruker eller har vurdert mekanismer som pay-per-crawl eller verktøy som Have I Been Trained (arXiv).

    Svaret «vi følger bransjestandard» er ikke et svar, fordi det ikke finnes en bransjestandard som fungerer på tvers av duplikater. Et leverandørsvar som beskriver en konkret, etterprøvbar rutine er verdt mer enn et som lover full etterlevelse.

    Spørsmål 3: Hvem bærer risikoen hvis et krav kommer?

    Flere store leverandører markedsfører ansvarsdekning for opphavsrettskrav knyttet til utdata fra modellene. Spørsmålet er hva dekningen faktisk omfatter. Be om det skriftlige vilkårsdokumentet, ikke nettsideteksten, og se spesielt etter beløpstak, unntak ved egen finjustering, unntak ved bruk av åpne modeller og krav til at du har brukt innebygde filtre.

    Be i tillegg om en prosessbeskrivelse: hvem varsler hvem, innen hvilken frist, og hvem styrer forsvaret hvis et krav kommer. En dekning uten prosess er en forsikring du ikke vet hvordan du utløser.

    Spørsmål 4: Brukes våre data til videre trening?

    Dette er spørsmålet flest norske virksomheter tror de har svar på, og færrest har dokumentert. Skill mellom trening, logging og menneskelig gjennomgang for kvalitetssikring. De tre har ulike personvernkonsekvenser, og et nei til det første er ikke automatisk et nei til det andre og tredje.

    Be om at nei til trening på kundedata står som standardinnstilling i avtalen, ikke som en bryter noen må huske å slå på i et administrasjonspanel. Erfaringene fra Samsungs ChatGPT-utrulling handler i kjernen om det samme: data som forlater bedriften gjør det oftest fordi ingen definerte grensen tydelig nok.

    Slik scorer du svarene

    SpørsmålGodt svarRødt flaggHva du kontraktsfester
    1. DatakilderKategorisert oversikt med lisensstatus per kilde«Offentlig tilgjengelige data»Rett til oppdatert dokumentasjon ved forespørsel
    2. ReservasjonerBeskrevet metode for maskinlesbar opt-out«Vi følger bransjestandard»Varslingsplikt ved endret praksis
    3. AnsvarVilkårsdokument med tak og unntak listetDekning omtalt kun på nettsidenAnsvarsklausul med definert varslingsprosess
    4. Egne dataNei til trening som standard i avtalenOpt-out som må aktiveres manueltForbud mot trening på kundedata

    Alura mener at et leverandørsvar som ikke kan dokumenteres, bør behandles som et åpent risikopunkt i anskaffelsen. Ikke som en showstopper, og ikke som et ikke-problem. Det betyr at punktet føres i risikoregisteret, får en eier i ledergruppen og en dato for ny vurdering. Da blir det en beslutning styret har tatt bevisst, ikke en forglemmelse noen oppdager i ettertid.

    Leverandør eller distributør: hvor AI Act plasserer bedriften din

    AI Act skiller mellom leverandører og distributører av AI-systemer. Leverandører utvikler systemet, distributører bruker det i egne applikasjoner (OpenAI). Skillet avgjør hvilke plikter som treffer deg, og det er det første punktet i enhver seriøs AI-anskaffelse.

    Alura mener de fleste norske SMB-er er distributører og ikke leverandører under AI Act, men at ansvaret uansett ligger hos styre og ledelse. Rollen din bestemmer omfanget av dokumentasjonskravene. Den fjerner ikke ansvaret for at systemet brukes forsvarlig.

    Skillet i korte trekk

    DimensjonLeverandørDistributør
    Typisk rolleUtvikler systemet og setter det på markedetBruker systemet i egen virksomhet
    Typisk norsk SMBSjelden, men mulig ved egen produktutviklingVanligste plassering
    HovedpliktTeknisk dokumentasjon og samsvar før lanseringBruk i tråd med instruksjoner og menneskelig oversyn
    Hva du må kunne viseHvordan systemet er bygget og testetHvor systemet brukes og hvem som eier ansvaret

    Grensen er ikke statisk. Bygger du et eget produkt oppå en tredjepartsmodell og selger det videre under eget navn, bør plasseringen vurderes juridisk og ikke antas. Det er en konkret vurdering som koster lite å gjøre tidlig og mye å gjøre for sent.

    Ekstraterritoriell rekkevidde

    Et vanlig argument i norske ledergrupper er at leverandøren sitter i USA, og at EU-regelverket derfor er deres problem. Det stemmer ikke. AI Act har ekstraterritoriell rekkevidde og gjelder også selskaper etablert utenfor EU under visse betingelser (OpenAI).

    Rekkevidden går også andre veien: ikke-EU-selskaper må forholde seg til kravene i EUs atferdskodeks for generell AI for å få tilgang til EU-markedet (arXiv). Det er faktisk en fordel for deg som kjøper. Markedsadgangen gir leverandøren en grunn til å produsere dokumentasjonen du ber om.

    Ansvaret ligger hos styre og ledelse

    AI Act er den første europeiske reguleringen som definerer AI-systemer og bruken av dem, med forbud mot visse bruksområder og krav til både utviklere og brukere (Digi.no). Ansvaret for AI-systemene legges direkte på styre og ledelse, og brudd kan føre til sanksjoner.

    Det stilles også krav til AI-forståelse hos utviklere, brukere og beslutningstakere. I praksis betyr det at «IT tar seg av det» ikke er en holdbar ansvarsplassering. Et styre som ikke kan forklare hvilke AI-systemer virksomheten bruker, hvor de brukes og hvem som har oversyn, har en dokumentasjonsjobb foran seg.

    Tidslinjen for AI Act og hva som gjelder fra når

    AI Act trådte i kraft 1. august 2024, 20 dager etter publisering i EUs offisielle tidsskrift (OpenAI). Pliktene kommer ikke samtidig. De fases inn i trinn, og hvert trinn måles fra ikrafttredelsesdatoen.

    TrinnTidspunktHva det betyr for deg
    Ikrafttredelse1. august 2024, 20 dager etter publiseringKlokken begynner å gå for alle frister under
    Forbudt praksis6 måneder etter ikrafttredelseVisse bruksområder er ulovlige uansett bransje
    Atferdskodekser ferdigstilt9 måneder etter ikrafttredelseRammene for hva leverandører skal dokumentere
    Generelle AI-forpliktelser12 måneder etter ikrafttredelseKrav til modellene de fleste SMB-er kjøper
    Høyrisikosystemer24 måneder etter ikrafttredelseTyngste dokumentasjonskrav slår inn
    Eksisterende GPAI og store IT-systemer36 måneder etter ikrafttredelseLengre overgang for det som allerede er i drift

    Terskelen for systemisk risiko

    Regelverket bruker en teknisk terskel for å skille ut modeller med systemisk risiko: beregningsmengde over 10^25 FLOPs under trening (OpenAI). Modeller over terskelen får strengere forpliktelser enn resten.

    Dette er relevant for deg av en enkel grunn. De fleste kjente generelle språkmodellene på markedet ligger i sjiktet der spørsmålet er aktuelt. Det gir deg et konkret spørsmål å stille: hvilken kategori faller modellen vi kjøper inn i, og hvilke forpliktelser følger med?

    Det norske bildet er ikke ferdig tegnet

    De første bestemmelsene i AI-regelverket trådte i kraft i februar 2025, og EUs implementering av kravsettene fortsetter gjennom 2026 (Digi.no). Norge er i en tidlig fase, og det er fortsatt under arbeid hvilken norsk myndighet som skal ha hovedansvaret for kontroll av AI-systemer.

    Uavklart tilsynsmyndighet er ikke det samme som uavklart plikt. Det betyr bare at du ikke vet hvem som kommer til å spørre. Virksomheter som venter med dokumentasjonen til tilsynsmodellen er på plass, gjør jobben under tidspress i stedet for i ro.

    Markedet: hva leverandørene selv publiserer om etterlevelse

    Store leverandører har begynt å publisere posisjoner om AI Act, og det er nyttig lesning. Det er også markedskommunikasjon. Skillet mellom hva som er frivillig forpliktelse og hva som er juridisk bindende overfor deg som kunde, er ikke alltid tydelig i teksten.

    Frivillige forpliktelser og atferdskodeks

    OpenAI signerte de tre kjerneforpliktelsene i EUs AI-pakt 25. september 2024, og kunngjorde senere at de ville undertegne atferdskodeksen for generell AI, med oppdatering publisert 11. juli 2025 (OpenAI). Slike signaturer er et positivt signal, men de er forpliktelser overfor EU og ikke overfor din bedrift.

    Dette er den praktiske testen: hvis leverandøren bryter en frivillig forpliktelse, har du noe kontraktsmessig å gå på? I de fleste standardavtaler er svaret nei. Det er derfor de fire spørsmålene skal ende opp som vedlegg og klausuler, ikke som skjermbilder fra et nettsted.

    Verktøyene som gir delvis innsyn

    Det finnes et voksende økosystem av teknikker for å kartlegge og filtrere treningsdata. MIT Data Provenance Initiative gjennomførte en systematisk revisjon av mer enn 1 800 tekst-datasett, og forskningslitteraturen beskriver blant annet perseptuell hashing, navnegjenkjenning, pay-per-crawl-modeller og verktøy som Have I Been Trained og InnerProbe (arXiv).

    Filtrering fungerer når den er målrettet. Anthropics klassifiserer for CBRN-innhold oppnådde en F1-score på 0,96 for å skille skadelig fra ufarlig materiale. Opphavsrettsfiltrering er en vanskeligere oppgave, fordi den krever kunnskap om rettighetsstatus og ikke bare om innholdets art. Når en leverandør sier de «filtrerer treningsdata», er oppfølgingsspørsmålet hvilket problem filteret faktisk løser.


    Les også: Det Samsungs ChatGPT-utrulling lærer norske bedrifter. Samsung Electronics ruller ut ChatGPT Enterprise og Codex til ansatte i Korea og DX-divisjonen globalt.


    Kostnadsbildet når lisensiering og dokumentasjon skal inn i budsjettet

    Prisen på en AI-leveranse er sjelden bare lisenskostnaden. Etterlevelse koster penger, og kostnaden kommer i poster som ofte mangler i tilbudet du får tilsendt. Europaparlamentets studie peker mot rimelige lisensieringsmodeller og en godtgjørelsesordning som fremtidige elementer (EU-kommisjonen, 2025). Kommer de, havner de i verdikjeden og til slutt hos sluttkunden.

    Poenget er ikke å avskrekke. Det er å budsjettere riktig, slik at prosjektet ikke stopper i måned ni fordi juristen krever en gjennomgang ingen hadde satt av penger til.

    Postene som sjelden står i tilbudet

    KostnadspostHva den dekkerNår den trefferHvem eier den
    Juridisk gjennomgangKlausuler om treningsdata, ansvar og databrukFør signeringLedelse og innkjøp
    Dokumentasjon og loggingOversikt over systemer, bruksområder og risikoklasseLøpende fra oppstartSystemeier
    KompetanseOpplæring i AI-forståelse for ansatte og beslutningstakereFørste år og deretter årligHR og ledelse
    Lisensiering av innholdRettigheter til materiale i egne data og i leverandørens leddKan komme etterskuddsvisLeverandør, men prises videre
    Exit og migreringEvnen til å bytte leverandør hvis risikobildet endrer segVed reforhandlingIT og innkjøp

    Den siste posten er den mest undervurderte. Hvis en modell må skiftes ut fordi leverandøren taper en rettssak eller trekker et produkt, er kostnaden din avhengig av hvor dypt modellen er vevd inn i prosessene. Abstraksjonslag koster litt i starten og sparer mye når noe må byttes.

    Bot-risikoen er reell

    Personvern og opphavsrett er to ulike regelverk, men håndhevingen viser samme mønster. Den italienske personvernmyndigheten Garante idømte OpenAI en bot på 15 millioner euro for brudd på GDPR (arXiv). Saken hadde bakgrunn blant annet i et datainnbrudd 20. mars 2023 som berørte 440 italienske brukere.

    Lærdommen for en norsk SMB er ikke botens størrelse, men hva som utløste den: manglende kontroll på hvilke data som ble behandlet og hvordan. Det er samme spørsmål som spørsmål fire i sjekklisten. Kontrollen på egne data er den delen av risikobildet du faktisk kan styre selv.

    Åpenhetskrav i California og Japan peker mot neste runde

    EU er ikke alene om å regulere treningsdata, og EU er heller ikke først på alle punkter. To jurisdiksjoner er verdt å følge, fordi de trekker i motsatt retning og viser hvor spennet ligger.

    California AB 412 og 30-dagersfristen

    California AB 412 fra 2025 krever at utviklere av generative AI-modeller dokumenterer opphavsrettsbeskyttet materiale brukt i trening, og at de tilbyr en offentlig mekanisme der rettighetshavere kan be om denne informasjonen med 30 dagers svarfrist (arXiv). Det er en konkret åpenhetsplikt med en klokke på.

    Hvis leverandøren din er underlagt et slikt krav i hjemmemarkedet, finnes dokumentasjonen allerede i en eller annen form. Da er spørsmålet ditt ikke om de kan lage den, men om de vil dele den med deg. Det er et forhandlingsspørsmål, ikke et teknisk.

    Japans artikkel 30-4 trekker motsatt vei

    Japans reviderte åndsverkslov, artikkel 30-4, gjeldende fra 1. januar 2019, tillater bred bruk av opphavsrettsbeskyttede verk til informasjonsanalyse inkludert AI-trening, for både kommersielle og ikke-kommersielle formål (arXiv). Der EU diskuterer innstramming, har Japan valgt åpning.

    Spriket betyr at en modell kan være trent fullt ut lovlig i en jurisdiksjon og reise spørsmål i en annen. Det er derfor spørsmålet «hvor ble modellen trent, og under hvilket regime» hører hjemme i due diligence. Forskningslitteraturen beskriver nettopp kritiske hull i håndhevingen på tvers av EU, USA og Asia-Stillehavsregionen.

    Markedsobservasjon: 93 prosent færre klikk

    Ett tall fra de usensurerte dokumentene fortjener egen oppmerksomhet, og det handler ikke om jus. Microsofts Copilot, beskrevet som en «answer engine», førte ifølge Microsofts egne data til at klikkraten for The New York Times' domene falt med opptil 93 prosent sammenlignet med tradisjonelt Bing-søk (TechCrunch).

    Det beskriver en mekanisme, ikke en enkeltsak. Når et AI-grensesnitt svarer i stedet for å henvise, forsvinner trafikken som finansierte innholdet svaret bygger på. Fenomenet har blitt omtalt som en «doom loop» for nettet (The Verge): innholdsprodusentene mister inntekt, produserer mindre, og modellene får dårligere materiale å lære av.

    For en norsk leder er dette relevant på to måter samtidig. Det forklarer hvorfor rettighetshavere presser på for lisensiering og åpenhet, og det forklarer hvorfor kostnaden sannsynligvis kommer tilbake som en lisensavgift et sted i kjeden.

    Hva det betyr hvis bedriften din lever av innhold

    Produserer dere fagartikler, produktdata, kurs eller dokumentasjon som konkurransefortrinn, er dere på samme side av bordet som forlagene. Da bør reservasjon mot tekst- og datautvinning være et bevisst valg, tatt av noen med mandat, og ikke en innstilling ingen har sett på.

    Selger dere derimot tjenester der innholdet er markedsføring, kan regnestykket gå motsatt vei. Å bli sitert av en modell kan være verdt mer enn klikket du taper. Det er en forretningsbeslutning, ikke en teknisk, og den bør tas eksplisitt fordi standardinnstillingen i EU er at materialet ditt kan brukes.

    Vanlige feil norske SMB-er gjør i AI-anskaffelser

    Feilene under går igjen på tvers av bransjer og størrelser. Ingen av dem skyldes manglende teknisk kompetanse. De skyldes at AI-innkjøp behandles som programvarekjøp, når det i praksis er en kombinasjon av programvarekjøp, databehandleravtale og risikovurdering.

    Å forveksle en compliance-side med en forpliktelse

    En leverandørs side om ansvarlig AI er markedsføring, ikke avtaletekst. Den kan endres når som helst uten varsel til deg. Det samme gjelder frivillige signaturer på pakter og kodekser: de er forpliktelser overfor myndigheter, ikke overfor kjøperen.

    Testen er enkel: hvis du ikke kan peke på et punktnummer i avtalen, har du ikke en rettighet. Ta de fire spørsmålene, få svarene skriftlig, og vedlegg dem med en henvisning i hoveddokumentet.

    Å ikke vite hvilke data som forlater bedriften

    De fleste datalekkasjer i AI-sammenheng skjer ikke gjennom avanserte angrep, men gjennom vanlige ansatte som limer inn dokumenter i et grensesnitt fordi det løser problemet raskt. Skyggebruk oppstår der det offisielle verktøyet er dårligere enn det uoffisielle.

    Løsningen er sjelden forbud. Den er et godkjent verktøy med klare grenser, kombinert med opplæring i hva som kan og ikke kan deles. AI Act stiller uansett krav til AI-forståelse hos brukere og beslutningstakere (Digi.no), så opplæringen skal gjøres uansett.

    Å kjøpe modell når problemet er prosess

    En overraskende stor andel av det som selges som AI-prosjekter, er egentlig prosessproblemer. Manuelle overleveringer mellom systemer løses ofte bedre med robotisert prosessautomatisering enn med en språkmodell, og til en brøkdel av den juridiske kompleksiteten.

    Tilsvarende: trenger dere presise svar basert på egne dokumenter, er spørsmålet om arkitektur og ikke om modellvalg. Både maskinlæring og RAG-baserte oppsett gir ofte bedre kontroll på datagrunnlaget, fordi kildene er dine egne og dermed dokumenterbare. Jo mer av verdien som ligger i dine data, jo mindre avhengig er du av hva grunnmodellen ble trent på.

    Ofte stilte spørsmål om treningsdata og opphavsrett

    Spørsmålene under er de som oftest kommer opp i ledergrupper når temaet først er på agendaen. Svarene er generelle og erstatter ikke juridisk rådgivning i den enkelte sak.

    Kan vi bli ansvarlige for hva leverandørens modell er trent på?

    Et krav rettes normalt mot den som har foretatt kopieringen, altså mot den som trente modellen. Risikoen din som distributør ligger først og fremst i utdata: hvis systemet produserer innhold som er for likt et beskyttet verk og dere publiserer det. Derfor er ansvarsdekning for utdata mer relevant for en typisk SMB enn ansvar for selve treningen.

    Den andre risikoen er operasjonell. Hvis leveransen må endres eller trekkes som følge av en rettstvist, er det dere som sitter med nedetiden. Det er en kontinuitetsrisiko som hører hjemme i risikoregisteret, ikke i juridisk avdeling alene.

    Gjelder AI Act for oss når leverandøren sitter i USA?

    Ja. Loven har ekstraterritoriell rekkevidde og gjelder selskaper etablert utenfor EU under visse betingelser (OpenAI). Dine egne plikter som distributør følger uansett av at dere bruker systemet i virksomheten deres, ikke av hvor leverandøren har hovedkontor.

    Eier vi opphavsretten til det AI-en produserer for oss?

    Under EU-lovgivningen nyter ikke verk generert helt av maskiner uten menneskelig inngripen opphavsrettslig beskyttelse (EU-kommisjonen, 2025). Europaparlamentets studie anbefaler at helt maskingenererte verk forblir ubeskyttet, mens AI-assisterte verk bør få harmoniserte beskyttelseskriterier.

    Konsekvensen er konkret: rent AI-generert markedsmateriell kan i prinsippet kopieres fritt av konkurrenter. Er innholdet forretningskritisk, bør det være tydelig menneskelig bearbeiding i prosessen, og den bearbeidingen bør dokumenteres.

    Hva gjør vi hvis leverandøren nekter å svare?

    Et avslag er også informasjon. Noter det, be om begrunnelsen skriftlig, og vurder om begrunnelsen er reell. «Forretningshemmelighet» er legitimt for detaljerte datasettlister, men mindre overbevisende for kategorier og lisensstatus på overordnet nivå.

    Deretter kompenserer du med andre mekanismer: strammere ansvarsklausul, kortere bindingstid, exit-rett ved vesentlig endret risikobilde, og lavere avhengighet i arkitekturen. Du kan ikke tvinge fram innsyn, men du kan prise fraværet av det.

    Oppsummering og neste steg for ledergruppen

    Treningsdata er det minst gjennomsiktige laget i en AI-leveranse, og det mest rettslig ustabile. EUs utgangspunkt er at trening er tillatt med mindre rettighetshaver har reservert seg, samtidig som reservasjonsmekanismene ikke fungerer pålitelig i praksis. De usensurerte dokumentene i den amerikanske rettssaken har flyttet hva en kjøper med rimelighet kan be om å få vite.

    De fire spørsmålene i kortform

    Hvilke datakilder, og hvordan dokumentert? Hvordan er reservasjoner håndtert? Hvem bærer risikoen ved krav? Brukes våre data til videre trening? Still dem skriftlig, før pris er avtalt, og legg svarene ved kontrakten. Fire spørsmål tar en time å stille og kan spare et prosjekt.

    Bruk svarene til å plassere bedriften i rollekartet, sett en eier for hvert åpent punkt, og fest en dato for ny gjennomgang. Ansvaret ligger uansett hos styre og ledelse (Digi.no), så beslutningen bør tas der.

    Det som fortsatt er uavklart

    Vi vet ikke hvordan den amerikanske rettssaken ender, om EU innfører en godtgjørelsesordning, eller hvilken norsk myndighet som får tilsynsansvaret. Europaparlamentets studie skisserer scenarier helt fram mot 2030, og det sier noe om tempoet (EU-kommisjonen, 2025).

    Det er ikke et argument for å vente. Det er et argument for avtaler som tåler endring: kortere bindingstid, rett til oppdatert dokumentasjon, varslingsplikt ved endret praksis og en arkitektur der modellen kan byttes uten at prosessene må bygges om. Usikkerhet håndteres med fleksibilitet, ikke med utsettelse.

    I Alura kombinerer vi teknisk AI-kompetanse med praktisk forståelse for GDPR, EU AI Act og Datatilsynets forventninger. Vi hjelper norske virksomheter å bygge AI som tåler en revisjon, uten å bremse innovasjonen.

    Bestill en compliance-vurdering: vi kartlegger dine AI-systemer mot gjeldende og kommende krav, og leverer en handlingsplan som faktisk er gjennomførbar. Uforpliktende.

    Kilder

    • TechCrunch. Microsoft exec called AI scraping 'the largest theft of labor in human history,' unredacted filings reveal
    • OpenAI. En introduksjon til EUs AI-lov: Betydningen det får for AI-leverandører og -distributører
    • arXiv. Copyright in AI Pre-Training Data Filtering: Regulatory Landscape and Mitigation Strategies
    • Digi.no. AI Act trer i kraft: Slik påvirker det oss i Norge | Digi.no
    • EU-kommisjonen (2025). Generative AI and Copyright - European Parliament
    • The Verge. OpenAI and Microsoft knew they were starting a 'doom loop' for the web
    A

    Alura

    Praktisk kunnskap om AI-automatisering og effektivisering for norske bedrifter.