Fire spørsmål om treningsdata før du signerer AI-avtalen
Usensurerte rettsdokumenter mot OpenAI og Microsoft viser 91 692 kopier av vernede verk i ett datasett. Her er spørsmålene norske SMB-er bør stille AI-leverandøren sin.

Nøkkelpunkter per 23. september 2026:
- Innsyn i treningsdata hører hjemme i kontrakten. Usensurerte rettsdokumenter beskriver over 91 692 kopier av verk fra tre nyhetsforlag i OpenAIs mellomtreningsdatasett (TechCrunch).
- AI Act fases inn trinnvis. Loven trådte i kraft 1. august 2024, med 12 måneder til generelle AI-forpliktelser og 24 måneder til høyrisikosystemer (OpenAI).
- Trening er lovlig som standard i EU med mindre rettighetshaver reserverer seg maskinlesbart, men ingen taggingsprotokoll sporer duplikater pålitelig (arXiv).
- Ansvaret legges på styre og ledelse. De første bestemmelsene traff norske virksomheter fra februar 2025, og kravsettene fases inn gjennom 2026 (Digi.no).
- Åpenhetskravene strammes utenfor EU først. California AB 412 gir rettighetshavere 30 dagers svarfrist på innsyn i opphavsrettsbeskyttet treningsmateriale (arXiv).
Hva treningsdata er, og hvorfor opphavsretten er uavklart
Når en leverandør skriver at modellen er «trent på et bredt utvalg offentlig tilgjengelige data», har du fått en formulering og ikke et svar. Treningsdata er materialet modellen har lest for å lære språk, mønstre og faktakunnskap. Det er laget i leveransen du har minst innsyn i, og samtidig det laget som bærer mest juridisk usikkerhet. Forskjellen mellom en gjennomtenkt og en naiv AI-anskaffelse ligger ofte i om noen i det hele tatt stilte spørsmålet.
Europaparlamentets juridiske komite bestilte i 2025 en studie av hvordan generativ AI utfordrer europeisk opphavsrett. Den konkluderer med at dagens unntak ikke er bygget for storskala modelltrening, og at uteblitt reform gir rettslig usikkerhet, markedskonsentrasjon og kulturell homogenisering (EU-kommisjonen, 2025). Det er ikke en fotnote for jurister. Det er en risikofaktor du kjøper inn i.
Treningsdata, finjusteringsdata og kontekstdata
Tre datalag blandes systematisk i salgssamtaler, og forvirringen er kostbar. Treningsdata er det grunnmodellen er bygget på, og det kontrollerer du ikke. Finjusteringsdata er materiale brukt til å spesialisere modellen mot en oppgave. Kontekstdata er dine egne dokumenter som hentes inn ved hvert enkelt svar, typisk i et RAG-oppsett. Mange leverandører svarer på spørsmål om lag en ved å beskrive lag tre.
| Datalag | Hva det er | Hvem kontrollerer det | Ditt innsyn |
|---|---|---|---|
| Treningsdata | Materialet grunnmodellen er bygget på | Modelleverandøren | Nesten ingen uten kontraktfestet krav |
| Finjusteringsdata | Data brukt til å spesialisere modellen mot en oppgave | Leverandør eller integrator | Delvis, avhenger av avtalen |
| Kontekstdata | Egne dokumenter modellen henter fra ved hvert svar | Din bedrift | Fullt, dette er dine egne systemer |
Poenget med inndelingen er praktisk. Du kan styre lag to og tre med interne rutiner. Lag en kan du bare styre gjennom kontrakten, og derfor må spørsmålene stilles før signering og ikke etter.
Hvorfor uavklart opphavsrett blir kjøperens problem
Et opphavsrettskrav rettes normalt mot den som har kopiert. Men når en modell er vevd inn i kundeservice, saksbehandling eller produktutvikling, er det kjøperen som må håndtere konsekvensene av at leveransen stopper, endres eller må skiftes ut. En modell som må trekkes fra markedet, eller retrenes uten et omstridt datasett, er en driftsrisiko uansett hvem som taper rettssaken.
Studien fra Europaparlamentet beskriver et verdigap mellom skapere og AI-utviklere, og argumenterer for en lovfestet godtgjørelsesordning for å tette det (EU-kommisjonen, 2025). Hvis en slik ordning kommer, blir den en kostnad et sted i verdikjeden. Prisen på modellen du kjøper i dag reflekterer ikke nødvendigvis den kostnaden.
Europa har ikke landet svaret
Opphavsrett er harmonisert i EU på papiret, men praktiseres i 27 medlemsstater med egne nasjonale lover (EU-kommisjonen, 2025). Studien beskriver fragmentert styring på tvers av institusjoner og etterlyser mer koherente, tverrsektorielle svar. For en norsk kjøper betyr det at rettstilstanden kan bli tydeligere, men ikke raskt.
Studien foreslår blant annet en ekspertgruppe på høyt nivå med seks måneders mandat, og skisserer scenarier for europeisk opphavsrettsstyring fram mot 2030. Det er tidshorisonten. Avtalen du signerer i høst vil sannsynligvis reforhandles minst en gang før regelverket har satt seg.
Microsoft-saken: hva de usensurerte dokumentene viser
The New York Times saksøkte OpenAI og Microsoft for direkte opphavsrettskrenkelse i desember 2023 (arXiv). Saken ble lenge fulgt som en prinsippsak om amerikansk fair use. Da deler av saksdokumentene ble offentliggjort uten sladd, endret den karakter: den ble et innsyn i hvordan store treningsdatasett faktisk ble satt sammen, beskrevet av folk som satt tett på arbeidet.
Dette er partsinnlegg i en amerikansk rettssak, ikke rettskraftige funn. Les dem deretter. Men de er det mest detaljerte offentlige materialet som finnes om praksisen, og de forklarer hvorfor spørsmål om treningsdata ikke lenger kan avfeies som teoretiske.
Det lederne skrev internt
Ifølge søksmålet beskrev en toppleder i Microsoft selskapenes AI-treningspraksis som «tyveri», omtalt i dokumentene som den største arbeidstyveri-operasjonen i menneskehetens historie (TechCrunch). Et internt Microsoft-dokument beskriver en «reell risiko» for at generativ AI kan forstyrre sysselsettingen til dem som produserte treningsdataene. Notatene knyttes til januar 2023 og en intern presentasjon i januar 2024.
Fra OpenAI-siden skal ChatGPT-sjef Nick Turley internt ha skrevet at forlag står overfor en «eksistensiell trussel» fra produkter som chatboten (TechCrunch). Det er verdt å merke hvem som sier det. Dette er ikke kritikere utenfra, det er interne vurderinger fra selskapene som bygget modellene.
Omfanget i tall
Dokumentene beskriver at OpenAIs mellomtreningsdatasett alene inneholdt mer enn 91 692 kopier av verk fra The New York Times, Daily News og Center for Investigative Reporting. Et Common Crawl-basert datasett skal ha inneholdt rundt 2 millioner dokumenter fra nytimes.com, og treningsdatasettet kalt Project Mango skal ha omfattet 160 903 unike verk fra nyhetsforlag (TechCrunch).
Skalaen er vanskelig å forestille seg. I søksmålet beskrives det aktuelle treningsdatasettet som tilsvarende et tekstdokument på over 3,7 milliarder sider (arXiv). Når datamengden er så stor, er det ingen som kan svare presist på hva som ligger inne uten systematisk dokumentasjon fra innsamlingstidspunktet. Det er nettopp derfor spørsmål nummer en i denne artikkelen handler om dokumentasjon og ikke om intensjon.
Nadella om betalingsmurer
Dokumentene beskriver at selskapene omgikk betalingsmurer, bygde treningsdatasett via massiv skraping og fjernet opphavsrettsmerknader. Samtidig forklarte Microsoft-sjef Satya Nadella i en deponering at alt som ligger bak betalingsmur, bør lisensieres av enhver som vil bruke det til trening (TechCrunch). Avstanden mellom prinsippet og praksisen er sakens kjerne.
Alura mener rettssakene i USA ikke endrer norsk lov, men de endrer hva en kjøper med rimelighet kan kreve å få vite. En leverandør kan ikke lenger si at spørsmålet om datakilder er umulig å besvare, når konkurrenters interne dokumentasjon nå er offentlig i detalj. Terskelen for hva som regnes som et akseptabelt svar har flyttet seg.
Les også: Valg av AI-leverandør – Kriterier og fallgruver for norske bedrifter. Norge har over 350 AI-selskaper å velge mellom.
TDM-unntaket i CDSM artikkel 4 og retten til å reservere seg
Mye av den norske debatten forutsetter at AI-trening på opphavsrettsbeskyttet materiale er ulovlig i Europa. Utgangspunktet er det motsatte. Artikkel 4 i CDSM-direktivet gir et unntak for tekst- og datautvinning som tillater bruk av opphavsrettsbeskyttet innhold, med mindre rettighetshaveren har reservert seg (EU-kommisjonen, 2025).
Det er en opt-out-modell, ikke en opt-in-modell. Forskjellen betyr alt for hvordan du vurderer et leverandørsvar.
Hovedregelen er lovlig bruk med opt-out
EUs regelverk tillater AI-trening på opphavsrettsbeskyttet innhold som standard, med mindre rettighetshavere aktivt reserverer seg gjennom maskinlesbare midler (arXiv). En leverandør som sier «vi trener bare på lovlig tilgjengelig materiale» kan derfor ha rett i en formell forstand og likevel ikke ha svart på noe som helst.
Det operative spørsmålet er ikke om trening er tillatt. Det er om leverandøren faktisk registrerte og respekterte reservasjoner på innsamlingstidspunktet, og om de kan vise hvordan.
Opt-out som ikke virker i praksis
Reservasjonsretten forutsetter en teknisk mekanisme som fungerer. Den finnes ikke i moden form. Ingen nåværende taggingsprotokoll kan pålitelig spore duplikater eller håndtere utviklende utvinningsmetoder (EU-kommisjonen, 2025). Et verk som er reservert på originalnettstedet, kan ligge ureservert i en kopi et annet sted.
Konsekvensen er at selv en leverandør med god vilje ikke kan garantere fullstendig etterlevelse av opt-out. Det gjør det viktigere å vite hvilken metode de bruker, hvor ofte den oppdateres, og hva som skjer når en rettighetshaver melder fra i ettertid. Studien fra Europaparlamentet konkluderer for øvrig med at dagens TDM-unntak ikke er designet for generativ AI-trening og risikerer å forvrenge formålet med opphavsrettsunntak.
Hva Europaparlamentets studie foreslår
Studien fra juli 2025 lander på fem hovedfunn og foreslår målrettede reformer: forhåndsgodkjenning for visse bruksformer, harmoniserte opt-out-mekanismer, åpenhetskrav og rimelige lisensieringsmodeller (EU-kommisjonen, 2025). Ingen av disse er vedtatt. Alle er retningsgivende for hvor reguleringen beveger seg.
For en kjøper er dette et argument for fleksibilitet i avtaleverket. Hvis åpenhetskrav og lisensieringsplikt strammes inn i løpet av avtaleperioden, vil du vite om leverandøren kan levere dokumentasjonen uten reforhandling, og hvem som betaler hvis de ikke kan.
Fire spørsmål du stiller AI-leverandøren før signering
Alura mener innsyn i treningsdata hører hjemme i kontrakten, ikke i leverandørens markedsmateriell. En compliance-side kan endres uten varsel. En kontraktsklausul kan ikke. Det er hele forskjellen mellom en påstand og en forpliktelse.
Spørsmålene under er formulert så de kan besvares skriftlig og legges ved avtalen. De er ikke juridisk rådgivning, men en innkjøpsstruktur. Bruk dem sammen med de øvrige kriteriene for leverandørvalg, og still dem tidlig nok til at svarene faktisk kan påvirke prisen.
Spørsmål 1: Hvilke datakilder er modellen trent på, og hvordan er de dokumentert?
Du spør ikke etter en fullstendig liste over hvert dokument, for den finnes sannsynligvis ikke i brukbar form. Du spør etter kategorisert oversikt med lisensstatus: hvilke hovedkilder inngår, hvilke er lisensiert, hvilke er skrapet fra åpent nett, hvilke er kjøpt inn fra tredjepart. Be om formatet dokumentasjonen foreligger i, og om den oppdateres ved nye modellversjoner.
Et godt svar er spesifikt og kjedelig. Et dårlig svar er generisk og entusiastisk. Formuleringen «offentlig tilgjengelige data» forteller deg ingenting om lisensstatus, for offentlig tilgjengelig og fritt anvendelig er to forskjellige ting. Det var nettopp denne distinksjonen Nadella-deponeringen handlet om.
Spørsmål 2: Hvordan er reservasjoner fra rettighetshavere håndtert?
Dette er spørsmålet som går rett på artikkel 4. Be leverandøren beskrive hvilken maskinlesbar mekanisme de respekterer, hvor ofte den kontrolleres, og hva rutinen er når en rettighetshaver melder fra etter at treningen er gjennomført. Be også om å få vite om de bruker eller har vurdert mekanismer som pay-per-crawl eller verktøy som Have I Been Trained (arXiv).
Svaret «vi følger bransjestandard» er ikke et svar, fordi det ikke finnes en bransjestandard som fungerer på tvers av duplikater. Et leverandørsvar som beskriver en konkret, etterprøvbar rutine er verdt mer enn et som lover full etterlevelse.
Spørsmål 3: Hvem bærer risikoen hvis et krav kommer?
Flere store leverandører markedsfører ansvarsdekning for opphavsrettskrav knyttet til utdata fra modellene. Spørsmålet er hva dekningen faktisk omfatter. Be om det skriftlige vilkårsdokumentet, ikke nettsideteksten, og se spesielt etter beløpstak, unntak ved egen finjustering, unntak ved bruk av åpne modeller og krav til at du har brukt innebygde filtre.
Be i tillegg om en prosessbeskrivelse: hvem varsler hvem, innen hvilken frist, og hvem styrer forsvaret hvis et krav kommer. En dekning uten prosess er en forsikring du ikke vet hvordan du utløser.
Spørsmål 4: Brukes våre data til videre trening?
Dette er spørsmålet flest norske virksomheter tror de har svar på, og færrest har dokumentert. Skill mellom trening, logging og menneskelig gjennomgang for kvalitetssikring. De tre har ulike personvernkonsekvenser, og et nei til det første er ikke automatisk et nei til det andre og tredje.
Be om at nei til trening på kundedata står som standardinnstilling i avtalen, ikke som en bryter noen må huske å slå på i et administrasjonspanel. Erfaringene fra Samsungs ChatGPT-utrulling handler i kjernen om det samme: data som forlater bedriften gjør det oftest fordi ingen definerte grensen tydelig nok.
Slik scorer du svarene
| Spørsmål | Godt svar | Rødt flagg | Hva du kontraktsfester |
|---|---|---|---|
| 1. Datakilder | Kategorisert oversikt med lisensstatus per kilde | «Offentlig tilgjengelige data» | Rett til oppdatert dokumentasjon ved forespørsel |
| 2. Reservasjoner | Beskrevet metode for maskinlesbar opt-out | «Vi følger bransjestandard» | Varslingsplikt ved endret praksis |
| 3. Ansvar | Vilkårsdokument med tak og unntak listet | Dekning omtalt kun på nettsiden | Ansvarsklausul med definert varslingsprosess |
| 4. Egne data | Nei til trening som standard i avtalen | Opt-out som må aktiveres manuelt | Forbud mot trening på kundedata |
Alura mener at et leverandørsvar som ikke kan dokumenteres, bør behandles som et åpent risikopunkt i anskaffelsen. Ikke som en showstopper, og ikke som et ikke-problem. Det betyr at punktet føres i risikoregisteret, får en eier i ledergruppen og en dato for ny vurdering. Da blir det en beslutning styret har tatt bevisst, ikke en forglemmelse noen oppdager i ettertid.
Leverandør eller distributør: hvor AI Act plasserer bedriften din
AI Act skiller mellom leverandører og distributører av AI-systemer. Leverandører utvikler systemet, distributører bruker det i egne applikasjoner (OpenAI). Skillet avgjør hvilke plikter som treffer deg, og det er det første punktet i enhver seriøs AI-anskaffelse.
Alura mener de fleste norske SMB-er er distributører og ikke leverandører under AI Act, men at ansvaret uansett ligger hos styre og ledelse. Rollen din bestemmer omfanget av dokumentasjonskravene. Den fjerner ikke ansvaret for at systemet brukes forsvarlig.
Skillet i korte trekk
| Dimensjon | Leverandør | Distributør |
|---|---|---|
| Typisk rolle | Utvikler systemet og setter det på markedet | Bruker systemet i egen virksomhet |
| Typisk norsk SMB | Sjelden, men mulig ved egen produktutvikling | Vanligste plassering |
| Hovedplikt | Teknisk dokumentasjon og samsvar før lansering | Bruk i tråd med instruksjoner og menneskelig oversyn |
| Hva du må kunne vise | Hvordan systemet er bygget og testet | Hvor systemet brukes og hvem som eier ansvaret |
Grensen er ikke statisk. Bygger du et eget produkt oppå en tredjepartsmodell og selger det videre under eget navn, bør plasseringen vurderes juridisk og ikke antas. Det er en konkret vurdering som koster lite å gjøre tidlig og mye å gjøre for sent.
Ekstraterritoriell rekkevidde
Et vanlig argument i norske ledergrupper er at leverandøren sitter i USA, og at EU-regelverket derfor er deres problem. Det stemmer ikke. AI Act har ekstraterritoriell rekkevidde og gjelder også selskaper etablert utenfor EU under visse betingelser (OpenAI).
Rekkevidden går også andre veien: ikke-EU-selskaper må forholde seg til kravene i EUs atferdskodeks for generell AI for å få tilgang til EU-markedet (arXiv). Det er faktisk en fordel for deg som kjøper. Markedsadgangen gir leverandøren en grunn til å produsere dokumentasjonen du ber om.
Ansvaret ligger hos styre og ledelse
AI Act er den første europeiske reguleringen som definerer AI-systemer og bruken av dem, med forbud mot visse bruksområder og krav til både utviklere og brukere (Digi.no). Ansvaret for AI-systemene legges direkte på styre og ledelse, og brudd kan føre til sanksjoner.
Det stilles også krav til AI-forståelse hos utviklere, brukere og beslutningstakere. I praksis betyr det at «IT tar seg av det» ikke er en holdbar ansvarsplassering. Et styre som ikke kan forklare hvilke AI-systemer virksomheten bruker, hvor de brukes og hvem som har oversyn, har en dokumentasjonsjobb foran seg.
Tidslinjen for AI Act og hva som gjelder fra når
AI Act trådte i kraft 1. august 2024, 20 dager etter publisering i EUs offisielle tidsskrift (OpenAI). Pliktene kommer ikke samtidig. De fases inn i trinn, og hvert trinn måles fra ikrafttredelsesdatoen.
| Trinn | Tidspunkt | Hva det betyr for deg |
|---|---|---|
| Ikrafttredelse | 1. august 2024, 20 dager etter publisering | Klokken begynner å gå for alle frister under |
| Forbudt praksis | 6 måneder etter ikrafttredelse | Visse bruksområder er ulovlige uansett bransje |
| Atferdskodekser ferdigstilt | 9 måneder etter ikrafttredelse | Rammene for hva leverandører skal dokumentere |
| Generelle AI-forpliktelser | 12 måneder etter ikrafttredelse | Krav til modellene de fleste SMB-er kjøper |
| Høyrisikosystemer | 24 måneder etter ikrafttredelse | Tyngste dokumentasjonskrav slår inn |
| Eksisterende GPAI og store IT-systemer | 36 måneder etter ikrafttredelse | Lengre overgang for det som allerede er i drift |
Terskelen for systemisk risiko
Regelverket bruker en teknisk terskel for å skille ut modeller med systemisk risiko: beregningsmengde over 10^25 FLOPs under trening (OpenAI). Modeller over terskelen får strengere forpliktelser enn resten.
Dette er relevant for deg av en enkel grunn. De fleste kjente generelle språkmodellene på markedet ligger i sjiktet der spørsmålet er aktuelt. Det gir deg et konkret spørsmål å stille: hvilken kategori faller modellen vi kjøper inn i, og hvilke forpliktelser følger med?
Det norske bildet er ikke ferdig tegnet
De første bestemmelsene i AI-regelverket trådte i kraft i februar 2025, og EUs implementering av kravsettene fortsetter gjennom 2026 (Digi.no). Norge er i en tidlig fase, og det er fortsatt under arbeid hvilken norsk myndighet som skal ha hovedansvaret for kontroll av AI-systemer.
Uavklart tilsynsmyndighet er ikke det samme som uavklart plikt. Det betyr bare at du ikke vet hvem som kommer til å spørre. Virksomheter som venter med dokumentasjonen til tilsynsmodellen er på plass, gjør jobben under tidspress i stedet for i ro.
Markedet: hva leverandørene selv publiserer om etterlevelse
Store leverandører har begynt å publisere posisjoner om AI Act, og det er nyttig lesning. Det er også markedskommunikasjon. Skillet mellom hva som er frivillig forpliktelse og hva som er juridisk bindende overfor deg som kunde, er ikke alltid tydelig i teksten.
Frivillige forpliktelser og atferdskodeks
OpenAI signerte de tre kjerneforpliktelsene i EUs AI-pakt 25. september 2024, og kunngjorde senere at de ville undertegne atferdskodeksen for generell AI, med oppdatering publisert 11. juli 2025 (OpenAI). Slike signaturer er et positivt signal, men de er forpliktelser overfor EU og ikke overfor din bedrift.
Dette er den praktiske testen: hvis leverandøren bryter en frivillig forpliktelse, har du noe kontraktsmessig å gå på? I de fleste standardavtaler er svaret nei. Det er derfor de fire spørsmålene skal ende opp som vedlegg og klausuler, ikke som skjermbilder fra et nettsted.
Verktøyene som gir delvis innsyn
Det finnes et voksende økosystem av teknikker for å kartlegge og filtrere treningsdata. MIT Data Provenance Initiative gjennomførte en systematisk revisjon av mer enn 1 800 tekst-datasett, og forskningslitteraturen beskriver blant annet perseptuell hashing, navnegjenkjenning, pay-per-crawl-modeller og verktøy som Have I Been Trained og InnerProbe (arXiv).
Filtrering fungerer når den er målrettet. Anthropics klassifiserer for CBRN-innhold oppnådde en F1-score på 0,96 for å skille skadelig fra ufarlig materiale. Opphavsrettsfiltrering er en vanskeligere oppgave, fordi den krever kunnskap om rettighetsstatus og ikke bare om innholdets art. Når en leverandør sier de «filtrerer treningsdata», er oppfølgingsspørsmålet hvilket problem filteret faktisk løser.
Les også: Det Samsungs ChatGPT-utrulling lærer norske bedrifter. Samsung Electronics ruller ut ChatGPT Enterprise og Codex til ansatte i Korea og DX-divisjonen globalt.
Kostnadsbildet når lisensiering og dokumentasjon skal inn i budsjettet
Prisen på en AI-leveranse er sjelden bare lisenskostnaden. Etterlevelse koster penger, og kostnaden kommer i poster som ofte mangler i tilbudet du får tilsendt. Europaparlamentets studie peker mot rimelige lisensieringsmodeller og en godtgjørelsesordning som fremtidige elementer (EU-kommisjonen, 2025). Kommer de, havner de i verdikjeden og til slutt hos sluttkunden.
Poenget er ikke å avskrekke. Det er å budsjettere riktig, slik at prosjektet ikke stopper i måned ni fordi juristen krever en gjennomgang ingen hadde satt av penger til.
Postene som sjelden står i tilbudet
| Kostnadspost | Hva den dekker | Når den treffer | Hvem eier den |
|---|---|---|---|
| Juridisk gjennomgang | Klausuler om treningsdata, ansvar og databruk | Før signering | Ledelse og innkjøp |
| Dokumentasjon og logging | Oversikt over systemer, bruksområder og risikoklasse | Løpende fra oppstart | Systemeier |
| Kompetanse | Opplæring i AI-forståelse for ansatte og beslutningstakere | Første år og deretter årlig | HR og ledelse |
| Lisensiering av innhold | Rettigheter til materiale i egne data og i leverandørens ledd | Kan komme etterskuddsvis | Leverandør, men prises videre |
| Exit og migrering | Evnen til å bytte leverandør hvis risikobildet endrer seg | Ved reforhandling | IT og innkjøp |
Den siste posten er den mest undervurderte. Hvis en modell må skiftes ut fordi leverandøren taper en rettssak eller trekker et produkt, er kostnaden din avhengig av hvor dypt modellen er vevd inn i prosessene. Abstraksjonslag koster litt i starten og sparer mye når noe må byttes.
Bot-risikoen er reell
Personvern og opphavsrett er to ulike regelverk, men håndhevingen viser samme mønster. Den italienske personvernmyndigheten Garante idømte OpenAI en bot på 15 millioner euro for brudd på GDPR (arXiv). Saken hadde bakgrunn blant annet i et datainnbrudd 20. mars 2023 som berørte 440 italienske brukere.
Lærdommen for en norsk SMB er ikke botens størrelse, men hva som utløste den: manglende kontroll på hvilke data som ble behandlet og hvordan. Det er samme spørsmål som spørsmål fire i sjekklisten. Kontrollen på egne data er den delen av risikobildet du faktisk kan styre selv.
Åpenhetskrav i California og Japan peker mot neste runde
EU er ikke alene om å regulere treningsdata, og EU er heller ikke først på alle punkter. To jurisdiksjoner er verdt å følge, fordi de trekker i motsatt retning og viser hvor spennet ligger.
California AB 412 og 30-dagersfristen
California AB 412 fra 2025 krever at utviklere av generative AI-modeller dokumenterer opphavsrettsbeskyttet materiale brukt i trening, og at de tilbyr en offentlig mekanisme der rettighetshavere kan be om denne informasjonen med 30 dagers svarfrist (arXiv). Det er en konkret åpenhetsplikt med en klokke på.
Hvis leverandøren din er underlagt et slikt krav i hjemmemarkedet, finnes dokumentasjonen allerede i en eller annen form. Da er spørsmålet ditt ikke om de kan lage den, men om de vil dele den med deg. Det er et forhandlingsspørsmål, ikke et teknisk.
Japans artikkel 30-4 trekker motsatt vei
Japans reviderte åndsverkslov, artikkel 30-4, gjeldende fra 1. januar 2019, tillater bred bruk av opphavsrettsbeskyttede verk til informasjonsanalyse inkludert AI-trening, for både kommersielle og ikke-kommersielle formål (arXiv). Der EU diskuterer innstramming, har Japan valgt åpning.
Spriket betyr at en modell kan være trent fullt ut lovlig i en jurisdiksjon og reise spørsmål i en annen. Det er derfor spørsmålet «hvor ble modellen trent, og under hvilket regime» hører hjemme i due diligence. Forskningslitteraturen beskriver nettopp kritiske hull i håndhevingen på tvers av EU, USA og Asia-Stillehavsregionen.
Markedsobservasjon: 93 prosent færre klikk
Ett tall fra de usensurerte dokumentene fortjener egen oppmerksomhet, og det handler ikke om jus. Microsofts Copilot, beskrevet som en «answer engine», førte ifølge Microsofts egne data til at klikkraten for The New York Times' domene falt med opptil 93 prosent sammenlignet med tradisjonelt Bing-søk (TechCrunch).
Det beskriver en mekanisme, ikke en enkeltsak. Når et AI-grensesnitt svarer i stedet for å henvise, forsvinner trafikken som finansierte innholdet svaret bygger på. Fenomenet har blitt omtalt som en «doom loop» for nettet (The Verge): innholdsprodusentene mister inntekt, produserer mindre, og modellene får dårligere materiale å lære av.
For en norsk leder er dette relevant på to måter samtidig. Det forklarer hvorfor rettighetshavere presser på for lisensiering og åpenhet, og det forklarer hvorfor kostnaden sannsynligvis kommer tilbake som en lisensavgift et sted i kjeden.
Hva det betyr hvis bedriften din lever av innhold
Produserer dere fagartikler, produktdata, kurs eller dokumentasjon som konkurransefortrinn, er dere på samme side av bordet som forlagene. Da bør reservasjon mot tekst- og datautvinning være et bevisst valg, tatt av noen med mandat, og ikke en innstilling ingen har sett på.
Selger dere derimot tjenester der innholdet er markedsføring, kan regnestykket gå motsatt vei. Å bli sitert av en modell kan være verdt mer enn klikket du taper. Det er en forretningsbeslutning, ikke en teknisk, og den bør tas eksplisitt fordi standardinnstillingen i EU er at materialet ditt kan brukes.
Vanlige feil norske SMB-er gjør i AI-anskaffelser
Feilene under går igjen på tvers av bransjer og størrelser. Ingen av dem skyldes manglende teknisk kompetanse. De skyldes at AI-innkjøp behandles som programvarekjøp, når det i praksis er en kombinasjon av programvarekjøp, databehandleravtale og risikovurdering.
Å forveksle en compliance-side med en forpliktelse
En leverandørs side om ansvarlig AI er markedsføring, ikke avtaletekst. Den kan endres når som helst uten varsel til deg. Det samme gjelder frivillige signaturer på pakter og kodekser: de er forpliktelser overfor myndigheter, ikke overfor kjøperen.
Testen er enkel: hvis du ikke kan peke på et punktnummer i avtalen, har du ikke en rettighet. Ta de fire spørsmålene, få svarene skriftlig, og vedlegg dem med en henvisning i hoveddokumentet.
Å ikke vite hvilke data som forlater bedriften
De fleste datalekkasjer i AI-sammenheng skjer ikke gjennom avanserte angrep, men gjennom vanlige ansatte som limer inn dokumenter i et grensesnitt fordi det løser problemet raskt. Skyggebruk oppstår der det offisielle verktøyet er dårligere enn det uoffisielle.
Løsningen er sjelden forbud. Den er et godkjent verktøy med klare grenser, kombinert med opplæring i hva som kan og ikke kan deles. AI Act stiller uansett krav til AI-forståelse hos brukere og beslutningstakere (Digi.no), så opplæringen skal gjøres uansett.
Å kjøpe modell når problemet er prosess
En overraskende stor andel av det som selges som AI-prosjekter, er egentlig prosessproblemer. Manuelle overleveringer mellom systemer løses ofte bedre med robotisert prosessautomatisering enn med en språkmodell, og til en brøkdel av den juridiske kompleksiteten.
Tilsvarende: trenger dere presise svar basert på egne dokumenter, er spørsmålet om arkitektur og ikke om modellvalg. Både maskinlæring og RAG-baserte oppsett gir ofte bedre kontroll på datagrunnlaget, fordi kildene er dine egne og dermed dokumenterbare. Jo mer av verdien som ligger i dine data, jo mindre avhengig er du av hva grunnmodellen ble trent på.
Ofte stilte spørsmål om treningsdata og opphavsrett
Spørsmålene under er de som oftest kommer opp i ledergrupper når temaet først er på agendaen. Svarene er generelle og erstatter ikke juridisk rådgivning i den enkelte sak.
Kan vi bli ansvarlige for hva leverandørens modell er trent på?
Et krav rettes normalt mot den som har foretatt kopieringen, altså mot den som trente modellen. Risikoen din som distributør ligger først og fremst i utdata: hvis systemet produserer innhold som er for likt et beskyttet verk og dere publiserer det. Derfor er ansvarsdekning for utdata mer relevant for en typisk SMB enn ansvar for selve treningen.
Den andre risikoen er operasjonell. Hvis leveransen må endres eller trekkes som følge av en rettstvist, er det dere som sitter med nedetiden. Det er en kontinuitetsrisiko som hører hjemme i risikoregisteret, ikke i juridisk avdeling alene.
Gjelder AI Act for oss når leverandøren sitter i USA?
Ja. Loven har ekstraterritoriell rekkevidde og gjelder selskaper etablert utenfor EU under visse betingelser (OpenAI). Dine egne plikter som distributør følger uansett av at dere bruker systemet i virksomheten deres, ikke av hvor leverandøren har hovedkontor.
Eier vi opphavsretten til det AI-en produserer for oss?
Under EU-lovgivningen nyter ikke verk generert helt av maskiner uten menneskelig inngripen opphavsrettslig beskyttelse (EU-kommisjonen, 2025). Europaparlamentets studie anbefaler at helt maskingenererte verk forblir ubeskyttet, mens AI-assisterte verk bør få harmoniserte beskyttelseskriterier.
Konsekvensen er konkret: rent AI-generert markedsmateriell kan i prinsippet kopieres fritt av konkurrenter. Er innholdet forretningskritisk, bør det være tydelig menneskelig bearbeiding i prosessen, og den bearbeidingen bør dokumenteres.
Hva gjør vi hvis leverandøren nekter å svare?
Et avslag er også informasjon. Noter det, be om begrunnelsen skriftlig, og vurder om begrunnelsen er reell. «Forretningshemmelighet» er legitimt for detaljerte datasettlister, men mindre overbevisende for kategorier og lisensstatus på overordnet nivå.
Deretter kompenserer du med andre mekanismer: strammere ansvarsklausul, kortere bindingstid, exit-rett ved vesentlig endret risikobilde, og lavere avhengighet i arkitekturen. Du kan ikke tvinge fram innsyn, men du kan prise fraværet av det.
Oppsummering og neste steg for ledergruppen
Treningsdata er det minst gjennomsiktige laget i en AI-leveranse, og det mest rettslig ustabile. EUs utgangspunkt er at trening er tillatt med mindre rettighetshaver har reservert seg, samtidig som reservasjonsmekanismene ikke fungerer pålitelig i praksis. De usensurerte dokumentene i den amerikanske rettssaken har flyttet hva en kjøper med rimelighet kan be om å få vite.
De fire spørsmålene i kortform
Hvilke datakilder, og hvordan dokumentert? Hvordan er reservasjoner håndtert? Hvem bærer risikoen ved krav? Brukes våre data til videre trening? Still dem skriftlig, før pris er avtalt, og legg svarene ved kontrakten. Fire spørsmål tar en time å stille og kan spare et prosjekt.
Bruk svarene til å plassere bedriften i rollekartet, sett en eier for hvert åpent punkt, og fest en dato for ny gjennomgang. Ansvaret ligger uansett hos styre og ledelse (Digi.no), så beslutningen bør tas der.
Det som fortsatt er uavklart
Vi vet ikke hvordan den amerikanske rettssaken ender, om EU innfører en godtgjørelsesordning, eller hvilken norsk myndighet som får tilsynsansvaret. Europaparlamentets studie skisserer scenarier helt fram mot 2030, og det sier noe om tempoet (EU-kommisjonen, 2025).
Det er ikke et argument for å vente. Det er et argument for avtaler som tåler endring: kortere bindingstid, rett til oppdatert dokumentasjon, varslingsplikt ved endret praksis og en arkitektur der modellen kan byttes uten at prosessene må bygges om. Usikkerhet håndteres med fleksibilitet, ikke med utsettelse.
I Alura kombinerer vi teknisk AI-kompetanse med praktisk forståelse for GDPR, EU AI Act og Datatilsynets forventninger. Vi hjelper norske virksomheter å bygge AI som tåler en revisjon, uten å bremse innovasjonen.
Bestill en compliance-vurdering: vi kartlegger dine AI-systemer mot gjeldende og kommende krav, og leverer en handlingsplan som faktisk er gjennomførbar. Uforpliktende.
Kilder
- TechCrunch. Microsoft exec called AI scraping 'the largest theft of labor in human history,' unredacted filings reveal
- OpenAI. En introduksjon til EUs AI-lov: Betydningen det får for AI-leverandører og -distributører
- arXiv. Copyright in AI Pre-Training Data Filtering: Regulatory Landscape and Mitigation Strategies
- Digi.no. AI Act trer i kraft: Slik påvirker det oss i Norge | Digi.no
- EU-kommisjonen (2025). Generative AI and Copyright - European Parliament
- The Verge. OpenAI and Microsoft knew they were starting a 'doom loop' for the web
Alura
Praktisk kunnskap om AI-automatisering og effektivisering for norske bedrifter.
Les neste
AI-risiko må på styrets agenda før AI Act treffer
Bill Gates mener AI har passert flere farlige terskler, mens bare 34 prosent av norske virksomheter ser AI som en sikkerhetsrisiko. Her er rammeverket ledere trenger nå.
Krav til AI-leverandører når modeller skjuler egne feil
OpenAI la 16. september 2026 frem seks rapporter om modeller som skjuler egne feil. Her er åpenhetskravene norske virksomheter bør stille før de signerer med en AI-leverandør.
EU AI Act treffer norske SMB-er fra midten av 2026
EU AI Act begynner etter alt aa doemme aa gjelde midten av 2026, og enkelte krav ett aar foer. Her er hva norske SMB-er maa dokumentere selv, uansett hva leverandoeren lover.
Sensitive data i AI-verktøy uroer 82 prosent av brukerne
Andelen brukere som frykter misbruk av egne data steg fra 74 til 82 prosent på ett år. EUs etiske AI-krav er fortsatt frivillige. Her er kjørereglene norske bedrifter bør sette selv.

