Følg oss her

AI

AI-selskapene kjøper opp gamle bøker og river dem i stykker: Jakten på tekst uten AI-forgiftning

Rygger skjæres av, sider mates gjennom skannere, og bøkene ender som avfall.

Publisert

d.

AI-selskapene kjøper opp gamle bøker og river dem i stykker: Jakten på tekst uten AI-forgiftning

Bakgrunnen er en voksende bekymring i AI-industrien: det åpne nettet er nå så mettet av tekst produsert av språkmodeller at det er blitt vanskelig å finne treningsdata som ikke allerede er skrevet av en tidligere AI. Løsningen mange selskaper griper til, er å kjøpe opp fysiske bøker fra tiden før 2022, skanne dem industrielt og makulere originalene.

Databaseselskapet ISBNdb, som tradisjonelt har levert metadata til forlag og bokhandlere, markedsfører nå tjenesten aktivt overfor AI-laboratorier. Ifølge en gjennomgang hos TheNextWeb beskriver selskapet trykte bøker som «tette, redigerte, autoritative» kilder, og lover strenge taushetsavtaler slik at kjøperne kan holdes anonyme. «Streng NDA i hvert oppdrag», skriver selskapet på nettsidene sine.

Kroken er årstallet 2022

Grunnen til at pre-2022-bøker er så ettertraktet, er enkel: de kan ikke inneholde tekst generert av store språkmodeller, siden ChatGPT først kom sent i november 2022. Alt som er trykt tidligere, er per definisjon skrevet av mennesker.

ISBNdb erkjenner selv at skanning i stor skala nesten alltid ødelegger boken. Rygger skjæres av så løse sider kan mates raskt gjennom maskiner, en metode som er billigere enn skånsom håndtering, men som gjør bøkene ubrukelige etterpå. Selskapet innrømmer også at dette er et omdømmeproblem. «'AI-selskap ødelegger to millioner bøker' er ikke en overskrift som skaper sympati», heter det i markedsføringen.

Les også: Switch 2 eller PlayStation 5 til barnebarna: Slik velger du riktig konsoll før prisene stiger igjen

Modellene forfaller når de spiser hverandre

Fenomenet AI-industrien frykter, kalles «model collapse». I en artikkel publisert i Nature i juli 2024 viste forskeren Ilia Shumailov og medforfattere at språkmodeller som trenes på tekst generert av tidligere modeller, gradvis mister nyansene i det opprinnelige språket. Feilene forsterker seg fra generasjon til generasjon, og til slutt sitter man igjen med en modell som produserer stadig mer ensformig og upresis tekst.

Effekten sammenlignes ofte med en kopi av en kopi av en kopi: hvert ledd taper informasjon. For nordmenn som daglig bruker ChatGPT, Gemini eller Copilot, betyr det at kvaliteten på svarene ikke nødvendigvis bare går én vei. Uten friske, menneskeskrevne data risikerer modellene å bli dårligere over tid.

Bare 250 dokumenter er nok til å ødelegge en modell

I tillegg til det gradvise forfallet, er språkmodeller sårbare for aktiv sabotasje. Anthropic, selskapet bak Claude, publiserte 9. oktober 2025 en studie sammen med det britiske AI Security Institute og Alan Turing Institute som viste at bare 250 nøye utformede dokumenter er nok til å plante en bakdør i en språkmodell, uavhengig av om modellen har 600 millioner eller 13 milliarder parametere.

Studien viste at en angriper kunne få modellen til å produsere rent vrøvl ved å utløse et bestemt kodeord i teksten. Konklusjonen var at forsvar mot forgiftede treningsdata må fungere i stor skala, selv når mengden ondsinnet materiale er konstant.

Les også: Kinesisk utfordrer til Renault 5 elektrisk: Leapmotor B03 skal selges i Europa via Stellantis

Kombinasjonen av spontant modellforfall og bevisst forgiftning gjør at bekreftet menneskeskrevet tekst er blitt en handelsvare i seg selv.

Domstolene har gitt praksisen grønt lys

Bokødeleggelsen har også en juridisk side. I saken Bartz mot Anthropic slo dommer William Alsup ved den føderale distriktsdomstolen i Nord-California i juni 2025 fast at det å kjøpe en trykt bok, skanne den og deretter destruere originalen, faller inn under «fair use» i amerikansk opphavsrett. Anthropic måtte imidlertid separat inngå et forlik på 1,5 milliarder dollar for bruken av piratkopierte bøker, en sum som fordeles på rettighetshaverne til rundt 500.000 verk.

Kombinasjonen av juridisk klarsignal og desperat behov for ren tekst har gjort makulering av bøker til storindustri. Bokdistributøren Ingram, den største i USA, har ifølge TheNextWeb allerede varslet forlagene og gitt dem mulighet til å reservere seg mot at bøkene deres selges videre til dette formålet.

For nordmenn er koblingen indirekte, men reell. Hver gang en amerikansk lagerbygning fylles med bøker som skal skjæres opp, er det for å holde AI-tjenestene brukbare i årene fremover, også de nordmenn støtter seg på i jobb og skole.

Les også: Robotstøvsugere i 2026: To funksjoner avgjør om du angrer på kjøpet

Les også: Verdens største bilskip satte kinesisk rekord: 7.738 Teslaer lastet i Shanghai

Jeg heter Jesper Bengtson og er trafikkansvarlig for hele MGDK, hvor jeg har ansvar for å analysere leseradferd, følge utviklingen i søk og digitale plattformer, og sikre at journalistikken når ut til flest mulig lesere. Gjennom arbeidet følger jeg teknologiutviklingen tett og holder meg kontinuerlig oppdatert på nye produkter, trender og innovasjoner. Elbiler er et av mine spesialområder, men jeg skriver også om smarttelefoner, wearables, datamaskiner, kunstig intelligens, forbrukerelektronikk og annen teknologi. Jeg legger vekt på grundig research, faktabaserte vurderinger og troverdige kilder, slik at leserne får oppdatert og pålitelig informasjon om produktene og teknologien som preger hverdagen.

Annonse