Amazon koopt massaal boeken op om AI-chatbots te trainen en vernietigt ze daarna
20 augustus 2026 · 06:00 · Claude (Anthropic) · claude-sonnet-5
Een onderzoek van 404 Media, opgepikt door VRT NWS, onthult dat Amazon op grote schaal fysieke boeken opkoopt, digitaliseert voor het trainen van AI-modellen en de originele exemplaren vervolgens vernietigt. De praktijk roept vragen op over auteursrecht, dataverzameling en de toekomst van fysieke boeken in het AI-tijdperk.
Amazon boeken AI training staat sinds deze week volop in de schijnwerpers na een onthullend onderzoek van 404 Media, dat door VRT NWS werd overgenomen. Uit de reportage blijkt dat Amazon massaal fysieke boeken inkoopt, deze scant om als trainingsdata te gebruiken voor zijn AI-chatbots, en de originele boeken daarna vernietigt. Het nieuws voedt een bredere discussie over hoe grote techbedrijven aan data komen om hun taalmodellen te voeden, en welke prijs daarvoor wordt betaald buiten de digitale wereld.Wat onthult het onderzoek precies?
Volgens de tracker die 404 Media gebruikte, koopt Amazon op grote schaal tweedehands boeken op via eigen kanalen en externe verkopers. Die boeken worden niet doorverkocht of hergebruikt, maar systematisch gedigitaliseerd. De inhoud dient als voedingsbron voor de trainingsdatasets van Amazons AI-systemen, waaronder de chatbot-technologie die het bedrijf inzet in producten zoals Alexa en zijn cloudplatform AWS. Nadat de tekst is ingescand, worden de fysieke exemplaren volgens de onderzoekers vernietigd in plaats van gerecycled of doorverkocht, wat bij velen vragen oproept over verspilling en duurzaamheid. Het onderzoek sluit aan bij een patroon dat we al langer zien in de geschiedenis van kunstmatige intelligentie: grote taalmodellen hebben enorme hoeveelheden tekst nodig om te leren, en boeken vormen een bijzonder waardevolle bron omdat ze doorgaans van hogere kwaliteit en beter gestructureerd zijn dan willekeurige webteksten.Waarom zijn boeken zo waardevol voor AI-bedrijven?
Taalmodellen zoals die van Amazon, maar ook concurrenten van OpenAI, Google en Meta, worden getraind op gigantische tekstcorpora. Boeken bieden lange, coherente verhaallijnen, complexe zinsstructuren en een breed scala aan onderwerpen, wat ze uitermate geschikt maakt om een AI-model taalvaardigheid en redeneervermogen bij te brengen. Waar het internet vaak korte, fragmentarische en soms onbetrouwbare informatie bevat, zijn boeken redactioneel gecontroleerd en juridisch beter afgebakend qua auteurschap. Toch ligt precies dat laatste punt gevoelig. Auteurs en uitgevers hebben in het verleden al meerdere rechtszaken aangespannen tegen techbedrijven wegens het zonder toestemming gebruiken van auteursrechtelijk beschermd material voor AI-training. Het scannen en vervolgens vernietigen van fysieke boeken zou volgens juristen een manier kunnen zijn om binnen de grenzen van bepaalde wetgeving te blijven, aangezien het kopen van een fysiek exemplaar in sommige rechtsgebieden andere regels kent dan het digitaal kopiëren van beschermde content.Reacties en maatschappelijke impact
Het nieuws leidde tot verontwaardigde reacties, onder meer van boekenliefhebbers, auteurs en milieuorganisaties. Zij wijzen erop dat het vernietigen van fysieke boeken haaks staat op duurzaamheidsdoelen en op het culturele belang van gedrukte werken. Anderen benadrukken dat de praktijk illustreert hoe hongerig de AI-industrie is naar kwalitatieve data, nu het internet zelf steeds meer met AI-gegenereerde content vervuild raakt en dus minder betrouwbaar wordt als trainingsbron. Amazon is niet de enige speler die op zoek is naar nieuwe databronnen. Ook andere grote techbedrijven investeren fors in het verwerven van exclusieve datasets, licentieovereenkomsten met uitgevers en samenwerkingen met bibliotheken. Dit past in een bredere trend waarbij AI-toepassingen steeds afhankelijker worden van schaarse, hoogwaardige data nu de gemakkelijk beschikbare bronnen langzaam uitgeput raken.Wat betekent dit voor de toekomst van AI en boeken?
De onthulling zet de deur open voor strengere regelgeving rond dataverzameling voor AI-training. Beleidsmakers in de Europese Unie en de Verenigde Staten kijken kritisch naar hoe techbedrijven aan hun trainingsdata komen, en zaken als deze kunnen de druk verhogen om transparantie en compensatie voor makers wettelijk te verankeren. Tegelijk laat het zien hoe ver bedrijven bereid zijn te gaan om een concurrentievoordeel te behalen in de race om steeds krachtigere AI-modellen. Voor consumenten en de boekensector roept dit fundamentele vragen op: wie profiteert er eigenlijk van de kennis die in boeken is vastgelegd, en tegen welke prijs? Nu de discussie over auteursrecht, dataverzameling en AI-ethiek verder oplaait, is het aannemelijk dat dit niet de laatste onthulling is over hoe grote techbedrijven hun modellen voeden. Wie de ontwikkelingen wil blijven volgen, kan terecht bij meer AI-nieuws en onze kennisbank voor achtergrondinformatie over de werking en impact van kunstmatige intelligentie.Bron: VRT NWS
Ster Software
Het meest complete Nederlandstalige informatieplatform over kunstmatige intelligentie.
Kraaienjagersweg 24
7341 PT Beemte Broekland
© 2026 Ster Software BV · KvK 75474913
Inhoud gegenereerd door Claude (Anthropic) · model: claude-sonnet-4-6