De Marktprijs van Ongelicentieerde AI-trainingsdata
Benchmarking van de financiële aansprakelijkheid van gescrapte inhoud tegen de schikking van $1,5 miljard van Anthropic en licentietarieven.
Jarenlang ging de AI-industrie ervan uit dat publieke data in feite gratis data was. Dat tijdperk eindigde op 20 juli 2026, toen een Amerikaanse rechtbank definitieve goedkeuring gaf aan een schikking van $1.5 miljard (bekendgemaakt: Cybersecurity Intelligence) in de zaak Bartz v. Anthropic. Deze baanbrekende zaak, de grootste auteursrechtschikking in de geschiedenis, had betrekking op het ongeoorloofde gebruik van gepirateerde boeken voor het trainen van grote taalmodellen. Voor data-eigenaren en -kopers biedt deze gebeurtenis het eerste concrete antwoord op een cruciale vraag: wat is de werkelijke marktprijs voor niet-gelicentieerde AI-trainingsdata?
De 'schikkingsprijs' versus de marktprijs
De schikking in Bartz v. Anthropic schept een onthutsend financieel precedent. Op basis van het volume aan auteursrechtelijk beschermde werken in de 'Books3'-dataset hebben analisten de schikkingskosten geschat op ongeveer $3,000 per werk (geschat: Enterprise DNA). Dit cijfer vertegenwoordigt de "schaduwprijs" van niet-gelicentieerde data—de retrospectieve kosten van het gebruik van content zonder voorafgaande overeenkomst.
Om de werkelijke waardering van een dataset te begrijpen, moet men deze aansprakelijkheid van $3,000 per werk vergelijken met de huidige tarieven voor proactieve licenering. Zo sloot Reddit naar verluidt een deal van $60 miljoen per jaar (bekendgemaakt: Reuters) met Google voor zijn door gebruikers gegenereerde content. Op vergelijkbare wijze sloot News Corp een vijfjarige deal met OpenAI ter waarde van meer dan $250 miljoen (bekendgemaakt: Wall Street Journal). Wanneer dit wordt uitgesplitst naar de miljoenen betrokken artikelen of threads, zijn de kosten per item in een gelicentieerde deal vaak 50x tot 100x lager dan de kosten van een juridische schikking.
Waarom niet-gelicentieerde data niet langer 'gratis' is
Voor datakopers is het risicoprofiel van gescrapete data verschoven van een juridische overlast naar een bedreiging voor de balans. Onder de U.S. Copyright Act kunnen wettelijke schadevergoedingen voor opzettelijke inbreuk oplopen tot $150,000 per werk (bron: U.S. Copyright Office). Hoewel de Anthropic-schikking gemiddeld $3,000 per werk bedroeg, toont het aan dat rechtbanken nu bereid zijn deze schadevergoedingen te aggregeren tot in de miljarden.
Voor data-eigenaren creëert dit een krachtig hefboompunt. Als u beschikt over een eigen archief, is de waarde ervan niet langer alleen het nut voor AI, maar de kosten van de aansprakelijkheid die het vervangt. Om een eerlijke vraagprijs te bepalen, moeten eigenaren onze gids raadplegen over wat is een dataset waard: 4 waarderingsmethoden om hun verwachtingen af te stemmen op de institutionele risicobereidheid.
Prijsbenchmarks per datatype
De markt is uiteengevallen in drie verschillende prijsniveaus voor AI-trainingsdata:
- Niveau 1: Premium gelicentieerde media. Nieuws van hoge autoriteit, wetenschappelijke tijdschriften en professionele fotografie. Prijzen variëren van $10 tot $50 per item voor meerjarige gebruiksrechten, vaak gebundeld in jaarlijkse vaste vergoedingen van meerdere miljoenen dollars.
- Niveau 2: Eigen interactiedata. Klantenservicelogboeken, gespecialiseerde forums en niche-communitydata. Deze worden vaak gewaardeerd op basis van "token-dichtheid" of de uniekheid van het domein, met deals variërend van $1M tot $10M per jaar.
- Niveau 3: Gescrapete/niet-gelicentieerde data. Technisch gezien $0 op het moment van acquisitie, maar met een "aansprakelijkheidslast" van $1,000+ per werk aan potentiële juridische reserves.
De herkomstpremie
De belangrijkste drijfveer voor de waarde van data in 2026 is niet langer alleen volume; het is herkomst. AI-labs zijn steeds vaker bereid een "herkomstpremie" te betalen voor datasets die worden geleverd met een zuivere eigendomsketen en expliciete AI-trainingsrechten. Deze verschuiving wordt gedreven door de behoefte aan "audit-ready" modellen die voldoen aan evoluerende regelgeving zoals de EU AI Act, die transparantie verplicht stelt over het gebruik van auteursrechtelijk beschermde trainingsdata (bron: samenvattingen EU Data Act/AI Act).
Data-eigenaren die gedocumenteerde toestemming en gestructureerde metadata kunnen verstrekken, kunnen aanzienlijk hogere prijzen bedingen dan degenen die ruwe, ongestructureerde dumps verkopen. Kopers betalen in feite voor een verzekering—de gemoedsrust dat hun trainingsrun van $100M+ niet onderworpen zal worden aan een door de rechtbank bevolen verwijdering of een schikking van een miljard dollar.
Wat dit voor u betekent
De Anthropic-schikking van $1.5 miljard heeft de kosten van het afsnijden van bochten geformaliseerd. Voor data-eigenaren zijn uw gespecialiseerde archieven nu meer waard als "safe harbor"-alternatieven voor gescrapete data. Voor datakopers zijn de kosten van licenering nu een verplichte verzekeringspolis tegen catastrofale rechtszaken.
Of u nu een bestaand archief wilt verzilveren of schone inputs voor uw volgende model wilt veiligstellen, het navigeren op deze markt met hoge inzetten vereist professionele intelligentie. Verken de huidige markttarieven en beschikbare activa in onze datasetcatalogus om ervoor te zorgen dat uw volgende deal wordt gebouwd op een fundament van juridische en financiële zekerheid.
Sources
- enterprisedna.co
- www.copyright.gov
Data Academy
Go deeper with our guides
From the marketplace
Explore live data opportunities
Peakpowerenergy — Gelegenheid voor sensortelemetergegevens
View opportunity →overigB2Uco — Gelegenheid voor dataset met onderhoudslogboeken
View opportunity →industrieelAnyshape — Mogelijkheden voor datasets met inspectierapporten
View opportunity →News & Insights
Latest from the briefing
- Hoe te voldoen aan de California Delete Act en het DROP-systeem
- Hoe Massale Verwijderingsrechten de Waardering van Consumentendatasets Beïnvloeden
- Prijsstelling van auteursrechtelijk beschermd materiaal voor AI-training: een waarderingskader
- Externe Datastrategie: Wanneer Kopen vs. Bouwen voor AI-training
d-nvest turns the data assets behind these deals into scored, actionable opportunities.
Explore the pipeline →