valorisationpricing datacomparablescopyright lawai training7 augustus 2026

Prijsstelling van auteursrechtelijk beschermd materiaal voor AI-training: een waarderingskader

Hoe de eerste juridische schikkingen van een miljard dollar de eerlijke marktprijs voor intellectueel eigendom bepalen.

Het tijdperk van "ongeautoriseerd scrapen" als levensvatbare bedrijfsstrategie voor Large Language Models (LLMs) is officieel ten einde. Nu een federale rechter definitieve goedkeuring heeft gegeven aan een bekendgemaakte schikking van $1.5 miljard tussen Anthropic en een groep auteurs (latimes.com), heeft de markt nu zijn eerste definitieve prijsanker. Deze schikking, die kwalitatief hoogwaardige auteursrechtelijk beschermde boeken effectief waardeert op ongeveer $3,000 per werk, biedt een cruciale basislijn voor zowel data-eigenaren als AI-kopers die navigeren door het complexe landschap van intellectueel eigendom (IP) licenties.

De nieuwe bodem: Waarom $3,000 per werk de benchmark is

Jarenlang was de waardering van auteursrechtelijk beschermde data speculatief, variërend van fracties van een cent per token tot "toegangskosten" in de vorm van een eenmalig bedrag van meerdere miljoenen dollars. De Anthropic-schikking verandert de berekening door een retrospectieve boete vast te stellen die nu wordt gebruikt als een prospectieve prijsbodem. Wanneer een door de rechtbank bekrachtigde schikking inbreuken uit het verleden prijst op $3,000 per deel, moeten toekomstige licentiedeals logischerwijs op of boven dit niveau beginnen om rekening te houden met de "gemoedsrust" en juridische vrijwaring die een formele licentie biedt.

Dit cijfer komt overeen met andere spraakmakende, bekendgemaakte overeenkomsten. Zo wordt de deal van News Corp met OpenAI geschat op een waarde van meer dan $250 miljoen over vijf jaar (nytimes.com), wat de hoge premie weerspiegelt die wordt geplaatst op geverifieerde tekst met een hoge autoriteit. Voor data-eigenaren is de les duidelijk: uw waardering is niet langer uitsluitend gekoppeld aan de productiekosten, maar aan de beperking van juridische risico's die u de koper biedt.

Belangrijkste waarderingsfactoren voor auteursrechtelijk beschermde datasets

Hoewel het anker van $3,000 nuttig is voor boeken, is niet alle auteursrechtelijk beschermde data gelijk. Om een nauwkeurige prijs te bepalen, moeten beide partijen de dataset evalueren aan de hand van vier primaire waarderingsmethoden. U kunt deze in detail verkennen in onze gids voor waarderingsmethoden. In de context van auteursrechtelijk beschermde werken dicteren momenteel drie factoren de marktpremies:

  • Verifieerbaarheid en herkomst: Kopers betalen een premie voor "schone" data met een gedocumenteerde eigendomsketen. In een markt na de schikking wordt data met een onduidelijk eigendom steeds vaker gezien als een last in plaats van een bezit.
  • Rijkdom aan metadata: Een ruwe PDF van een boek is aanzienlijk minder waard dan een gestructureerde dataset die hoofdstuksamenvattingen, personagekaarten of annotaties op expertniveau bevat. Metadata van hoge kwaliteit kan de waarde per werk met 2x tot 5x verhogen.
  • Exclusiviteit vs. niet-exclusiviteit: De meeste huidige deals, zoals de bekendgemaakte jaarlijkse overeenkomst van $60 miljoen tussen Reddit en Google (reuters.com), zijn niet-exclusief. Exclusieve rechten, die voorkomen dat een concurrent traint op dezelfde data, vragen doorgaans om een opslag van 300% tot 500% markup.

De deal structureren: Licentiemodellen

Onderhandelingen verschuiven van eenmalige uitkopen naar terugkerende inkomstenmodellen. Omdat AI-modellen voortdurende hertraining en "fine-tuning" op verse data vereisen, zijn de volgende structuren standaard geworden:

1. Het jaarabonnement (SaaS-model): Gebruikelijk voor nieuwsorganisaties en sociale platforms. De koper betaalt een terugkerende vergoeding voor toegang tot een live stream van nieuwe content. Dit biedt de koper "versheid" en de eigenaar een voorspelbare cashflow.

2. Prijsstelling per token of per document: Bij voorkeur voor statische archieven. Dit model is zeer transparant, maar vereist een strikte controle op de manier waarop de data wordt opgenomen en gebruikt binnen de trainingscycli van het model.

3. Aandelen- of omzetaandeel: In opkomst bij deals met kleinere, zeer gespecialiseerde data-eigenaren (bijv. medische archieven of technische handleidingen). In plaats van een grote vooruitbetaling ontvangt de data-eigenaar een belang in het resulterende model of een percentage van de API-omzet die door dat model wordt gegenereerd.

Een checklist voor data-eigenaren

Voordat organisaties die over te gelde te maken archieven beschikken een onderhandeling aangaan, moeten zij de volgende audit voltooien:

  • Rechtenaudit: Bent u de eigenaar van de digitale trainingsrechten, of alleen van de publicatierechten? Veel oudere contracten dekken machine learning-toepassingen niet expliciet.
  • Data scrubbing: Zorg ervoor dat alle PII (Personally Identifiable Information) wordt verwijderd. De kosten van een datalek of privacyschending wegen vaak zwaarder dan de licentie-inkomsten.
  • Concurrentie-benchmarking: Bekijk onze uitgebreide dataset-catalogus om te zien wat vergelijkbare archieven in uw sector opbrengen op de vrije markt.

Wat dit voor u betekent

De overgang van "scrapen" naar "licentiëren" is de belangrijkste verschuiving in de AI-economie van dit decennium. Voor data-eigenaren betekent dit dat uw archieven nu activa op de balans zijn met een duidelijke, door de rechtbank ondersteunde waardering. Voor data-kopers betekent het dat data-acquisitie nu een kapitaalintensieve post is die dezelfde due diligence vereist als een zakelijke M&A-transactie. Of u nu een bestaand archief te gelde wilt maken of de trainingspijplijn voor uw volgende model wilt veiligstellen, d-nvest biedt de transparantie en marktplaatsinfrastructuur om deze deals met grote belangen met vertrouwen uit te voeren.

Sources

  • www.latimes.com

Get the next analysis

One deep-dive per edition on where valuable data is hiding — the evidence, the sources, and who would pay for it. No noise.

One email per edition. Unsubscribe any time. We never share your address.

From the marketplace

Explore live data opportunities

Browse datasets by sector & use-case
Found this useful? Share it

d-nvest turns the data assets behind these deals into scored, actionable opportunities.

Explore the pipeline →