AI 训练内容的版权定价:估值框架
首批十亿美元的法律和解如何定义知识产权的公平市场价格。
“未经授权抓取”作为大型语言模型 (LLMs) 可行商业策略的时代已正式结束。随着联邦法官最终批准 Anthropic 与原告作者群体之间达成的 1.5 billion 美元公开和解协议 (latimes.com),市场现在有了第一个明确的价格锚点。这项和解协议实际上将高质量受版权保护的书籍定价为每部作品约 $3,000,为在复杂的知识产权 (IP) 许可领域中博弈的数据所有者和 AI 买家提供了关键基准。
新底价:为什么每部作品 $3,000 是基准
多年来,受版权保护数据的估值一直具有投机性,从每 token 几分钱到数百万美元的一次性“准入费”不等。Anthropic 的和解通过确立一项追溯性罚款改变了计算方式,该罚款现在被用作前瞻性的定价底线。当法院批准的和解协议将过去的侵权行为定价为每册 $3,000 时,未来的许可交易在逻辑上必须以此水平或更高水平开始,以考虑到正式许可所提供的“安心”和法律赔偿保障。
这一数字与其他备受瞩目的公开协议相一致。例如,News Corp 与 OpenAI 的交易估计在五年内价值超过 $250 million (nytimes.com),反映了对经过验证、高权威文本的高度溢价。对于数据所有者来说,教训很明确:你的估值不再仅仅与生产成本挂钩,而是与你为买家提供的法律风险缓解挂钩。
受版权保护数据集的核心估值驱动因素
虽然 $3,000 的锚点对书籍很有用,但并非所有受版权保护的数据都是平等的。为了确定精确的价格,双方必须根据四种主要的估值方法对数据集进行评估。您可以在我们的估值方法指南中详细了解这些内容。在受版权保护作品的背景下,目前有三个驱动因素决定着市场溢价:
- 可验证性和来源: 买家正在为具有记录在案的所有权链的“干净”数据支付溢价。在和解后的市场中,所有权模糊的数据越来越被视为负债而非资产。
- 元数据丰富度: 书籍的原始 PDF 价值远低于包含章节摘要、人物图谱或专家级注释的结构化数据集。高质量的元数据可以将每部作品的价值提升 2x 至 5x。
- 独家与非独家: 目前的大多数交易,如 Reddit 与 Google 之间披露的 $60 million 年度协议 (reuters.com),都是非独家的。防止竞争对手使用相同数据进行训练的独家权利通常会带来 300% 至 500% 的加价。
交易结构:许可模式
谈判正从一次性买断转向经常性收入模式。由于 AI 模型需要对新鲜数据进行持续的重新训练和“微调”,以下结构已成为标准:
1. 年度订阅(SaaS 模式): 常见于新闻机构和社交平台。买家支付经常性费用以访问新内容的实时流。这为买家提供了“新鲜度”,为所有者提供了可预测的现金流。
2. 按 Token 或按文档定价: 静态档案的首选。这种模式高度透明,但需要对数据如何在模型的训练周期中被摄取和使用进行严格审计。
3. 股权或收入分成: 出现在与较小的、高度专业化的数据所有者(例如医疗档案或技术手册)的交易中。数据所有者不是获得大笔预付款,而是获得所得模型的股份或该模型产生的 API 收入的百分比。
数据所有者清单
在进入谈判之前,拥有可货币化档案的机构应完成以下审计:
- 权利审计: 您是否拥有数字训练权,还是仅拥有出版权?许多较旧的合同并未明确涵盖机器学习用例。
- 数据清洗: 确保删除所有 PII(个人身份信息)。数据泄露或隐私违规的成本往往超过许可收入。
- 竞争基准测试: 查看我们的全面数据集目录,了解您垂直领域中类似档案在公开市场上的售价。
这对您意味着什么
从“抓取”到“许可”的转变是本世纪 AI 经济中最重要的单一转变。对于 数据所有者 来说,这意味着您的档案现在是资产负债表上的资产,具有明确的、受法院支持的估值。对于 数据买家 来说,这意味着数据获取现在是一项资本密集型项目,需要与企业并购 (M&A) 交易相同的尽职调查。无论您是希望将遗留档案货币化,还是为您的下一个模型确保训练管道,d-nvest 都提供透明度和市场基础设施,以充满信心地执行这些高风险交易。
Sources
- www.latimes.com
Data Academy
Go deeper with our guides
From the marketplace
Explore live data opportunities
d-nvest turns the data assets behind these deals into scored, actionable opportunities.
Explore the pipeline →