OpenAI 与 Time 达成多年数据许可协议
此次合作确保了 101 年的档案数据可用于 AI 训练,巩固了“付费训练”市场。
OpenAI 已与 Time Magazine 签署了一项为期多年的授权协议,将其 101 years 的存档内容整合到其生成式 AI 模型中 (openai.com)。此次合作使该 AI 实验室能够访问 Time 悠久历史中的数百万篇文章,使其产品(包括 ChatGPT)在引用和链接回原始报道的同时,利用这些数据来提高模型的准确性和事实基础。虽然财务条款尚未披露,但行业基准表明,该交易遵循了 OpenAI 此前与 News Corp 达成的估值约 $250 million(估计)协议的轨迹 (wsj.com)。
转向授权档案的战略转型
与 Time 的交易代表了 OpenAI 战略中的一个关键支柱,旨在使其训练管道免受围绕网络抓取的法律和监管波动的影响。通过获取一个世纪的高质量、经人工验证的数据,OpenAI 实际上正在构建一个授权智能的“护城河”。此举不仅关乎内容获取,更关乎数据资产的结构完整性。Time 的档案提供了全球事件的时间序列数据集,这对于训练模型理解历史背景和长期叙事转变具有不可估量的价值。这顺应了一个更广泛的趋势,即出版商不再将他们的档案视为静态的历史,而是将其视为生成式时代的动态训练资产。
诉讼替代方案:$1.6 Billion 的警告
正式授权的紧迫性因针对未经授权数据使用的巨大法律压力而愈发凸显。本周,代表 Sony Music 和 Universal Music Group 等巨头的 Recording Industry Association of America (RIAA) 对 AI 音乐初创公司 Suno 和 Udio 提起了具有里程碑意义的 $1.6 billion(估计)版权侵权诉讼 (reuters.com)。原告要求对每件侵权作品进行高达 $150,000(已披露)的法定赔偿 (theverge.com)。这种激进的诉讼充当了市场信号:“先抓取后道歉”的时代正在结束,未经授权的数据成本现在正被法院定以高价。
数据基础设施的整合
除了授权之外,以数据为中心的基础设施市场正在经历快速整合。OpenAI 最近以未披露的金额(估计为数亿美元)收购了实时搜索和分析数据库公司 Rockset (openai.com)。此次收购是增强“检索增强生成” (RAG) 的直接举措,允许企业用户更有效地索引自己的专有数据资产。与此同时,数据密集型 AI 的投资前景依然强劲;Etched 最近完成了 $120 million(已披露)的 A 轮融资,用于开发优化 Transformer 架构数据处理的专用芯片 (techcrunch.com)。
全球监管与数据挤压
监管机构正在使数据获取环境进一步复杂化。European Commission 最近指控 Apple 违反了 Digital Markets Act (DMA),专门针对这家科技巨头的“引导”规则,这些规则限制了开发者管理自己客户数据和关系的方式 (https://ec.europa.eu/commission/presscorner/detail/en/ip_24_3433)。随着监管机构收紧对数据可移植性和生态系统锁定的控制,像 Time 档案这样的“第一方”授权数据的价值只会增加。在当前的资本环境下,拥有自己的数据管道并对其训练集拥有明确法律所有权的公司发现自己处于显著的竞争优势。
为什么这对数据所有者很重要
对于机构数据所有者而言,OpenAI-Time 交易和并发的 RIAA 诉讼证实了高质量、结构化的数据集现在是 AI 供应链中最有价值的商品。我们正走向一个分化的市场:一个是针对授权、干净数据的高价值“白区市场”,另一个是针对抓取内容的高风险“灰色市场”。数据所有者应优先考虑其档案的策划和法律审计,因为由 YouTube 和 OpenAI 开创的“一次性付款”授权模式正成为专有内容资产的标准退出方式。数据的估值不再与页面浏览量挂钩,而是与其作为基础训练权重的效用挂钩。
Sources
Data Academy
Go deeper with our guides
From the marketplace
Explore live data opportunities
d-nvest turns the data assets behind these deals into scored, actionable opportunities.
Explore the pipeline →