licensingopenaidata acquisitionmedia deals2026年6月27日

OpenAI 与 Time 达成多年数据授权协议

OpenAI 获得 101 年 Time 杂志档案的访问权限,用于优化 ChatGPT 和训练下一代模型。

OpenAI 已正式与《时代》杂志达成一项多年内容许可协议,使这家人工智能巨头能够访问其 101 多年的存档报道,以完善其生成模型并增强 ChatGPT 的实时响应能力。虽然具体的财务条款仍未披露,但行业基准表明,该交易遵循了 OpenAI 此前与新闻集团(News Corp)达成的 2.5 亿美元(https://www.cnbc.com/2024/05/22/news-corp-strikes-multiyear-deal-with-openai.html)多年合作伙伴关系的估值轨迹。此次最新收购的优质编辑数据,允许 OpenAI 在适当引用和链接的情况下展示《时代》杂志的新闻报道,同时利用其百年深厚的存储库进行后端模型训练。

战略性转向许可编辑资产

与《时代》杂志的合作并非孤立事件,而是 OpenAI 规避法律风险同时确保高保真数据的一项核心战略。通过许可可追溯至 1923 年的档案,OpenAI 实际上是在购买 20 世纪和 21 世纪的精选历史。此举紧随一系列类似的高风险收购,包括与 Vox Media 和《大西洋月刊》以及 Axel Springer 和 Le Monde 等国际出版商达成的交易。随着人工智能开发商面临越来越大的压力,要求他们放弃已引发大规模版权诉讼的未经授权的网络抓取行为,经过验证的人工撰写数据市场已达到白热化程度。

对于《时代》杂志而言,这项交易代表了对其遗留资产的关键货币化。该出版物将能够访问 OpenAI 的技术,为其读者开发新工具,这标志着传统媒体与人工智能基础设施之间更深层次的融合。这种趋势在市场其他地方也有体现;例如,软银最近向专注于利用海量临床数据支持精准医疗的公司 Tempus AI 投资了 2 亿美元(https://www.bloomberg.com/news/articles/2024-06-24/softbank-invests-200-million-in-ai-medical-firm-tempus-ai)。无论是在新闻业还是在医疗保健领域,底层数据集的价值现在是资本配置的主要驱动力。

法律压力与免费抓取的终结

人工智能公司抓紧许可协议的紧迫性,得到了日益严峻的法律环境的印证。就在本周,包括索尼音乐和环球音乐集团在内的全球最大唱片公司,对人工智能音乐初创公司 Suno 和 Udio 提起重大诉讼,指控其未经授权使用受版权保护的录音来训练其系统。这些唱片公司正在为每项侵权作品寻求高达 15 万美元(https://www.reuters.com/legal/major-record-labels-sue-ai-firms-suno-udio-over-copyright-infringement-2024-06-24/)的赔偿。这项诉讼凸显了那些依赖“合理使用”原则进行大规模数据摄取而无需付费的人工智能公司所面临的生存威胁。

与此同时,基础设施提供商正在进行大规模融资,以支持这些许可数据集的处理。Etched,一家专业芯片制造商,在 A 轮融资中筹集了 1.2 亿美元(https://techcrunch.com/2024/06/25/etched-raises-120m-to-build-a-chip-that-only-runs-transformer-models/),用于制造专门用于更高效运行 Transformer 模型硬件。随着行业的成熟,重点正从通用计算能力转向能够从像 OpenAI-Time 协议这样解锁的特定、高质量数据孤岛中提取最大价值的专用系统。

全球监管壁垒收紧

监管环境也迫使数据采集采取更透明的方法。欧盟的《人工智能法案》正朝着全面实施迈进,要求通用人工智能模型的开发者提供用于训练的数据的详细摘要。这种透明度要求使得公司越来越难以隐藏使用抓取或盗版内容的行为。在这种背景下,直接许可协议不仅仅是一种内容策略;它是一种合规的必要条件。

市场正在出现“干净”模型(使用许可数据训练)和继续依赖有争议的抓取行为的“高风险”模型之间的分化。投资者显然更青睐前者,正如苹果公司与 Meta 公司就 Meta 的 Llama 模型可能集成到 Apple Intelligence 中进行讨论所证明的那样——这项交易可能需要严格的数据来源保证,以满足苹果的隐私和法律标准。

这对数据所有者意味着什么

OpenAI-Time 交易证实,“数据即资产”的时代已从理论走向了数百万美元的现实。对于专有数据集的所有者——无论是历史档案、临床记录还是技术文档——当前市场都提供了一个独特的窗口来货币化沉睡的资产。随着人工智能开发者耗尽高质量的公共网络数据供应,独家、人工验证且法律清晰的数据集的溢价将持续上涨。数据所有者应将他们的档案视为不仅是过去的记录,更是下一代工业和消费者智能的关键燃料。

Get the next analysis

One deep-dive per edition on where valuable data is hiding — the evidence, the sources, and who would pay for it. No noise.

One email per edition. Unsubscribe any time. We never share your address.

From the marketplace

Explore live data opportunities

Browse datasets by sector & use-case
Found this useful? Share it

d-nvest turns the data assets behind these deals into scored, actionable opportunities.

Explore the pipeline →