world modelsphysical aidata licensingai training2026年7月15日

网络抓取无法训练下一代人工智能

为什么下一代人工智能——世界模型、物理人工智能——将依赖于从未在线发布的数据

十五年来,现代人工智能都基于一个隐含的假设:模型所需的一切都已存在于互联网上——你只需去获取即可。这个假设正在消亡。随之而生的是一个全新的市场——介于那些构建未来模型的人和那些拥有真实世界数据的人之间。

以下是我为何相信 2026 年将是数据从免费原材料转变为可交易战略资产的一年。

1. 互联网正在触及天花板——并开始污染自身

临界点并非主观臆断。它是算术。

根据 Epoch AI 的数据,公开可用的高质量人类文本总量约为 300 万亿个 token——大型模型将在2026 年至 2032 年之间耗尽这一储备,其中位数预测约为 2028 年(Epoch AI,《我们是否会耗尽数据?》,ICML 2024)。

这并非少数孤立研究者的担忧。2024 年 12 月,在 NeurIPS 会议上,Ilya Sutskever——OpenAI 的联合创始人——直言不讳地说:“我们所知的预训练将终结”,因为“计算能力在增长,但数据却在增长,因为我们只有一个互联网。”他称数据为“人工智能的化石燃料”:它曾被创造出来,我们已经消耗了它,并且我们已经达到了“数据峰值”(据 The Verge 报道,2024 年 12 月)。

更糟的是:水源正在被污染。一项发表在 Nature 上的研究(Shumailov 等人,2024 年 7 月)证明了“模型坍塌”——一个在 AI 生成内容上递归训练的模型会退化,并丢失关于世界真实分布的信息。而网络正在充斥着正是这样的内容:根据 Graphite 的数据,AI 生成的文章份额最早在 2024 年 11 月就超过了人类撰写的文章(截至 2025 年 5 月约占 52%)。我们曾经汲取的源泉现在却充满了模型自身的倒影。

而且大门正在关闭。自 2025 年 7 月 1 日起,Cloudflare——其服务覆盖了约五分之一的互联网——默认阻止 AI 爬虫。在发布者方面,近一半的新闻网站现在至少阻止一个 AI 爬虫。在法律方面,《纽约时报诉 OpenAI 案》(于 2023 年底提起)在 2025 年驳回动议后继续进行,并将在实质上审理。

第一部分的结论:催生生成式人工智能的资源——免费的公共文本——正同时变得有限、受污染、被锁定和被争夺。

2. 实验室已经开始付费

爬取数据不再足够的最佳证明是,那些依赖爬取数据的公司正在掏出钱包

  • OpenAINews Corp:据报道,一项许可协议价值超过 2.5 亿美元,为期 5 年(据 WSJ 报道,2024 年 5 月)。
  • GoogleReddit:为数据访问支付约每年 6000 万美元(据 Reuters 报道,2024 年 2 月)。
  • OpenAIAxel SpringerFinancial TimesLe MondeAssociated Press……在 2024-2025 年期间,出现了一系列交易,金额从“数千万美元”到未披露的数额不等。

与此同时,市场基础设施正在建设中:Microsoft 在 2026 年初宣布推出“Publisher Content Marketplace”,以撮合发布者和 AI 开发者之间的内容许可交易。而 Scale AI 的惊人估值——在Meta 投资约 143 亿美元获得约 49% 的股份后,估值约为290 亿美元(2025 年 6 月)——说明了一个简单的事实:训练数据现在是战略级资产。

信息很明确。数据不再被爬取。它被许可谈判购买

3. 真正的转变:未来的模型不需要更多网络——它们需要别的东西

这是大多数分析所忽略的一点。

人工智能的下一个前沿不是另一个 LLM。而是世界模型物理人工智能:这些系统不仅操纵语言,还能建模模拟在真实世界中采取行动

  • NVIDIA 在 CES(2025 年 1 月)上推出了 Cosmos,这是一系列用于物理人工智能的世界基础模型。黄仁勋称之为“机器人领域的 ChatGPT 时刻”。这些模型以PB 级视频和传感器数据为食——NVIDIA 声称在 14 天内处理了2000 万小时的视频
  • Google DeepMind 先后推出了 Genie 2(2024 年 12 月)和 Genie 3(2025 年 8 月):这些模型能够生成可玩交互式世界,用于训练具身智能体。
  • Fei-Fei Li——计算机视觉领域的先驱——早在 2024 年 9 月就为 World Labs 筹集了2.3 亿美元,该实验室围绕“空间智能”构建,随后在 2026 年又获得了约10 亿美元的资金。

但这些模型遇到了网络无法逾越的障碍。不存在可以爬取的“物理交互互联网”。机器人训练数据仍然很少:具身人工智能领域的参考数据集以数十万次演示为单位(RT-1:约 130,000 次;VIMA:约 650,000 次),而像 LAION-5B 这样的视觉-语言语料库则包含57 亿条数据。真实世界的数据必须一次一个手势一次一个传感器一次一次行程地捕获

这正是Tesla(截至 2026 年 5 月,累计超过 100 亿 FSD 里程)和Waymo超过 1 亿自动驾驶里程)将其车队视为可防御资产的原因:它不在网上,无法从文本经纪商那里购买——它是在真实世界中产生的。

下一代人工智能所缺少的数据从未在线上存在过。它存在于工厂、车队、医院、电网、供应链中。它属于运营商,而不是实验室。

4. 我们在现场看到的——以及为什么这是一个双边市场

这就是我们在 d-nvest 的工作与这一论点相契合的地方——因为我们不仅评论它,我们还衡量它。

在我们的平台上,我们迄今已绘制了311 个真实数据持有者的图谱——这些组织在生产,通常是无意识地,正是未来人工智能所需的数据类型:

  • 66% 是时间序列数据(311 个中的 206 个)——传感器、遥测、机器日志:物理世界的原始信号。
  • 主要行业是工业(149 个)、出行(91 个)和医疗保健(24 个)——物理人工智能,而非网络文本。
  • 用例就像工业人工智能的路线图:预测性维护(136 个)、工业监控(64 个)、文档智能(34 个)、监管 RAG(19 个)、诊断人工智能(15 个)。
  • 在需求方,买家已经按画像识别:基础模型实验室计算机视觉团队垂直 LLM 构建者工业人工智能供应商
  • 所有这些都分布在重要的市场——英国法国美国德国加拿大——并且有近1000 条新闻信号证实了这些持有者真实的活动。

这些储备解决了并非空穴来风的市场:仅预测性维护在 2025 年就价值约140 亿美元(年复合增长率约 28%),工业物联网超过 4800 亿美元工业人工智能440 亿美元

一方面是持有者,他们拥有被低估的稀缺资源。另一方面是买家——下一代人工智能的构建者——他们准备为该资源付费,正如他们的许可协议已经证明的那样。他们之间缺失的是匹配、资格认证和信任的基础设施。这正是我们正在构建的。

底线

网络爬取训练了当前一代的模型。它将无法训练下一代模型。公共文本是有限的,它正在污染自身,并且正在关闭。世界模型和物理人工智能需要一种不同类型的数据——真实、操作性、多模态——这种数据从未被发布过,也永远不会被发布。

这些数据已经存在。它属于成千上万的运营商,他们常常不知道自己坐拥着未来十年人工智能的黄金。

问题不再是“我们在哪里找到数据”。而是“我们如何将持有数据的人与需要数据的人联系起来”。这是一个双边市场,而且才刚刚开始。

如果您是生产工业、出行或医疗保健数据的运营商——或者您是正在寻找专有真实世界数据集的人工智能参与者——现在是时候进行交流了。

— Salim Labriki, d-nvest

方法说明:许可协议金额为媒体(WSJ、Reuters、Bloomberg)报道的金额,很少得到双方的官方确认。库存数据(311 个持有者、模态、行业)来自我们截至 2024 年 7 月 1 日的自行绘制。

Get the next analysis

One deep-dive per edition on where valuable data is hiding — the evidence, the sources, and who would pay for it. No noise.

One email per edition. Unsubscribe any time. We never share your address.

From the marketplace

Explore live data opportunities

Browse datasets by sector & use-case
Found this useful? Share it

d-nvest turns the data assets behind these deals into scored, actionable opportunities.

Explore the pipeline →
网络抓取无法训练下一代人工智能 | d-nvest