biological aiphysical aifunding rounddata licensing2026年7月4日

EvolutionaryScale 获得 1.42 亿美元用于生物数据人工智能

前 Meta 研究人员推出 ESM3,一个在 27.8 亿个蛋白质序列上训练的前沿模型,用于编程生物学。

EvolutionaryScale 已完成一项已披露的 1.42 亿美元种子轮融资(evolutionaryscale.ai),由 Nat Friedman、Daniel Gross 和 Lux Capital 领投,旨在将前沿人工智能模型商业化以用于生物数据。此次注资标志着生物技术领域人工智能种子轮融资规模的顶峰之一,预示着市场对“物理人工智能”——即能够理解和操纵物理世界基本构件的系统——有着强劲的需求。此次交易的核心是 ESM3 的发布,这是一个在专有和公共数据集上训练的生成模型,涵盖了 27.8 亿个蛋白质序列(evolutionaryscale.ai),该模型使研究人员能够通过在数字环境中模拟数十亿年的进化来有效地“编程”生物学。

生物数据资产的多模态优势

与以往的蛋白质语言模型不同,ESM3 是一个多模态前沿模型。它不仅仅预测结构;它同时推理序列、结构和功能。通过处理包含 27.8 亿个序列及其对应的三维结构的数据集(evolutionaryscale.ai),该模型可以生成自然界中不存在的全新蛋白质。这一能力将生物数据从进化的被动记录转变为药物发现、碳捕获和材料科学的活跃资产。该公司由 Meta 的 ESM 项目团队创立,正将自己定位为“生物学领域的 OpenAI”,向科学界提供该模型的一个版本,同时保留用于商业合作的高容量版本。

物理人工智能与数据货币化的转变

EvolutionaryScale 的交易凸显了一个更广泛的趋势,即最有价值的数据资产正从人类生成文本转向物理世界观察。虽然文本的 LLM 面临收益递减和版权方面的法律障碍,但生物数据提供了一个广阔、未被开发的领域。ESM3 模型使用了约 1.0 x 10^24 FLOPS 的计算能力进行训练(evolutionaryscale.ai),这一规模以前仅限于顶级通用模型。这项投资强调了在专业、高保真物理数据上训练模型的成本高昂——以及潜在回报丰厚。随着物理人工智能的成熟,结构化生物、化学和机器人数据集的许可价值预计将超过通用网络爬取数据。

竞争格局:生命科学中的数据护城河

EvolutionaryScale 进入的市场目前由 DeepMind 的 AlphaFold 3 主导,但其重点是生成式设计而非仅仅结构预测。该领域的竞争护城河正从模型架构转向训练语料库的规模和质量。通过开源 ESM3 的 14 亿参数版本的权重,该公司正试图为生物数据表示设定行业标准。与此同时,生态系统中的其他参与者正在 securing 自己的数据管道;例如,据彭博社报道,Poolside 正在与潜在投资者洽谈,计划筹集约 5 亿美元,将类似的底层模型原理应用于软件工程数据,这进一步说明了在特定垂直数据领域占据主导地位的竞争。

监管与数据获取的合法性

随着这些模型的规模不断扩大,数据获取的法律框架仍然是投资者关键的转折点。在一项对数据行业具有重大意义的裁决中,美国一家法院最近在与 Meta 的长期法律纠纷中(brightdata.com)支持了 Bright Data,确认抓取公共数据不违反《计算机欺诈和滥用法案》(CFAA),也不违反合同,前提是数据未受登录保护。这项裁决为像 EvolutionaryScale 这样依赖大规模抓取公共科学数据库来增强其专有训练集的 AI 公司提供了重要的法律保护。然而,其他地方的监管压力正在增加;欧盟委员会最近通知苹果公司,其初步认为苹果的应用商店规则违反了《数字市场法案》(ec.europa.eu),这提醒我们,数据控制者在如何控制对生态系统数据的访问方面正受到越来越多的审查。

基础设施与许可创新

处理这些生物数据集所需的基础设施也在不断发展。Etched 最近宣布了一项已披露的 1.2 亿美元 A 轮融资(etched.com),旨在为 Transformer 模型构建专用芯片,以提供下一代数据密集型物理人工智能所需的计算效率。在许可方面,Perplexity AI 推出了新的“出版商计划”(perplexity.ai),与包括 Time 和 Der Spiegel 在内的数据所有者建立收入共享模式。这一举措代表着数据用于人工智能市场的成熟,从未经授权的抓取转向结构化的多年许可协议,为人工智能公司提供稳定、高质量的数据管道,同时补偿原始创作者。

对数据所有者的意义

对于数据所有者而言,EvolutionaryScale 的交易证明,高度专业化的非文本数据集——例如基因序列或蛋白质结构——现在是人工智能经济中最有价值的资产之一。随着底层模型进入物理科学领域,提供清洁、结构化且合乎道德的数据以用于“物理人工智能”的能力将带来高额许可费用。数据所有者应专注于审计其专有数据集的生成潜力,因为市场正迅速从简单的数据存储转向用于模型训练和微调的资产的积极许可。

Get the next analysis

One deep-dive per edition on where valuable data is hiding — the evidence, the sources, and who would pay for it. No noise.

One email per edition. Unsubscribe any time. We never share your address.

From the marketplace

Explore live data opportunities

Browse datasets by sector & use-case
Found this useful? Share it

d-nvest turns the data assets behind these deals into scored, actionable opportunities.

Explore the pipeline →