Poolside AI 融资 4 亿美元,估值 20 亿美元,用于代码-数据 LLM
Coatue 和 Dragoneer 领投向这家总部位于巴黎的初创公司注入巨资,以扩展其专有的代码生成资产。
Poolside AI 接近达成一项协议,将在新一轮融资中筹集约 4 亿美元(bloomberg.com),公司估值将达到 20 亿美元(bloomberg.com)。本轮融资由 Coatue Management 和 Dragoneer Investment Group(techcrunch.com)领投,这表明市场对将大型语言模型(LLM)从通用对话推向自主软件工程所需的海量专业数据进行了巨额押注。通过将运营中心设在巴黎,Poolside 将自己定位在欧洲人工智能人才和数据生态系统的核心,特别瞄准定义下一代生产力工具的专有代码库和开发者工作流程。
专业数据护城河:超越通用 LLM
向 Poolside AI 注资凸显了市场对领域特定数据资产的更广泛转变。虽然通用模型已达到效用平台期,但专注于高保真、专业数据集的初创公司正在获得高估值。Poolside 的战略围绕着在海量结构化代码库上训练模型,这比标准的文本数据集需要更高的精度。这一趋势在生物领域也有体现,EvolutionaryScale 最近披露了其 1.42 亿美元的种子轮融资(reuters.com),用于商业化其 ESM3 模型。ESM3 在惊人的 27 亿个蛋白质序列(techcrunch.com)上进行了训练,这说明当今最有价值的数据资产是那些描绘科学和工程基本构建模块的数据。
许可大战:档案与实时访问
随着初创公司获得资金来构建模型,老牌人工智能巨头正在积极锁定历史数据档案。OpenAI 已与 Time(openai.com)达成一项多年内容许可协议,获得了 101 年的档案内容(theverge.com)访问权,以改进其模型并在 ChatGPT 中提供引用的回复。此项协议遵循了与 News Corp 和 Axel Springer 等出版商建立高价值合作伙伴关系的模式,为高权威文本数据确立了明确的市场价格。对于数据所有者而言,这些交易代表着从被动托管到主动资产管理的转变,因为对可验证的、由人类策划的信息的需求正在直接响应在线上人工智能生成“垃圾”的泛滥。
监管压力与数据完整性
然而,对数据的争夺正面临重大的法律和监管阻力。美国唱片业协会(RIAA)已对人工智能音乐生成器 Suno 和 Udio(reuters.com)提起诉讼,寻求对每项侵权作品高达 15 万美元的法定损害赔偿(billboard.com)。与此同时,设计巨头 Figma 因其人工智能训练数据政策(theverge.com)而面临强烈反对,迫使该公司澄清其对企业用户的选择退出机制。这些事件表明,尽管数据密集型人工智能的资金充裕,“狂野西部”时代未经补偿的抓取正在结束。像 Glean 这样正在洽谈以 45 亿美元估值(reuters.com)筹集 2.5 亿美元(reuters.com)的公司,正通过专注于安全、已授权的企业内部数据而非公开的网络抓取内容而取得成功。
这对数据所有者意味着什么
Poolside AI 的估值以及对音乐初创公司的诉讼证明,市场正在分化:通用数据正在商品化,而专业、高完整性的数据资产正成为主要的超额收益来源。对于数据所有者而言,机会在于从一次性许可转向经常性的数据即服务(DaaS)模型。随着欧盟人工智能法案开始强制执行训练集的透明度,数据的来源将变得与数据本身一样有价值,从而使合规性成为机构数据持有者的竞争优势。
Data Academy
Go deeper with our guides
From the marketplace
Explore live data opportunities
Powerbee — 工业传感器数据集机会
View opportunity →工业Everactive — 工业传感器数据集机会
View opportunity →工业Texasenterprises — 维护日志数据集机会
View opportunity →d-nvest turns the data assets behind these deals into scored, actionable opportunities.
Explore the pipeline →