Scale AI lève 1 milliard de dollars en Série F à une valorisation de 13,8 milliards de dollars
Ce tour de table mené par Accel positionne Scale AI comme la principale 'Data Foundry' pour le développement de modèles d'IA de pointe.
Scale AI a finalisé un tour de financement de Série F de $1 billion (scale.com) qui porte sa valorisation post-monétaire à un montant divulgué de $13.8 billion (bloomberg.com). Mené par Accel avec une participation significative de Nvidia, Amazon et Meta, ce tour signale un pivot massif des capitaux vers le « goulot d'étranglement des données » auquel sont actuellement confrontés les plus grands développeurs de Large Language Model (LLM). Alors que l'industrie dépasse l'ère du « scraping du web ouvert », la mission de Scale AI de construire une « Data Foundry » représente l'investissement le plus important à ce jour dans la création d'actifs de données à haute densité et étiquetés par des experts pour l'IA souveraine et d'entreprise.
L'industrialisation des données d'IA
L'injection de $1 billion (scale.com) n'est pas simplement un tour de croissance ; c'est un pari sur l'infrastructure. Scale AI se positionne comme la raffinerie essentielle de la matière première du 21e siècle. Le financement sera utilisé pour mettre à l'échelle leur « Data Engine », qui fournit l'Apprentissage par renforcement à partir de la rétroaction humaine (RLHF) nécessaire pour pousser les modèles au-delà des plateaux de raisonnement actuels. Avec des investisseurs comme Cisco Investments, Intel Capital et AMD Ventures (bloomberg.com) rejoignant la table de capitalisation, l'accord souligne un consensus intersectoriel : la prochaine génération de performance de l'IA sera gagnée grâce à la qualité des données, et pas seulement par le volume de calcul.
Les accords de licence atteignent un sommet
Le tour de Scale AI coïncide avec une vague sans précédent d'accords directs d'acquisition de données entre les constructeurs de modèles et les propriétaires de contenus premium. Plus notablement, News Corp a signé un accord pluriannuel avec OpenAI (wsj.com) évalué à environ $250 million sur cinq ans (wsj.com). Ce partenariat accorde à OpenAI l'accès aux archives et au contenu actuel de The Wall Street Journal, Barron’s et The Times, marquant un virage définitif vers des ensembles de données sous licence et à haute autorité. De même, le partenariat d'OpenAI avec Reddit (openai.com) offre un accès en temps réel à l'API de données Reddit, permettant l'intégration de données conversationnelles centrées sur l'humain dans ChatGPT et d'autres produits.
Capitaliser sur les données incarnées et spécialisées
Au-delà des LLM textuels, le marché des actifs de données spécialisés voit des flux de capitaux massifs. Wayve a récemment sécurisé $1.05 billion (reuters.com) dans un tour de Série C mené par SoftBank pour développer une « IA incarnée » (Embodied AI) pour la conduite autonome. Cet accord met en lumière la prime accordée aux « données de bord » (edge data) — des informations sensorielles du monde réel qui ne peuvent être reproduites par la seule génération synthétique. Soutenant cet écosystème gourmand en données, CoreWeave a levé $1.1 billion (techcrunch.com) pour étendre son infrastructure cloud spécialisée, spécifiquement conçue pour gérer le débit massif requis pour les charges de travail d'entraînement d'IA intensives en données.
Le contrecoup réglementaire et des droits
Alors que la valeur des actifs de données monte en flèche, les détenteurs de droits agissent agressivement pour protéger leur propriété intellectuelle. Sony Music Group a émis un avertissement formel à plus de 700 entreprises d'IA (variety.com), déclarant un « opt-out » explicite contre le scraping non autorisé de données pour l'entraînement de l'IA. Cela fait suite à une série d'accords de licence, tels que l'accord d'OpenAI avec Vox Media (theverge.com) et The Atlantic (theatlantic.com), suggérant que l'ère du « fair use » pour les données d'entraînement est rapidement remplacée par un marché structuré de plusieurs milliards de dollars pour les droits de contenu.
Pourquoi cela importe pour les détenteurs de données
Pour les détenteurs de données institutionnels, la valorisation de Scale AI et l'accord News Corp confirment que les ensembles de données propriétaires ne sont plus des actifs secondaires — ils sont le levier principal de l'économie de l'IA. La transition des accords de licence de $250 million vers des tours de financement de $1 billion pour les raffineries de données indique que les « données propres étiquetées par des experts » constituent désormais une classe d'actifs distincte. Les propriétaires de données uniques, à haute vélocité ou historiquement profondes devraient donner la priorité à la gouvernance des données et à la « préparation à l'IA » pour capturer les valorisations premium actuellement fixées par les plus grands acteurs du marché.
Sources
Data Academy
Go deeper with our guides
Vos images spécialisées sont rares
Le visuel que l'IA ne trouve pas en ligne
Read the guide →3 min readAcheter de la donnée rare, en conformité
L'angle EU AI Act pour les acheteurs
Read the guide →4 min readLes places de marché de données, expliquées
Cloud-native, indépendantes, verticales — et ce que chacune sacrifie
Read the guide →From the marketplace
Explore live data opportunities
Mazzetti — Opportunité de jeu de données sur les marchés publics
View opportunity →industrielFenka — Opportunité de jeu de données de journaux de maintenance
View opportunity →industrielOpportunité de jeu de données sur les enregistrements réglementaires de Triggertech
View opportunity →News & Insights
Latest from the briefing
- La licence de données aux modèles d'IA cannibalise-t-elle le trafic de référence ?
- La tarification personnalisée est-elle légale ? Conformité pour les revenus basés sur les données
- Votre enregistrement de courtier en données représente-t-il désormais un risque financier quotidien ?
- Le coût financier et stratégique de la non-conformité des courtiers en données
d-nvest turns the data assets behind these deals into scored, actionable opportunities.
Explore the pipeline →