EvolutionaryScale lève 142 millions de dollars pour des "World Models" biologiques
Nvidia et Amazon soutiennent une levée de fonds d'amorçage de 142 millions de dollars pour entraîner le modèle ESM3 sur un ensemble de données de 278 millions de protéines.
EvolutionaryScale a clôturé un tour de financement de démarrage de 142 millions de dollars (forbes.com) pour accélérer le développement de "modèles mondiaux" d'IA capables de simuler et d'ingénierer des systèmes biologiques. Ce tour, mené par Lux Capital, Nat Friedman et Daniel Gross, avec la participation de Nvidia et Amazon, positionne la startup à l'avant-garde de la course aux armements "data-for-biology". Le capital est destiné au perfectionnement d'ESM3, un modèle linguistique de pointe pour la biologie qui compte 98 milliards de paramètres (evolutionaryscale.ai) et a été entraîné sur un ensemble de données massif de 2,78 milliards de protéines (evolutionaryscale.ai).
L'essor des modèles mondiaux biologiques
Contrairement à l'IA générative traditionnelle qui se concentre sur le texte ou les pixels, EvolutionaryScale construit ce que les chercheurs appellent un "modèle mondial" pour les sciences de la vie. En traitant le code génétique comme un langage, le modèle ESM3 a démontré sa capacité à générer des protéines fluorescentes entièrement nouvelles qui s'écartent considérablement de celles trouvées dans la nature, simulant ainsi efficacement 500 millions d'années d'évolution (evolutionaryscale.ai) dans un environnement numérique. Cette capacité signale un changement sur le marché des actifs de données, où les ensembles de données les plus précieux ne sont plus seulement du texte extrait du web, mais des séquences biologiques hautement spécialisées et structurées qui peuvent être utilisées pour "programmer" la matière.
Le pivot de la licence de données : de l'usage équitable aux actifs payants
Le tour de financement d'EvolutionaryScale coïncide avec un changement de marché plus large vers la licence de données à haute intégrité. Alors que les données biologiques sont tokenisées pour la découverte de médicaments, les géants des médias sécurisent leurs propres archives. OpenAI a récemment signé un accord de licence de contenu pluriannuel (time.com) avec Time Magazine, accordant au laboratoire d'IA l'accès à plus de 100 ans d'archives journalistiques. Bien que les termes financiers restent confidentiels (reuters.com), l'accord fait suite au seuil de 250 millions de dollars divulgué (reuters.com) fixé par l'accord News Corp. De même, YouTube négocierait (ft.com) avec les principaux labels de disques, dont Sony et Universal, pour offrir des sommes forfaitaires estimées à plusieurs millions de dollars (ft.com) pour un accès légal aux catalogues musicaux pour l'entraînement de l'IA.
Obstacles réglementaires et provenance des données
Alors que la valeur des données d'entraînement explose, les régulateurs et les créateurs s'opposent à l'utilisation non autorisée. Figma a récemment désactivé sa fonctionnalité d'IA "Make Design" (theverge.com) suite à des allégations selon lesquelles elle aurait été entraînée sur des conceptions d'applications existantes, soulignant les risques juridiques des pipelines de données opaques. De plus, l'investissement rapporté de 10 à 20 millions de dollars (bloomberg.com) de SoftBank dans Perplexity AI intervient dans un contexte de nombreuses notifications de violation de droits d'auteur de la part des éditeurs, suggérant que même les startups d'IA à forte croissance doivent désormais allouer des budgets importants à la conformité des données et aux règlements. Cette tendance est encore étayée par le tour de financement estimé à 100 millions de dollars (techcrunch.com) de Harvey, qui valorise le spécialiste des données juridiques à environ 1,5 milliard de dollars (techcrunch.com premium, grâce à son accès à des ensembles de données juridiques propriétaires et à enjeux élevés.
Pourquoi c'est important pour les propriétaires de données
L'accord EvolutionaryScale prouve que la frontière la plus lucrative pour la monétisation des données se déplace du contenu web général vers les "modèles mondiaux spécifiques à un domaine". Pour les propriétaires de données dans les domaines de la biologie, du droit et de la musique, le marché a dépassé la simple licence pour un modèle de partenariat stratégique où les données sont le principal catalyseur des percées scientifiques et créatives. Alors que les laboratoires d'IA comme OpenAI et Anthropic épuisent les données publiques du web, la prime sur les ensembles de données propres, propriétaires et légalement approuvés continuera d'augmenter, transformant les archives passives en actifs financiers à haut rendement.
Data Academy
Go deeper with our guides
From the marketplace
Explore live data opportunities
Bentham — Opportunité de jeu de données d'enregistrements réglementaires
View opportunity →industrielDcubed — Opportunité d'actif de données téléchargeable
View opportunity →industrielOpportunité de jeu de données d'inspection — Umweltanalytik Saalfeld
View opportunity →News & Insights
Latest from the briefing
- Comment les mécanismes de suppression universelle impactent la valorisation des données de consommation
- Comment déterminer si votre entreprise est considérée comme un collecteur de données réglementé
- Le véritable coût opérationnel de la mise à l'échelle d'une activité de monétisation de données
- La licence de données aux modèles d'IA cannibalise-t-elle le trafic de référence ?
d-nvest turns the data assets behind these deals into scored, actionable opportunities.
Explore the pipeline →