biological dataai fundingdata licensingdefense airegulation1 juillet 2026

EvolutionaryScale Lève 142 Millions de Dollars pour Développer des Modèles de Données Biologiques

La startup clôture une levée de fonds d'amorçage pour construire une IA générative utilisant un jeu de données de 2,78 milliards de séquences protéiques.

EvolutionaryScale a clôturé une levée de fonds de démarrage de 142 millions de dollars (https://www.forbes.com/sites/alexkonrad/2024/06/25/evolutionaryscale-raises-142-million-for-biology-ai/) pour accélérer le développement de modèles d'IA générative entraînés sur des ensembles de données biologiques massifs. La levée de fonds, menée par Nat Friedman, Daniel Gross et Lux Capital, positionne l'entreprise pour traiter la biologie comme un actif de données programmable, en s'appuyant sur son nouveau modèle ESM3 qui a été entraîné sur un ensemble de données de 2,78 milliards de séquences protéiques (https://www.evolutionaryscale.ai/blog/esm3-release). Cette étape souligne la valeur croissante des données non textuelles et spécifiques à un domaine dans la course aux capacités d'IA de pointe.

L'essor des actifs de données biologiques

Contrairement aux LLM à usage général qui parcourent le web public, la proposition de valeur d'EvolutionaryScale repose sur la curation et le traitement d'informations biologiques spécialisées. Le modèle ESM3 est un modèle génératif multimodal capable de raisonner sur la séquence, la structure et la fonction des protéines. En traitant des milliers de milliards de points de données (https://www.evolutionaryscale.ai/blog/esm3-release) issus du monde naturel, la startup vise à permettre aux chercheurs de « programmer » de nouvelles protéines, potentiellement en réduisant les délais de découverte de médicaments de plusieurs années à quelques semaines. Cette approche « ChatGPT pour la biologie » met en évidence une tendance de marché plus large : la monétisation de jeux de données scientifiques propriétaires et de haute fidélité qui ne peuvent pas être facilement reproduits par des robots d'exploration génériques.

Licences vs. Litiges : La bataille pour les droits sur les données

Le financement de startups axées sur les données comme EvolutionaryScale intervient alors que le paysage juridique de l'acquisition de données atteint un point critique. OpenAI et le magazine Time ont récemment finalisé un accord de licence de contenu pluriannuel (https://openai.com/index/openai-and-time-sign-multi-year-content-partnership-and-strategic-alliance/), accordant à OpenAI l'accès aux archives de Time, vieilles de 101 ans. Bien que les termes financiers exacts n'aient pas été divulgués, les analystes de l'industrie citent l'accord estimé à 250 millions de dollars d'OpenAI avec News Corp (https://www.reuters.com/technology/news-corp-strikes-ai-content-licensing-deal-with-openai-2024-05-22/) comme référence pour la prime désormais accordée au journalisme humain vérifié.

Inversement, le coût de l'acquisition de données sans licence devient prohibitif. La RIAA, représentant des labels majeurs comme Sony et Universal, demande des dommages et intérêts statutaires allant jusqu'à 150 000 $ par œuvre (https://www.reuters.com/legal/music-labels-sue-suno-udio-ai-copyright-infringement-2024-06-24/) dans un procès contre les startups de musique IA Suno et Udio. Avec des centaines de milliers d'enregistrements prétendument utilisés sans autorisation, la responsabilité totale pourrait atteindre une estimation de 13,5 milliards de dollars (https://www.reuters.com/legal/music-labels-sue-suno-udio-ai-copyright-infringement-2024-06-24/). Cette pression juridique force une transition de la défense de « l'usage loyal » vers un marché de données structuré où chaque token d'entraînement a une provenance et un prix clairs.

Afflux de capitaux dans l'infrastructure gourmande en données

La demande d'IA prête pour les données a également déclenché des investissements massifs dans l'infrastructure. Helsing, une entreprise européenne d'IA de défense, a obtenu 450 millions d'euros (https://www.reuters.com/technology/defense-ai-startup-helsing-raises-450-mln-euro-funding-round-2024-07-04/) lors d'une levée de fonds de série C, valorisant l'entreprise à environ 5 milliards d'euros (https://www.bloomberg.com/news/articles/2024-06-17/defense-ai-startup-helsing-is-said-to-near-400-million-funding). Les systèmes de défense définis par logiciel de Helsing s'appuient sur le traitement en temps réel des données de capteurs du champ de bataille, représentant un secteur vertical critique pour la monétisation des actifs de données dans le secteur public. De même, Etched.ai a levé 120 millions de dollars (https://techcrunch.com/2024/06/25/etched-raises-120m-to-build-a-chip-that-only-runs-transformer-models/) pour construire des puces spécialisées conçues spécifiquement pour gérer le débit de données massif requis par les modèles Transformer.

Dans le domaine de la technologie juridique, la startup Harvey serait en discussion pour lever de nouveaux capitaux à une valorisation estimée à 2 milliards de dollars (https://techcrunch.com/2024/06/25/legal-ai-startup-harvey-is-raising-600m-from-google-at-a-2b-valuation/). L'actif principal de Harvey est son accès et son traitement de données juridiques propriétaires, prouvant davantage que le marché récompense les entreprises qui contrôlent le « fossé de données » plutôt que le simple algorithme.

Pourquoi c'est important pour les propriétaires de données

Pour les propriétaires de données institutionnels, les accords EvolutionaryScale et OpenAI-Time confirment que l'ère du scraping de données gratuit touche à sa fin. Les données ne sont plus un sous-produit des opérations commerciales ; elles sont une classe d'actifs primaire. Qu'il s'agisse de séquences biologiques, d'archives historiques ou de précédents juridiques, le marché offre désormais deux voies distinctes : des partenariats de licence de plusieurs millions de dollars pour ceux qui coopèrent, et des litiges de plusieurs milliards de dollars pour ceux dont les actifs sont pris sans consentement. À mesure que les modèles d'IA deviennent plus spécialisés, la valeur des jeux de données de niche et de haute intégrité continuera de dépasser la valeur du contenu générique extrait du web.

Get the next analysis

One deep-dive per edition on where valuable data is hiding — the evidence, the sources, and who would pay for it. No noise.

One email per edition. Unsubscribe any time. We never share your address.

From the marketplace

Explore live data opportunities

Browse datasets by sector & use-case
Found this useful? Share it

d-nvest turns the data assets behind these deals into scored, actionable opportunities.

Explore the pipeline →