biological aiphysical aifunding rounddata licensing4 juillet 2026

EvolutionaryScale lève 142 millions de dollars pour l'IA de données biologiques

D'anciens chercheurs de Meta lancent ESM3, un modèle de pointe entraîné sur 2,78 milliards de séquences de protéines pour programmer la biologie.

EvolutionaryScale a clôturé un tour de financement d'amorçage annoncé de 142 millions $ (evolutionaryscale.ai) dirigé par Nat Friedman, Daniel Gross et Lux Capital pour commercialiser des modèles d'IA de pointe pour les données biologiques. Cette injection de capital marque l'une des étapes d'amorçage les plus importantes de l'histoire de l'IA axée sur la biotechnologie, signalant un appétit agressif du marché pour l'« IA physique » — des systèmes capables de comprendre et de manipuler les composants fondamentaux du monde physique. Au cœur de la transaction se trouve le lancement d'ESM3, un modèle génératif entraîné sur un ensemble de données propriétaires et publiques couvrant 2,78 milliards de séquences de protéines (evolutionaryscale.ai), qui permet aux chercheurs de « programmer » efficacement la biologie en simulant des milliards d'années d'évolution dans un environnement numérique.

L'avantage multimodal dans les actifs de données biologiques

Contrairement aux itérations précédentes des modèles de langage protéique, ESM3 est un modèle de pointe multimodal. Il ne se contente pas de prédire la structure ; il raisonne simultanément sur la séquence, la structure et la fonction. En traitant un ensemble de données de 2,78 milliards de séquences et leurs structures 3D correspondantes (evolutionaryscale.ai), le modèle peut générer des protéines entièrement nouvelles qui n'existent pas dans la nature. Cette capacité transforme les données biologiques d'un enregistrement passif de l'évolution en un actif actif pour la découverte de médicaments, la capture du carbone et la science des matériaux. L'entreprise, fondée par l'équipe à l'origine du projet ESM de Meta, se positionne comme l'« OpenAI de la biologie », offrant une version du modèle à la communauté scientifique tout en conservant des versions à haute capacité pour des partenariats commerciaux.

L'IA physique et le changement dans la monétisation des données

L'accord EvolutionaryScale met en évidence une tendance plus large où les actifs de données les plus précieux passent du texte généré par l'homme aux observations du monde physique. Alors que les LLM pour le texte font face à des rendements décroissants et à des obstacles juridiques liés au droit d'auteur, les données biologiques offrent une vaste frontière inexploitée. Le modèle ESM3 a été entraîné en utilisant environ 1,0 x 10^24 FLOPS de puissance de calcul (evolutionaryscale.ai), une échelle auparavant réservée aux modèles polyvalents de premier plan. Cet investissement souligne le coût élevé — et le rendement potentiel élevé — de l'entraînement de modèles sur des données physiques spécialisées et de haute fidélité. À mesure que l'IA physique mûrit, l'octroi de licences pour des ensembles de données biologiques, chimiques et robotiques structurés devrait dépasser les données générales collectées sur le web en termes de valeur par jeton.

Le paysage concurrentiel : les fossés de données dans les sciences de la vie

EvolutionaryScale entre sur un marché actuellement dominé par AlphaFold 3 de DeepMind, mais avec un accent distinct sur la conception générative plutôt que sur la simple prédiction structurelle. Le fossé concurrentiel dans ce secteur s'éloigne de l'architecture des modèles pour se diriger vers l'échelle et la qualité du corpus d'entraînement. En ouvrant le code source des poids pour une version de 1,4 milliard de paramètres d'ESM3, l'entreprise tente d'établir la norme de l'industrie pour la représentation des données biologiques. Pendant ce temps, d'autres acteurs de l'écosystème sécurisent leurs propres pipelines de données ; par exemple, Poolside serait en pourparlers pour lever environ 500 millions $, selon Bloomberg, afin d'appliquer des principes de modèles de fondation similaires aux données de génie logiciel, illustrant davantage la course pour dominer des domaines de données verticaux spécifiques.

Réglementation et légalité de l'acquisition de données

À mesure que ces modèles montent en charge, le cadre juridique de l'acquisition des données reste un point pivot critique pour les investisseurs. Dans une décision importante pour l'industrie des données, un tribunal américain a récemment statué en faveur de Bright Data dans sa bataille juridique de longue date avec Meta (brightdata.com), affirmant que le scraping de données publiques ne viole pas le Computer Fraud and Abuse Act (CFAA) et ne rompt pas les contrats lorsque les données ne sont pas protégées par un identifiant. Cette décision fournit un bouclier juridique vital pour les entreprises d'IA comme EvolutionaryScale qui s'appuient sur la collecte à grande échelle de bases de données scientifiques publiques pour augmenter leurs ensembles d'entraînement propriétaires. Cependant, la pression réglementaire monte ailleurs ; la Commission européenne a récemment informé Apple de son avis préliminaire selon lequel les règles de son App Store enfreignent le Digital Markets Act (ec.europa.eu), un rappel que les contrôleurs d'accès aux données font l'objet d'une surveillance accrue quant à la manière dont ils contrôlent l'accès aux données de l'écosystème.

Innovations en matière d'infrastructure et de licences

L'infrastructure requise pour traiter ces ensembles de données biologiques évolue également. Etched a récemment annoncé une série A de 120 millions $ (etched.com) pour construire des puces spécialisées pour les modèles transformeurs, visant à fournir l'efficacité de calcul nécessaire à la prochaine génération d'IA physique gourmande en données. Sur le front des licences, Perplexity AI a lancé un nouveau « Publishers Program » (perplexity.ai) pour créer un modèle de partage des revenus avec les propriétaires de données, y compris Time et Der Spiegel. Cette initiative représente une maturation du marché des données pour l'IA, s'éloignant du scraping non autorisé pour se diriger vers des accords de licence structurés et pluriannuels qui fournissent aux entreprises d'IA des pipelines de données stables et de haute qualité tout en rémunérant les créateurs originaux.

Pourquoi cela est important pour les propriétaires de données

Pour les propriétaires de données, l'accord EvolutionaryScale prouve que les ensembles de données hautement spécialisés et non textuels — tels que les séquences génomiques ou les structures de protéines — figurent désormais parmi les actifs les plus précieux de l'économie de l'IA. À mesure que les modèles de fondation s'étendent aux sciences physiques, la capacité à fournir des données propres, structurées et sourcées de manière éthique pour l'« IA physique » commandera des frais de licence élevés. Les propriétaires de données devraient se concentrer sur l'audit de leurs ensembles de données propriétaires pour leur potentiel génératif, car le marché passe rapidement du simple stockage de données à l'octroi de licences actives d'actifs pour l'entraînement et l'ajustement des modèles.

Get the next analysis

One deep-dive per edition on where valuable data is hiding — the evidence, the sources, and who would pay for it. No noise.

One email per edition. Unsubscribe any time. We never share your address.

From the marketplace

Explore live data opportunities

Browse datasets by sector & use-case
Found this useful? Share it

d-nvest turns the data assets behind these deals into scored, actionable opportunities.

Explore the pipeline →