EvolutionaryScale lève 142 millions de dollars pour entraîner l'IA sur 2,8 milliards de séquences protéiques
Menée par Lux Capital, la startup d'IA biologique cible le marché de la découverte de médicaments avec des jeux de données génomiques propriétaires.
EvolutionaryScale a finalisé une levée de fonds d'amorçage de 142 millions de dollars (https://techcrunch.com/2024/06/25/evolutionaryscale-is-building-a-chatgpt-for-biology-with-142m-from-nat-friedman-and-lux-capital/) pour commercialiser ESM3, un modèle d'IA générative entraîné sur un corpus massif de 2,78 milliards de séquences protéiques (https://www.forbes.com/sites/alexkonrad/2024/06/25/evolutionaryscale-raises-142-million-for-biological-ai/). La levée de fonds, menée par Lux Capital, Nat Friedman et Daniel Gross, avec la participation d'Amazon et de NVentures (la branche capital-risque de Nvidia), signale un changement décisif sur le marché des actifs de données : la transition des LLM à usage général vers des modèles de données biologiques spécialisés et de haute fidélité. ESM3 représente l'une des plus grandes applications de données scientifiques à l'ère de l'IA, avec 98 milliards de paramètres (https://www.forbes.com/sites/alexkonrad/2024/06/25/evolutionaryscale-raises-142-million-for-biological-ai/) et la capacité de simuler 500 millions d'années d'évolution pour concevoir de nouvelles protéines.
La Frontière des Données Biologiques
Contrairement aux ensembles de données riches en texte qui ont alimenté la première vague d'IA générative, la proposition de valeur d'EvolutionaryScale repose entièrement sur la curation et le traitement des données génomiques et protéomiques. En s'entraînant sur des milliards de séquences, l'entreprise crée effectivement une couche de "biologie programmable". Cette démarche souligne la prime désormais accordée aux données scientifiques structurées, qui sont beaucoup plus rares et plus difficiles à ingérer que le texte du web public. L'implication d'Amazon et de Nvidia (https://techcrunch.com/2024/06/25/evolutionaryscale-is-building-a-chatgpt-for-biology-with-142m-from-nat-friedman-and-lux-capital/) suggère que les fournisseurs d'infrastructure sont désireux de sécuriser une position dans le pipeline de données biologiques, qui devrait révolutionner le secteur de la R&D pharmaceutique évalué à 1 billion de dollars.
Acquisition Stratégique de Données par OpenAI
La quête d'efficacité des données ne se limite pas à la biologie. OpenAI a récemment annoncé l'acquisition de Rockset (https://openai.com/index/openai-to-acquire-rockset/), une entreprise spécialisée dans les bases de données de recherche et d'analyse en temps réel. Cette acquisition est une manœuvre tactique claire pour renforcer les capacités de génération augmentée par récupération (RAG) d'OpenAI. En intégrant la technologie de Rockset, OpenAI peut indexer et interroger plus efficacement les énormes ensembles de données fournis par ses partenaires d'entreprise, transformant les dépôts de données statiques en renseignements dynamiques et exploitables. Cette transaction souligne l'importance croissante de l'interface "données-modèle", la couche logicielle qui détermine l'efficacité avec laquelle une IA peut accéder et raisonner sur les actifs d'entreprise propriétaires.
La Ruée vers les Données Cliniques
Soulignant davantage la valeur des données spécialisées, HEALWELL AI a conclu un accord définitif pour acquérir BioPharma Services (https://www.globenewswire.com/news-release/2024/06/24/2903058/0/en/HEALWELL-AI-to-Acquire-BioPharma-Services-a-Leading-Full-Service-Contract-Research-Organization.html) pour environ 11,5 millions de dollars (https://www.globenewswire.com/news-release/2024/06/24/2903058/0/en/HEALWELL-AI-to-Acquire-BioPharma-Services-a-Leading-Full-Service-Contract-Research-Organization.html). BioPharma Services est une organisation de recherche sous contrat (CRO) à service complet qui possède des actifs de données d'essais cliniques approfondis. Pour HEALWELL, il ne s'agit pas seulement d'une expansion de services, mais d'une acquisition stratégique d'un pipeline de données. L'accès à des données d'essais cliniques de haute qualité est le principal goulot d'étranglement pour la découverte de médicaments et la médecine personnalisée pilotées par l'IA, et l'acquisition d'une CRO fournit une source directe et propriétaire des données de "vérité terrain" nécessaires pour entraîner des modèles diagnostiques et thérapeutiques.
Murs Réglementaires et Portabilité des Données
Alors que la valeur des actifs de données augmente, les régulateurs s'efforcent de garantir que cette valeur ne soit pas enfermée derrière les "jardins clos" des géants de la technologie. La Commission européenne a récemment publié ses conclusions préliminaires selon lesquelles Apple enfreint le Digital Markets Act (DMA) (https://ec.europa.eu/commission/presscorner/detail/en/ip_24_3433). L'enquête porte notamment sur les règles de redirection d'Apple, qui empêchent les développeurs d'orienter librement les consommateurs vers des offres et des écosystèmes de données alternatifs. Cette pression réglementaire s'inscrit dans une tendance mondiale plus large visant à imposer la portabilité et l'interopérabilité des données. Pour les investisseurs en données, ces décisions sont cruciales : elles signalent un avenir où le contrôle des données des utilisateurs et la capacité à les monétiser par le biais de licences secondaires seront soumis à un examen antitrust intense.
Pourquoi c'est important pour les propriétaires de données
Les transactions EvolutionaryScale et Healwell démontrent que les actifs de données les plus lucratifs ne se trouvent plus sur le "web ouvert", mais dans des domaines spécialisés et à forte barrière à l'entrée comme la génomique et la médecine clinique. Pour les propriétaires de données, la leçon est claire : le marché s'éloigne de la licence de données en vrac au profit d'ensembles de données structurés de haute précision qui peuvent être directement ingérés par des architectures d'IA spécialisées. Qu'il s'agisse de séquences protéiques ou de données d'entreprise en temps réel, la valeur réside dans la capacité unique des données à résoudre des problèmes spécifiques et de grande valeur que les modèles à usage général ne peuvent pas aborder. Les stratégies de monétisation devraient se concentrer sur la propreté des données, la conformité réglementaire et la capacité d'intégration avec les dernières architectures RAG et génératives.
Data Academy
Go deeper with our guides
From the marketplace
Explore live data opportunities
Opportunité de jeu de données de journaux de maintenance Hm Automatisme
View opportunity →autreOpportunité de jeu de données de journaux de maintenance Ad Cleantech
View opportunity →mobilitéOpportunité de jeu de données de télémétrie de mobilité Chargeguru
View opportunity →News & Insights
Latest from the briefing
- Comment valoriser les données de raisonnement d'experts pour l'entraînement des LLM
- Due Diligence des données : une checklist en 6 points pour les licences d'IA à fort enjeu
- Comment les droits de suppression massive impactent la valorisation des ensembles de données consommateurs
- Valorisation du contenu protégé par droit d'auteur pour l'entraînement de l'IA : Un cadre d'évaluation
d-nvest turns the data assets behind these deals into scored, actionable opportunities.
Explore the pipeline →