EvolutionaryScale haalt $142 miljoen op voor AI voor biologische data
Voormalige Meta-onderzoekers lanceren ESM3, een grensmodel getraind op 2,78 miljard eiwitsequenties om biologie te programmeren.
EvolutionaryScale heeft een bekendgemaakte seed-financieringsronde van $142 miljoen gesloten (evolutionaryscale.ai) onder leiding van Nat Friedman, Daniel Gross en Lux Capital om geavanceerde AI-modellen voor biologische gegevens te commercialiseren. De kapitaalinjectie markeert een van de grootste seed-rondes in de geschiedenis van op biotechnologie gerichte AI, wat duidt op een agressieve marktinteresse in "Physical AI"—systemen die in staat zijn de bouwstenen van de fysieke wereld te begrijpen en te manipuleren. De kern van de deal is de release van ESM3, een generatief model getraind op een eigen en publiek dataset van 2,78 miljard eiwitsequenties (evolutionaryscale.ai), waarmee onderzoekers biologie effectief kunnen "programmeren" door miljarden jaren evolutie in een digitale omgeving te simuleren.
De Multi-Modale Voorsprong in Biologische Data-Assets
In tegenstelling tot eerdere iteraties van eiwit-taalmodellen, is ESM3 een multi-modaal geavanceerd model. Het voorspelt niet alleen de structuur; het redeneert gelijktijdig over sequentie, structuur en functie. Door een dataset van 2,78 miljard sequenties en hun bijbehorende 3D-structuren te verwerken (evolutionaryscale.ai), kan het model volledig nieuwe eiwitten genereren die niet in de natuur voorkomen. Deze mogelijkheid transformeert biologische gegevens van een passief verslag van evolutie naar een actief bezit voor medicijnontdekking, koolstofafvang en materiaalkunde. Het bedrijf, opgericht door het team achter Meta's ESM-project, positioneert zich als de "OpenAI van de biologie", en biedt een versie van het model aan de wetenschappelijke gemeenschap aan, terwijl het high-capacity versies behoudt voor commerciële partnerschappen.
Physical AI en de Verschuiving in Data Monetisatie
De EvolutionaryScale-deal benadrukt een bredere trend waarbij de meest waardevolle data-assets verschuiven van door mensen gegenereerde tekst naar observaties van de fysieke wereld. Terwijl LLM's voor tekst te maken hebben met afnemende rendementen en juridische hindernissen met betrekking tot auteursrecht, biedt biologische data een uitgestrekte, onontgonnen grens. Het ESM3-model werd getraind met ongeveer 1,0 x 10^24 FLOPS aan rekenkracht (evolutionaryscale.ai), een schaal die voorheen was voorbehouden aan top-tier algemene modellen. Deze investering onderstreept de hoge kosten—en het hoge potentiële rendement—van het trainen van modellen op gespecialiseerde, hoogwaardige fysieke data. Naarmate fysieke AI volwassener wordt, wordt verwacht dat de licentieverlening van gestructureerde biologische, chemische en robotische datasets de algemene web-gecrawlde data zal overtreffen wat betreft waarde per token.
Het Competitieve Landschap: Data Moats in Life Sciences
EvolutionaryScale betreedt een markt die momenteel wordt gedomineerd door DeepMind's AlphaFold 3, maar met een duidelijke focus op generatief ontwerp in plaats van alleen structurele voorspelling. De competitieve moat in deze sector verschuift van modelarchitectuur naar de schaal en kwaliteit van het trainingscorpus. Door de gewichten van een versie van ESM3 met 1,4 miljard parameters open-source te maken, probeert het bedrijf de industriestandaard voor biologische datarepresentatie te zetten. Ondertussen beveiligen andere spelers in het ecosysteem hun eigen datapijplijnen; bijvoorbeeld, Poolside zou naar verluidt in gesprek zijn om naar schatting $500 miljoen op te halen, volgens Bloomberg, om vergelijkbare foundation model principes toe te passen op software engineering data, wat de rush om specifieke verticale data-domeinen te domineren verder illustreert.
Regulering en de Legaliteit van Data Acquisitie
Naarmate deze modellen schalen, blijft het juridische kader voor hoe data wordt verkregen een cruciaal keerpunt voor investeerders. In een belangrijke uitspraak voor de dataindustrie heeft een Amerikaanse rechtbank onlangs in het voordeel van Bright Data beslist in haar langdurige juridische strijd met Meta (brightdata.com), en bevestigd dat het scrapen van publieke data de Computer Fraud and Abuse Act (CFAA) niet schendt of contracten breekt wanneer de data niet achter een login zit. Deze uitspraak biedt een essentieel juridisch schild voor AI-bedrijven zoals EvolutionaryScale die afhankelijk zijn van grootschalige oogst van publieke wetenschappelijke databases om hun eigen trainingssets aan te vullen. Echter, de regelgevende druk neemt elders toe; de Europese Commissie heeft Apple onlangs geïnformeerd over haar voorlopige standpunt dat haar App Store-regels de Digital Markets Act schenden (ec.europa.eu), een herinnering dat data-poortwachters onder toenemende controle staan met betrekking tot hoe zij de toegang tot ecosysteemdata controleren.
Infrastructuur en Licentie Innovaties
De infrastructuur die nodig is om deze biologische datasets te verwerken, evolueert ook. Etched kondigde onlangs een bekendgemaakte Series A-financiering van $120 miljoen aan (etched.com) om gespecialiseerde chips voor transformatormodellen te bouwen, met als doel de rekenkracht-efficiëntie te bieden die nodig is voor de volgende generatie data-intensieve fysieke AI. Op het gebied van licenties heeft Perplexity AI een nieuw "Publishers Program" gelanceerd (perplexity.ai) om een revenue-sharing model te creëren met data-eigenaren, waaronder Time en Der Spiegel. Deze stap vertegenwoordigt een volwassenwording van de data-voor-AI-markt, weg van ongeautoriseerd scrapen naar gestructureerde, meerjarige licentieovereenkomsten die AI-bedrijven voorzien van stabiele, hoogwaardige datapijplijnen, terwijl de oorspronkelijke makers worden gecompenseerd.
Waarom het ertoe doet voor data-eigenaren
Voor data-eigenaren bewijst de EvolutionaryScale-deal dat zeer gespecialiseerde, niet-tekstuele datasets—zoals genomische sequenties of eiwitstructuren—nu tot de meest waardevolle activa in de AI-economie behoren. Nu foundation models zich begeven in de fysieke wetenschappen, zal het vermogen om schone, gestructureerde en ethisch verkregen data te leveren voor "Physical AI" premium licentievergoedingen opleveren. Data-eigenaren moeten zich richten op het auditen van hun eigen datasets op hun generatieve potentieel, aangezien de markt snel verschuift van eenvoudige dataopslag naar de actieve licentieverlening van activa voor modeltraining en fine-tuning.
Data Academy
Go deeper with our guides
Uw gespecialiseerde afbeeldingen zijn zeldzaam
De beelden die AI niet online kan vinden
Read the guide →3 min readKoop zeldzame, conforme data
De EU AI Act-hoek voor kopers
Read the guide →4 min readData marketplaces, uitgelegd
Cloud-native, onafhankelijk, verticaal — en wat elk afruilt
Read the guide →From the marketplace
Explore live data opportunities
Moltexflex — Gelegenheid voor dataset met regelgevingsgegevens
View opportunity →mobiliteitMusc — Gelegenheid voor dataset industriële operaties
View opportunity →andereTevel Tech — Gelegenheid voor dataset met sensortelemetering
View opportunity →d-nvest turns the data assets behind these deals into scored, actionable opportunities.
Explore the pipeline →