EvolutionaryScale sichert sich 142 Mio. US-Dollar für KI im Bereich biologischer Daten
Ehemalige Meta-Forscher stellen ESM3 vor, ein Frontier-Modell, das auf 2,78 Milliarden Proteinsequenzen trainiert wurde, um Biologie zu programmieren.
EvolutionaryScale hat eine disclosed Finanzierungsrunde der Serie Seed in Höhe von 142 Millionen US-Dollar abgeschlossen (evolutionaryscale.ai), angeführt von Nat Friedman, Daniel Gross und Lux Capital, um fortschrittliche KI-Modelle für biologische Daten zu kommerzialisieren. Die Kapitalzuführung markiert eine der größten Seed-Finanzierungsrunden in der Geschichte der auf Biotech fokussierten KI und signalisiert eine aggressive Marktnachfrage nach "Physical AI" – Systemen, die in der Lage sind, die Bausteine der physischen Welt zu verstehen und zu manipulieren. Im Kern der Transaktion steht die Veröffentlichung von ESM3, einem generativen Modell, das auf einem proprietären und öffentlichen Datensatz mit 2,78 Milliarden Proteinsequenzen trainiert wurde (evolutionaryscale.ai), was es Forschern ermöglicht, Biologie effektiv zu "programmieren", indem Milliarden von Evolutionsjahren in einer digitalen Umgebung simuliert werden.
Der Multi-Modale Vorteil bei biologischen Datenbeständen
Im Gegensatz zu früheren Iterationen von Protein-Sprachmodellen ist ESM3 ein multimodales Frontier-Modell. Es sagt nicht nur die Struktur voraus, sondern schließt von Sequenz, Struktur und Funktion gleichzeitig auf Zusammenhänge. Durch die Verarbeitung eines Datensatzes von 2,78 Milliarden Sequenzen und ihren entsprechenden 3D-Strukturen (evolutionaryscale.ai) kann das Modell völlig neue Proteine generieren, die in der Natur nicht vorkommen. Diese Fähigkeit verwandelt biologische Daten von einem passiven Aufzeichnung der Evolution in einen aktiven Vermögenswert für die Medikamentenentwicklung, Kohlenstoffabscheidung und Materialwissenschaften. Das Unternehmen, gegründet vom Team hinter Metas ESM-Projekt, positioniert sich als das "OpenAI der Biologie" und bietet der wissenschaftlichen Gemeinschaft eine Version des Modells an, während es Hochleistungsvarianten für kommerzielle Partnerschaften behält.
Physical AI und der Wandel bei der Datenmonetarisierung
Die Transaktion von EvolutionaryScale unterstreicht einen breiteren Trend, bei dem die wertvollsten Datenbestände von menschengeneriertem Text zu Beobachtungen der physischen Welt übergehen. Während LLMs für Text abnehmende Erträge und rechtliche Hürden bezüglich des Urheberrechts aufweisen, bieten biologische Daten eine riesige, unerschlossene Grenze. Das ESM3-Modell wurde mit etwa 1,0 x 10^24 FLOPS Rechenleistung trainiert (evolutionaryscale.ai), eine Skala, die bisher Spitzenmodellen für allgemeine Zwecke vorbehalten war. Diese Investition unterstreicht die hohen Kosten – und das hohe potenzielle Ertragspotenzial – des Trainings von Modellen auf spezialisierten, hochauflösenden physischen Daten. Mit der Reifung von Physical AI wird erwartet, dass die Lizenzierung von strukturierten biologischen, chemischen und robotischen Datensätzen den Wert von allgemeinen, aus dem Web gesammelten Daten pro Token übertreffen wird.
Die Wettbewerbslandschaft: Daten-Moats in den Biowissenschaften
EvolutionaryScale tritt in einen Markt ein, der derzeit von DeepMinds AlphaFold 3 dominiert wird, jedoch mit einem deutlichen Fokus auf generatives Design statt nur auf strukturelle Vorhersage. Der Wettbewerbsvorteil in diesem Sektor verlagert sich von der Modellarchitektur hin zur Skalierung und Qualität des Trainingskorpus. Durch das Open-Sourcing der Gewichte für eine Version von ESM3 mit 1,4 Milliarden Parametern versucht das Unternehmen, den Industriestandard für die Darstellung biologischer Daten zu setzen. In der Zwischenzeit sichern sich andere Akteure im Ökosystem ihre eigenen Datenpipelines; beispielsweise verhandelt Poolside Berichten zufolge über eine geschätzte Finanzierung von 500 Millionen US-Dollar, laut Bloomberg, um ähnliche Foundation-Modell-Prinzipien auf Daten für die Softwareentwicklung anzuwenden, was den Ansturm zur Beherrschung spezifischer vertikaler Datenbereiche weiter verdeutlicht.
Regulierung und die Rechtmäßigkeit der Datenerfassung
Mit zunehmender Skalierung dieser Modelle bleibt der rechtliche Rahmen für die Datenerfassung ein kritischer Wendepunkt für Investoren. In einer bedeutenden Entscheidung für die Datenbranche hat ein US-Gericht kürzlich zugunsten von Bright Data in seinem langjährigen Rechtsstreit mit Meta (brightdata.com) entschieden und bestätigt, dass das Scraping öffentlicher Daten nicht gegen den Computer Fraud and Abuse Act (CFAA) verstößt oder Verträge verletzt, wenn die Daten nicht hinter einem Login liegen. Diese Entscheidung bietet einen wichtigen rechtlichen Schutzschild für KI-Unternehmen wie EvolutionaryScale, die auf die groß angelegte Erfassung öffentlicher wissenschaftlicher Datenbanken angewiesen sind, um ihre proprietären Trainingsdatensätze zu erweitern. Allerdings nimmt der regulatorische Druck anderswo zu; die Europäische Kommission hat Apple kürzlich über ihre vorläufige Ansicht informiert, dass die Regeln ihres App Stores gegen den Digital Markets Act verstoßen (ec.europa.eu), eine Erinnerung daran, dass Daten-Gatekeeper zunehmend unter die Lupe genommen werden, wie sie den Zugang zu Ökosystemdaten kontrollieren.
Infrastruktur- und Lizenzinnovationen
Auch die Infrastruktur, die zur Verarbeitung dieser biologischen Datensätze erforderlich ist, entwickelt sich weiter. Etched kündigte kürzlich eine disclosed Series A-Finanzierung in Höhe von 120 Millionen US-Dollar an (etched.com), um spezialisierte Chips für Transformer-Modelle zu entwickeln und die für die nächste Generation datenintensiver Physical AI erforderliche Recheneffizienz bereitzustellen. Im Lizenzbereich hat Perplexity AI ein neues "Publishers Program" (perplexity.ai) gestartet, um ein Umsatzbeteiligungsmodell mit Dateneigentümern, darunter Time und Der Spiegel, zu schaffen. Dieser Schritt repräsentiert eine Reifung des Data-for-AI-Marktes, weg vom unbefugten Scraping hin zu strukturierten, mehrjährigen Lizenzvereinbarungen, die KI-Unternehmen stabile, qualitativ hochwertige Datenpipelines bieten und gleichzeitig die ursprünglichen Ersteller entschädigen.
Warum es für Dateneigentümer wichtig ist
Für Dateneigentümer beweist die Transaktion von EvolutionaryScale, dass hochspezialisierte, nicht-textuelle Datensätze – wie Genomsequenzen oder Proteinstrukturen – heute zu den wertvollsten Vermögenswerten in der KI-Wirtschaft gehören. Da Foundation-Modelle in die physikalischen Wissenschaften vordringen, wird die Fähigkeit, saubere, strukturierte und ethisch einwandfreie Daten für "Physical AI" bereitzustellen, hohe Lizenzgebühren erzielen. Dateneigentümer sollten sich darauf konzentrieren, ihre proprietären Datensätze auf ihr generatives Potenzial zu prüfen, da sich der Markt schnell von der einfachen Datenspeicherung hin zur aktiven Lizenzierung von Vermögenswerten für das Modelltraining und Fine-Tuning verlagert.
Data Academy
Go deeper with our guides
Ihre spezialisierten Bilder sind selten
Das Visuelle, das KI online nicht findet
Read the guide →3 min readSeltene und konforme Daten kaufen
Der EU AI Act-Ansatz für Käufer
Read the guide →4 min readDatenmarktplätze, erklärt
Cloud-nativ, unabhängig, vertikal – und was jeder davon preisgibt
Read the guide →From the marketplace
Explore live data opportunities
Moltexflex — Gelegenheit für Datensatz mit regulatorischen Aufzeichnungen
View opportunity →MobilitätMusc — Datensatzmöglichkeit für industrielle Betriebsabläufe
View opportunity →otherTevel Tech — Sensor Telemetry Dataset Opportunity
View opportunity →News & Insights
Latest from the briefing
- Die finanziellen und strategischen Kosten der Nichteinhaltung von Datenbrokern
- Sind Sie ein versehentlicher Datenbroker? Neue finanzielle Risiken erklärt
- Nachweisanforderungen für EU-KI-Gesetz-Untersuchungen
- Wie man Embedded Finance in vertikale Datenmarktplätze integriert
d-nvest turns the data assets behind these deals into scored, actionable opportunities.
Explore the pipeline →