biological dataai fundingdata licensingdefense airegulation1 luglio 2026

EvolutionaryScale Ottiene 142 Milioni di Dollari per Scalare Modelli di Dati Biologici

La startup chiude un round seed per costruire AI generativa utilizzando un dataset di 2,78 miliardi di sequenze proteiche.

EvolutionaryScale ha chiuso un round di finanziamento seed dichiarato di $142 million (forbes.com) per accelerare lo sviluppo di modelli di IA generativa addestrati su enormi dataset biologici. Il round, guidato da Nat Friedman, Daniel Gross e Lux Capital, posiziona l'azienda per trattare la biologia come un asset di dati programmabile, sfruttando il suo nuovo modello ESM3 che è stato addestrato su un dataset di 2.78 billion protein sequences (evolutionaryscale.ai). Questo traguardo sottolinea il valore crescente dei dati non testuali e specifici per il dominio nella corsa alle capacità di IA di frontiera.

L'ascesa degli asset di dati biologici

A differenza dei LLM di uso generale che effettuano lo scraping del web pubblico, la proposta di valore di EvolutionaryScale si basa sulla cura e l'elaborazione di informazioni biologiche specializzate. Il modello ESM3 è un modello generativo multimodale in grado di ragionare sulla sequenza, la struttura e la funzione delle proteine. Elaborando trillions of data points (evolutionaryscale.ai) dal mondo naturale, la startup mira a consentire ai ricercatori di "programmare" nuove proteine, riducendo potenzialmente i tempi di scoperta dei farmaci da anni a settimane. Questo approccio "ChatGPT per la biologia" evidenzia una tendenza di mercato più ampia: la monetizzazione di dataset scientifici proprietari ad alta fedeltà che non possono essere facilmente replicati dai crawler generici.

Licenze vs. Contenziosi: La battaglia per i diritti sui dati

Il finanziamento di startup ad alta intensità di dati come EvolutionaryScale arriva mentre il panorama legale per l'acquisizione dei dati raggiunge il punto di ebollizione. OpenAI e Time Magazine hanno recentemente finalizzato un accordo pluriennale di licenza dei contenuti (openai.com), garantendo a OpenAI l'accesso all'archivio di 101-year-old di Time. Sebbene i termini finanziari esatti non siano stati resi noti, gli analisti del settore indicano l'accordo stimato di $250 million di OpenAI con News Corp (reuters.com) come un punto di riferimento per il premio ora attribuito al giornalismo umano verificato.

Al contrario, il costo dell'acquisizione di dati senza licenza sta diventando proibitivamente alto. La RIAA, che rappresenta major come Sony e Universal, chiede danni legali fino a $150,000 per opera (reuters.com) in una causa contro le startup di musica IA Suno e Udio. Con centinaia di migliaia di registrazioni presumibilmente utilizzate senza permesso, la responsabilità totale potrebbe raggiungere una cifra stimata di $13.5 billion (reuters.com). Questa pressione legale sta forzando una transizione dalla difesa del "fair use" a un mercato dei dati strutturato in cui ogni token di addestramento ha una provenienza e un prezzo chiari.

Afflusso di capitali nelle infrastrutture ad alta intensità di dati

La domanda di IA pronta per i dati ha anche innescato massicci investimenti nelle infrastrutture. Helsing, un'azienda europea di IA per la difesa, ha ottenuto un finanziamento dichiarato di €450 million (reuters.com) in un round di Serie C, valutando l'azienda una cifra stimata di €5 billion (bloomberg.com). I sistemi di difesa software-defined di Helsing si basano sull'elaborazione in tempo reale dei dati dei sensori sul campo di battaglia, rappresentando un verticale critico per la monetizzazione degli asset di dati nel settore pubblico. Allo stesso modo, Etched.ai ha raccolto un finanziamento dichiarato di $120 million (techcrunch.com) per costruire chip specializzati progettati specificamente per gestire il massiccio throughput di dati richiesto dai modelli Transformer.

Nel settore del legal tech, la startup Harvey sarebbe in trattative per raccogliere nuovo capitale con una valutazione stimata di $2 billion (techcrunch.com). L'asset principale di Harvey è l'accesso e l'elaborazione di dati legali proprietari, a ulteriore dimostrazione del fatto che il mercato sta premiando le aziende che controllano il "fossato dei dati" piuttosto che solo l'algoritmo.

Perché è importante per i proprietari dei dati

Per i proprietari di dati istituzionali, gli accordi EvolutionaryScale e OpenAI-Time confermano che l'era dello scraping gratuito dei dati sta finendo. I dati non sono più un sottoprodotto delle operazioni aziendali; sono una classe di asset primaria. Che si tratti di sequenze biologiche, archivi storici o precedenti legali, il mercato offre ora due percorsi distinti: partnership di licenza multimilionarie per chi collabora e contenziosi miliardari per coloro i cui asset vengono prelevati senza consenso. Man mano che i modelli di IA diventano più specializzati, il valore dei dataset di nicchia e ad alta integrità continuerà a superare il valore dei contenuti generici prelevati dal web.

Get the next analysis

One deep-dive per edition on where valuable data is hiding — the evidence, the sources, and who would pay for it. No noise.

One email per edition. Unsubscribe any time. We never share your address.

From the marketplace

Explore live data opportunities

Browse datasets by sector & use-case
Found this useful? Share it

d-nvest turns the data assets behind these deals into scored, actionable opportunities.

Explore the pipeline →