OpenAI; Midjourney, Inc. × Automattic Inc.
Automattic, la società madre di Tumblr e WordPress.com, sta fornendo contenuti generati dagli utenti alle società di IA OpenAI e Midjourney per l'addestramento dei modelli. [32, 47] Sebbene le trattative siano state inizialmente riportate all'inizio del 2024, un rapporto dell'agosto 2026 ha confermato che la collaborazione era in corso, con Automattic che si preparava a rilasciare un'impostazione di opt-out per gli utenti. [32] Il prezzo dell'accordo non è stato divulgato.
The asset
Un corpus di post pubblici generati dagli utenti da Tumblr e WordPress.com, che si dice copra il periodo dal 2014 al 2023, da utilizzare per l'addestramento di modelli di intelligenza artificiale generativa.
The record
- Seller status
- Going concern
- Sector
- Blogging platforms and web publishing
- Modalities
- text, images
- Jurisdiction
- US
- Personal data
- Il venditore, Automattic, ha dichiarato che avrebbe fornito un'impostazione agli utenti per escludere la condivisione dei propri dati con terze parti. [32, 46] I rapporti iniziali nel 2024 hanno affermato che una prima compilazione dei dati includeva erroneamente post privati, cancellati e con classificazione per adulti. [46, 47]
What it means if you hold data
Questo accordo dimostra che i grandi archivi di contenuti diversificati e non strutturati generati dagli utenti, inclusi blog e post di immagini, sono una preziosa classe di attività per l'addestramento di modelli di IA multimodali. Evidenzia inoltre le significative sfide tecniche e politiche nel sanificare tali dati e nel rispettare la privacy degli utenti, come dimostrato dall'inclusione segnalata di contenuti non pubblici e dalla successiva necessità di meccanismi di opt-out. [46]