Licensing2026-08-24confirmed

OpenAI; Midjourney, Inc. × Automattic Inc.

Automattic, la empresa matriz de Tumblr y WordPress.com, está proporcionando contenido generado por usuarios a las empresas de IA OpenAI y Midjourney para el entrenamiento de modelos. [32, 47] Si bien las conversaciones se informaron por primera vez a principios de 2024, un informe de agosto de 2026 confirmó que la colaboración estaba en curso, y Automattic se preparaba para lanzar una configuración de exclusión voluntaria para los usuarios. [32] El precio del acuerdo no ha sido revelado.

Price paid
Not disclosed
Losing bid
Per unit
no meaningful ratio

The asset

Un corpus de publicaciones públicas generadas por usuarios de Tumblr y WordPress.com, que supuestamente abarcan desde 2014 hasta 2023, para ser utilizado en el entrenamiento de modelos de IA generativa.

The record

Seller status
Going concern
Sector
Blogging platforms and web publishing
Modalities
text, images
Jurisdiction
US
Personal data
El vendedor, Automattic, declaró que proporcionaría una configuración para que los usuarios optaran por no compartir sus datos con terceros. [32, 46] Los informes iniciales en 2024 alegaron que una compilación temprana de los datos incluía erróneamente publicaciones privadas, eliminadas y con clasificación para adultos. [46, 47]

What it means if you hold data

Este acuerdo demuestra que los grandes archivos de contenido diverso y no estructurado generado por usuarios, incluidas publicaciones de blogs e imágenes, son una clase de activo valiosa para entrenar modelos de IA multimodales. También destaca los importantes desafíos técnicos y de políticas para sanear dichos datos y respetar la privacidad del usuario, como lo demuestra la inclusión informada de contenido no público y la posterior necesidad de mecanismos de exclusión voluntaria. [46]

Sources