OpenAI; Midjourney, Inc. × Automattic Inc.
Automattic, la empresa matriz de Tumblr y WordPress.com, está proporcionando contenido generado por usuarios a las empresas de IA OpenAI y Midjourney para el entrenamiento de modelos. [32, 47] Si bien las conversaciones se informaron por primera vez a principios de 2024, un informe de agosto de 2026 confirmó que la colaboración estaba en curso, y Automattic se preparaba para lanzar una configuración de exclusión voluntaria para los usuarios. [32] El precio del acuerdo no ha sido revelado.
The asset
Un corpus de publicaciones públicas generadas por usuarios de Tumblr y WordPress.com, que supuestamente abarcan desde 2014 hasta 2023, para ser utilizado en el entrenamiento de modelos de IA generativa.
The record
- Seller status
- Going concern
- Sector
- Blogging platforms and web publishing
- Modalities
- text, images
- Jurisdiction
- US
- Personal data
- El vendedor, Automattic, declaró que proporcionaría una configuración para que los usuarios optaran por no compartir sus datos con terceros. [32, 46] Los informes iniciales en 2024 alegaron que una compilación temprana de los datos incluía erróneamente publicaciones privadas, eliminadas y con clasificación para adultos. [46, 47]
What it means if you hold data
Este acuerdo demuestra que los grandes archivos de contenido diverso y no estructurado generado por usuarios, incluidas publicaciones de blogs e imágenes, son una clase de activo valiosa para entrenar modelos de IA multimodales. También destaca los importantes desafíos técnicos y de políticas para sanear dichos datos y respetar la privacidad del usuario, como lo demuestra la inclusión informada de contenido no público y la posterior necesidad de mecanismos de exclusión voluntaria. [46]