OpenAI; Midjourney, Inc. × Automattic Inc.
Automattic, la société mère de Tumblr et WordPress.com, fournit du contenu généré par les utilisateurs aux sociétés d'IA OpenAI et Midjourney pour l'entraînement de modèles. [32, 47] Alors que les discussions ont été rapportées pour la première fois début 2024, un rapport d'août 2026 a confirmé que la collaboration était en cours, Automattic se préparant à publier un paramètre de désinscription pour les utilisateurs. [32] Le prix de l'accord n'a pas été divulgué.
The asset
Un corpus de publications publiques générées par les utilisateurs de Tumblr et WordPress.com, couvrant apparemment de 2014 à 2023, destiné à l'entraînement de modèles d'IA générative.
The record
- Seller status
- Going concern
- Sector
- Blogging platforms and web publishing
- Modalities
- text, images
- Jurisdiction
- US
- Personal data
- Le vendeur, Automattic, a déclaré qu'il fournirait un paramètre permettant aux utilisateurs de refuser le partage de leurs données avec des tiers. [32, 46] Les premiers rapports en 2024 ont allégué qu'une compilation précoce des données incluait par erreur des publications privées, supprimées et classées pour adultes. [46, 47]
What it means if you hold data
Cet accord démontre que de vastes archives de contenu diversifié et non structuré généré par les utilisateurs, y compris des blogs et des publications d'images, constituent une classe d'actifs précieuse pour l'entraînement de modèles d'IA multimodaux. Il met également en évidence les défis techniques et politiques importants liés à l'assainissement de ces données et au respect de la vie privée des utilisateurs, comme en témoigne l'inclusion rapportée de contenu non public et le besoin subséquent de mécanismes de désinscription. [46]