OpenAI укладає угоду про ліцензування даних на $250 млн з News Corp
П'ятирічна угода забезпечує доступ до преміальних журналістських архівів WSJ та Barron’s для навчання та виведення моделей ШІ.
Компанія OpenAI офіційно оформила історичну угоду про ліцензування контенту з News Corp, яка, за оцінками, коштуватиме понад 250 мільйонів доларів (https://www.wsj.com/business/media/openai-news-corp-deal-250-million-4d642b5d) протягом п'яти років. Це оголошене партнерство надає компанії OpenAI, що підтримується Microsoft, доступ до поточного та архівного контенту від провідних видань, включаючи The Wall Street Journal, Barron’s, MarketWatch та The Times, ефективно перетворюючи преміальний журналістський контент на високоточний навчальний потік для її моделей наступного покоління. Цей крок сигналізує про стратегічний поворот OpenAI для захисту свого конвеєра даних від зростаючих юридичних та етичних ризиків, пов'язаних з несанкціонованим веб-скрейпінгом.
Стратегічна цінність преміальних текстових активів
Угода є не просто оборонним юридичним маневром; це продумана ставка на вищу продуктивність курованих, високоавторитетних наборів даних. Оскільки передові моделі наближаються до межі загальнодоступних інтернет-даних, галузь вступає у фазу «дефіциту даних», де якість токенів має більше значення, ніж сирий обсяг. Забезпечивши доступ до архіву News Corp, OpenAI отримує доступ до десятиліть структурованого, перевіреного фактами та контекстно-багатого людського міркування. Це критично важливо для підвищення фактичної точності та можливостей міркування таких моделей, як GPT-5, які мають на меті функціонувати як більш надійні агенти у професійних та фінансових середовищах. Угода структурована таким чином, щоб надати OpenAI право відображати контент у відповідь на запити користувачів, ще більше розмиваючи межу між пошуковими системами та інтерфейсами генеративного ШІ.
Scale AI та інфраструктура даних на 1 мільярд доларів
Інституційний поштовх до високоякісних даних додатково підтверджується нещодавно закритим раундом фінансування серії F компанії Scale AI на суму 1 мільярд доларів (https://techcrunch.com/2024/05/21/scale-ai-raises-1-billion-at-a-13-8-billion-valuation/), який оцінив компанію в 13,8 мільярда доларів (https://www.reuters.com/technology/scale-ai-raises-1-billion-valuation-doubles-138-billion-2024-05-21/). Scale AI виступає як критично важливий посередник в економіці даних-активів, надаючи маркування з участю людини (HITL) та RLHF (навчання з підкріпленням на основі зворотного зв'язку від людини), необхідні для перетворення сирих даних, таких як архіви News Corp, на навчальні набори, готові для машин. Цей раунд фінансування, очолюваний Accel за участю суверенних фондів, підкреслює, що фізична та людська інфраструктура, необхідна для обробки даних, тепер настільки ж цінна, як і обчислювальна потужність. Оскільки світові моделі еволюціонують для обробки мультимодальних входів — відео, аудіо та сенсорних даних — складність маркування цих активів експоненціально зростає, створюючи величезну перевагу для тих, хто контролює ланцюжок поставок даних.
DeepL та зростання спеціалізованих даних
У той час як загальні моделі борються за архів новин, спеціалізовані компанії зі штучного інтелекту доводять цінність нішевих даних. DeepL, німецький спеціаліст з перекладу за допомогою ШІ, нещодавно залучив 300 мільйонів доларів (https://www.reuters.com/technology/ai-startup-deepl-valued-2-billion-after-latest-funding-round-2024-05-22/) інвестицій за оцінкою в 2 мільярди доларів (https://techcrunch.com/2024/05/22/deepl-the-ai-translation-startup-is-now-valued-at-2b/). Успіх DeepL побудований на пропрієтарному наборі високоякісних перекладів, який перевершує більші моделі, навчені на більш «шумних» даних. Це підтверджує зростаючу тенденцію в сфері розвідки d-nvest: власники даних, які володіють унікальними, специфічними для галузі наборами даних (юридичними, медичними або лінгвістичними), бачать, як вартість їхніх активів стрімко зростає, оскільки загальні компанії зі штучного інтелекту прагнуть придбати спеціалізовані «розумові рови» для диференціації своїх пропозицій.
Регуляторні запобіжники: фіналізація Закону ЄС про ШІ
Ринок угод з даними тепер функціонує за новим глобальним стандартом. Європейська рада офіційно надала своє остаточне схвалення (https://www.consilium.europa.eu/en/press/press-releases/2024/05/21/artificial-intelligence-ai-act-council-gives-final-green-light-to-the-first-worldwide-rules-on-ai/) Закону ЄС про ШІ, першої у світі комплексної рамки для штучного інтелекту. Регламент запроваджує суворі вимоги до прозорості для загальних моделей ШІ, включаючи зобов'язання надавати детальні резюме даних, використаних для навчання. Очікується, що ця регуляторна ясність прискорить тенденцію до формальних ліцензійних угод, оскільки компанії прагнуть уникнути позначки «високий ризик» та потенційних штрафів, пов'язаних з невідповідним джерелом даних. Для інвесторів у дані походження даних перетворюється з юридичної виноски на основний драйвер оцінки.
Чому це важливо для власників даних
Для власників високоякісних, структурованих даних угода OpenAI-News Corp є переломним моментом, який встановлює чітку ринкову ціну на преміальний контент. Ми переходимо від епохи експлуатації даних до епохи монетизації даних. Оскільки розробники ШІ переорієнтовують свою увагу на «Світові моделі», які вимагають глибокого контекстного розуміння та фактичного обґрунтування, важіль впливу повертається до творців контенту. Власники даних більше не повинні розглядати свої архіви як історичні записи, а як високоприбуткові ліквідні активи, які можна багаторазово ліцензувати для різних вертикалей ШІ. Ключ до максимізації цінності полягає в готовності даних: забезпечення того, щоб архіви були оцифровані, багаті на метадані та юридично очищені для навчання ШІ.
Data Academy
Go deeper with our guides
Ваша рідкісна мова недоступна для ШІ
Дефіцит недостатньо представлених мов
Read the guide →3 min readВаші спеціалізовані зображення рідкісні
Візуальний контент, який ШІ не знаходить онлайн
Read the guide →3 min readПридбання рідкісних даних, що відповідають вимогам
Кут зору EU AI Act для покупців
Read the guide →From the marketplace
Explore live data opportunities
Valaratomics — Можливість доступу до набору даних регуляторних записів
View opportunity →іншеVoltfang — Можливість отримання даних телеметрії датчиків
View opportunity →мобільністьTrucksters — Можливості набору даних телеметрії мобільності
View opportunity →News & Insights
Latest from the briefing
- Як працює транзакція B2B-даних? 8-кроковий процес продажу
- Як оцінити набір даних: 4 перевірені методи монетизації даних
- Які активи даних МСП є найціннішими для європейського ринку ШІ?
- Чому ліцензовані рідкісні дані є ключем до відповідності Закону ЄС про ШІ
d-nvest turns the data assets behind these deals into scored, actionable opportunities.
Explore the pipeline →