valorisationpricing datacomparablesdata licensinglegal risk15 серпня 2026 р.

Ринкова ціна неліцензованих даних для навчання ШІ

Порівняння фінансової відповідальності за зібраний контент із врегулюванням Anthropic на суму 1,5 мільярда доларів та ставками ліцензування.

Протягом років індустрія AI працювала, виходячи з припущення, що публічні дані фактично є безкоштовними. Ця ера закінчилася 20 липня 2026 року, коли суд США надав остаточне схвалення мирової угоди на суму $1.5 billion (розкрито: Cybersecurity Intelligence) у справі Bartz v. Anthropic. Ця знакова справа, найбільша мирова угода щодо авторського права в історії, стосувалася несанкціонованого використання піратських книг для навчання великих мовних моделей. Для власників та покупців даних ця подія дає першу конкретну відповідь на критичне питання: якою є реальна ринкова ціна неліцензійних даних для навчання AI?

«Ціна врегулювання» проти ринкової ціни

Мирова угода у справі Bartz v. Anthropic створює приголомшливий фінансовий прецедент. Виходячи з обсягу об'єктів авторського права, залучених у наборі даних «Books3», аналітики оцінили вартість врегулювання приблизно у $3,000 за твір (оцінка: Enterprise DNA). Ця цифра представляє «тіньову ціну» неліцензійних даних — ретроспективну вартість використання контенту без попередньої згоди.

Щоб зрозуміти справжню оцінку набору даних, необхідно порівняти це зобов'язання у розмірі $3,000 за твір із поточними ставками проактивного ліцензування. Наприклад, Reddit, за повідомленнями, уклав угоду на $60 million на рік (розкрито: Reuters) з Google за свій контент, створений користувачами. Аналогічно, News Corp уклала п'ятирічну угоду з OpenAI вартістю понад $250 million (розкрито: Wall Street Journal). Якщо розбити це на мільйони залучених статей або гілок обговорень, вартість одиниці в ліцензійній угоді часто в 50x–100x нижча, ніж вартість судового врегулювання.

Чому неліцензійні дані більше не є «безкоштовними»

Для покупців даних профіль ризику зібраних даних змістився з юридичної неприємності до загрози балансу компанії. Згідно із U.S. Copyright Act, встановлені законом збитки за умисне порушення можуть сягати до $150,000 за твір (джерело: U.S. Copyright Office). Хоча врегулювання Anthropic склало в середньому $3,000 за твір, воно демонструє, що суди тепер готові агрегувати ці збитки до мільярдів.

Для власників даних це створює потужний важіль впливу. Якщо ви володієте власним архівом, його цінність тепер полягає не лише в корисності для AI, а й у вартості зобов'язань, які він замінює. Щоб визначити справедливу ціну, власникам варто звернутися до нашого посібника про те, скільки коштує набір даних: 4 методи оцінки, щоб узгодити свої очікування з інституційними апетитами до ризику.

Цінові орієнтири за типами даних

Ринок розділився на три чіткі цінові рівні для даних для навчання AI:

  • Рівень 1: Преміальні ліцензійні медіа. Авторитетні новини, наукові журнали та професійна фотографія. Ціни варіюються від $10 до $50 за одиницю за багаторічні права на використання, часто об'єднані в багатомільйонні щорічні фіксовані платежі.
  • Рівень 2: Власні дані про взаємодію. Журнали підтримки клієнтів, спеціалізовані форуми та дані нішевих спільнот. Вони часто оцінюються на основі «щільності токенів» або унікальності домену, а суми угод становлять від $1M до $10M щорічно.
  • Рівень 3: Зібрані/неліцензійні дані. Технічно $0 на момент отримання, але вони несуть «тягар зобов'язань» у розмірі $1,000+ за твір у потенційних юридичних резервах.

Премія за походження

Основним фактором цінності даних у 2026 році є вже не просто обсяг, а їхнє походження. Лабораторії AI все частіше готові платити «премію за походження» за набори даних, які мають чисту історію володіння та явні права на навчання AI. Це зрушення зумовлене потребою в моделях, «готових до аудиту», які відповідають мінливим нормам, таким як EU AI Act, що вимагає прозорості щодо використання захищених авторським правом даних для навчання (джерело: резюме EU Data Act/AI Act).

Власники даних, які можуть надати задокументовану згоду та структуровані метадані, можуть вимагати значно вищі ціни, ніж ті, хто продає необроблені неструктуровані дампи. Покупці фактично платять за страхування — спокій за те, що їхній цикл навчання вартістю $100M+ не підлягатиме видаленню за рішенням суду або мільярдному врегулюванню.

Що це означає для вас

Мирова угода Anthropic на суму $1.5B формалізувала ціну спроб обійти правила. Для власників даних ваші спеціалізовані архіви тепер коштують більше як альтернативи «безпечної гавані» зібраним даним. Для покупців даних вартість ліцензування тепер є обов'язковим страховим полісом проти катастрофічних судових розглядів.

Незалежно від того, чи хочете ви монетизувати існуючий архів, чи забезпечити чисті вхідні дані для своєї наступної моделі, навігація на цьому ринку з високими ставками вимагає професійної аналітики. Вивчіть поточні ринкові ставки та доступні активи в нашому каталозі наборів даних, щоб переконатися, що ваша наступна угода побудована на фундаменті юридичної та фінансової впевненості.

Sources

  • enterprisedna.co
  • www.copyright.gov

Get the next analysis

One deep-dive per edition on where valuable data is hiding — the evidence, the sources, and who would pay for it. No noise.

One email per edition. Unsubscribe any time. We never share your address.

From the marketplace

Explore live data opportunities

Browse datasets by sector & use-case
Found this useful? Share it

d-nvest turns the data assets behind these deals into scored, actionable opportunities.

Explore the pipeline →