ai fundingdata licensingscale ai17 червня 2026 р.

Scale AI залучила 1 мільярд доларів у рамках раунду серії F для зміцнення ланцюга постачання даних для ШІ

Accel очолила масштабний раунд фінансування на 1 мільярд доларів, оцінивши лідера в галузі розмітки даних у 13,8 мільярда доларів.

Scale AI завершила раунд фінансування серії F на суму 1 мільярд доларів, підвищивши свою оцінку до 13,8 мільярда доларів на тлі зростаючого глобального попиту на високоякісні навчальні дані. Раунд очолив Accel за значної участі найактивніших інвесторів у галузі ШІ, зокрема Nvidia, Amazon та Meta. Це вливання капіталу відбувається в критичний момент, коли «стіна даних» — загроза нестачі високоякісного тексту та медіа, створених людьми — загрожує зупинити масштабування, яке стимулювало бум генеративного ШІ.

Індустріалізація розмітки даних

Новий капітал Scale AI призначений для розширення її Data Engine, власної інфраструктури, що використовується для вдосконалення необроблених наборів даних, необхідних для передових моделей. На відміну від ранніх днів простого тегування зображень, сучасний ринок вимагає складного навчання з підкріпленням на основі зворотного зв'язку від людини (RLHF). Scale AI позиціонувала себе як необхідного посередника, перетворюючи необроблені цифрові вихідні дані на структуровані токени з високим рівнем міркувань, які живлять такі моделі, як GPT-4 та Claude 3. Участь великих розробників моделей як інвесторів свідчить про стратегічний крок із забезпечення власних ланцюгів постачання даних проти конкурентів.

Стратегічне ліцензування та перехід до даних у реальному часі

Раунд Scale AI є частиною ширшої структурної зміни у способах отримання та оцінки даних. Оскільки галузь відмовляється від несанкціонованого веб-скрейпінгу, прямі ліцензійні угоди стають стандартом. Цей зсув був підкреслений цього тижня знаковим партнерством OpenAI з Reddit, яке надає ШІ-гіганту доступ до API даних Reddit. Інтегруючи розмови людей у реальному часі, OpenAI прагне підвищити актуальність ChatGPT, одночасно надаючи Reddit функції на основі ШІ для своїх користувачів та модераторів. Ця угода відображає річну угоду на суму 60 мільйонів доларів, яку Google уклав з Reddit раніше цього року, встановлюючи чітку ринкову ціну на соціальні дані у великих обсягах.

Захист інтелектуальної власності та регуляторний відгук

У той час як деякі платформи зосереджуються на монетизації, інші будують захисні рови. Sony Music Group нещодавно видала офіційне попередження понад 700 технологічним компаніям, явно відмовляючись від будь-якого несанкціонованого використання свого контенту для навчання ШІ. Ці масштабні зусилля із захисту інтелектуальної власності висвітлюють зростаюче тертя між розробниками ШІ, які потребують багато даних, та власниками преміальних творчих активів. Водночас регулятори посилюють контроль за практиками збору даних. Управління комісара з питань інформації Великобританії (ICO) нещодавно оновило свої рекомендації щодо веб-скрейпінгу, уточнивши, що персональні дані, зібрані з загальнодоступного веб-сайту для навчання ШІ, залишаються під дією суворих законів про захист даних.

Інфраструктура та спеціалізовані ринки даних

Капітал, що надходить у сферу даних, поступається лише інвестиціям у апаратне забезпечення, необхідне для їх обробки. CoreWeave нещодавно отримала кредитну лінію на суму 7,5 мільярда доларів під керівництвом Blackstone та Magnetar для розширення своєї інфраструктури центрів обробки даних, спеціалізованих на ШІ. У сфері програмного забезпечення спеціалізовані стартапи, орієнтовані на дані, також спостерігають значний успіх. DeepL, спеціаліст з перекладу мов, залучив 300 мільйонів доларів при оцінці в 2 мільярди доларів, доводячи, що нішеві, високоточні набори даних для перекладу та корпоративного спілкування залишаються дуже цінними. Крім того, Lamini залучила 25 мільйонів доларів, щоб допомогти підприємствам доналаштовувати моделі на власних пропрієтарних внутрішніх даних, уникаючи ризиків дефіциту загальнодоступних даних.

Чому це важливо для власників даних

Для власників даних оцінка Scale AI та угода між Reddit та OpenAI підтверджують, що пропрієтарні дані більше не є побічним продуктом — це першокласний клас активів. З наближенням «стіни даних» премія за чисті, перевірені людьми та юридично відповідні набори даних буде лише зростати. Організації, що володіють великими архівами спеціалізованих знань, будь то в соціальних мережах, охороні здоров'я чи мистецтві, тепер мають значний важіль для переговорів щодо довгострокових ліцензійних потоків доходу, а не дозволяти своїм активам стати товаром для загальних веб-сканерів.

Get the next analysis

One deep-dive per edition on where valuable data is hiding — the evidence, the sources, and who would pay for it. No noise.

One email per edition. Unsubscribe any time. We never share your address.

From the marketplace

Explore live data opportunities

Browse datasets by sector & use-case
Found this useful? Share it

d-nvest turns the data assets behind these deals into scored, actionable opportunities.

Explore the pipeline →