Scale AI залучила 1 мільярд доларів у рамках раунду серії F для зміцнення ланцюга постачання даних для ШІ
Accel очолила масштабний раунд фінансування на 1 мільярд доларів, оцінивши лідера в галузі розмітки даних у 13,8 мільярда доларів.
Scale AI завершила раунд фінансування серії F на суму 1 мільярд доларів, підвищивши свою оцінку до 13,8 мільярда доларів на тлі зростаючого глобального попиту на високоякісні навчальні дані. Раунд очолив Accel за значної участі найактивніших інвесторів у галузі ШІ, зокрема Nvidia, Amazon та Meta. Це вливання капіталу відбувається в критичний момент, коли «стіна даних» — загроза нестачі високоякісного тексту та медіа, створених людьми — загрожує зупинити масштабування, яке стимулювало бум генеративного ШІ.
Індустріалізація розмітки даних
Новий капітал Scale AI призначений для розширення її Data Engine, власної інфраструктури, що використовується для вдосконалення необроблених наборів даних, необхідних для передових моделей. На відміну від ранніх днів простого тегування зображень, сучасний ринок вимагає складного навчання з підкріпленням на основі зворотного зв'язку від людини (RLHF). Scale AI позиціонувала себе як необхідного посередника, перетворюючи необроблені цифрові вихідні дані на структуровані токени з високим рівнем міркувань, які живлять такі моделі, як GPT-4 та Claude 3. Участь великих розробників моделей як інвесторів свідчить про стратегічний крок із забезпечення власних ланцюгів постачання даних проти конкурентів.
Стратегічне ліцензування та перехід до даних у реальному часі
Раунд Scale AI є частиною ширшої структурної зміни у способах отримання та оцінки даних. Оскільки галузь відмовляється від несанкціонованого веб-скрейпінгу, прямі ліцензійні угоди стають стандартом. Цей зсув був підкреслений цього тижня знаковим партнерством OpenAI з Reddit, яке надає ШІ-гіганту доступ до API даних Reddit. Інтегруючи розмови людей у реальному часі, OpenAI прагне підвищити актуальність ChatGPT, одночасно надаючи Reddit функції на основі ШІ для своїх користувачів та модераторів. Ця угода відображає річну угоду на суму 60 мільйонів доларів, яку Google уклав з Reddit раніше цього року, встановлюючи чітку ринкову ціну на соціальні дані у великих обсягах.
Захист інтелектуальної власності та регуляторний відгук
У той час як деякі платформи зосереджуються на монетизації, інші будують захисні рови. Sony Music Group нещодавно видала офіційне попередження понад 700 технологічним компаніям, явно відмовляючись від будь-якого несанкціонованого використання свого контенту для навчання ШІ. Ці масштабні зусилля із захисту інтелектуальної власності висвітлюють зростаюче тертя між розробниками ШІ, які потребують багато даних, та власниками преміальних творчих активів. Водночас регулятори посилюють контроль за практиками збору даних. Управління комісара з питань інформації Великобританії (ICO) нещодавно оновило свої рекомендації щодо веб-скрейпінгу, уточнивши, що персональні дані, зібрані з загальнодоступного веб-сайту для навчання ШІ, залишаються під дією суворих законів про захист даних.
Інфраструктура та спеціалізовані ринки даних
Капітал, що надходить у сферу даних, поступається лише інвестиціям у апаратне забезпечення, необхідне для їх обробки. CoreWeave нещодавно отримала кредитну лінію на суму 7,5 мільярда доларів під керівництвом Blackstone та Magnetar для розширення своєї інфраструктури центрів обробки даних, спеціалізованих на ШІ. У сфері програмного забезпечення спеціалізовані стартапи, орієнтовані на дані, також спостерігають значний успіх. DeepL, спеціаліст з перекладу мов, залучив 300 мільйонів доларів при оцінці в 2 мільярди доларів, доводячи, що нішеві, високоточні набори даних для перекладу та корпоративного спілкування залишаються дуже цінними. Крім того, Lamini залучила 25 мільйонів доларів, щоб допомогти підприємствам доналаштовувати моделі на власних пропрієтарних внутрішніх даних, уникаючи ризиків дефіциту загальнодоступних даних.
Чому це важливо для власників даних
Для власників даних оцінка Scale AI та угода між Reddit та OpenAI підтверджують, що пропрієтарні дані більше не є побічним продуктом — це першокласний клас активів. З наближенням «стіни даних» премія за чисті, перевірені людьми та юридично відповідні набори даних буде лише зростати. Організації, що володіють великими архівами спеціалізованих знань, будь то в соціальних мережах, охороні здоров'я чи мистецтві, тепер мають значний важіль для переговорів щодо довгострокових ліцензійних потоків доходу, а не дозволяти своїм активам стати товаром для загальних веб-сканерів.
Data Academy
Go deeper with our guides
Ваші спеціалізовані зображення рідкісні
Візуальний контент, який ШІ не знаходить онлайн
Read the guide →3 min readПридбання рідкісних даних, що відповідають вимогам
Кут зору EU AI Act для покупців
Read the guide →3 min readЧи ваші дані коштують грошей?
7 монетизованих дата-активів
Read the guide →From the marketplace
Explore live data opportunities
Marvelfusion — Можливості датасету промислових операцій
View opportunity →мобільністьMt Logistik — Можливості набору даних регуляторних записів
View opportunity →мобільністьXpdel — Можливість придбання набору даних мобільної телеметрії
View opportunity →News & Insights
Latest from the briefing
- Як оцінювати та ліцензувати пропрієтарні набори даних зображень для навчання ШІ
- Монетизація даних рідкісних мов: Посібник для корпусів тренування ШІ
- Як оцінити егоцентричні відео набори даних для навчання робототехніки
- Як монетизувати експертні міркування для спеціалізованого навчання ШІ
d-nvest turns the data assets behind these deals into scored, actionable opportunities.
Explore the pipeline →