← Усі статті

Мільйони за коментар: як корпорації скуповують дані для ШІ

Reddit, медіаугоди OpenAI, архів Spirit Airlines і скан книг Anthropic — чому навчання моделей дедалі частіше починається з чека, а не з відкритої мережі.

Мільйони за коментар: як корпорації скуповують дані для ШІ
Зміст

Коротко

На Habr вийшов огляд про те, як текст із форумів, новини й навіть старі паперові книжки перетворилися на товар із цінником.

Це схоже на нафту: поки вона «просто тече», ніхто не рахує барелі, а коли завод стоїть без сировини — платять за доступ.

Автор проходить шлях від платного API у Reddit і медіаугод OpenAI до банкрутного аукціону Spirit Airlines і проєкту Anthropic зі скупки й знищення фізичних книг.

Що сталося

Бум великих мовних моделей прийнято відраховувати з 2022 року й виходу ChatGPT на базі GPT-3.5.

Для навчання потрібні чужі тексти, код, фото й листування — без людського сліду моделі ні з чого збирати. Автор нагадує просту картинку: нова пекарня «не існує» для рекомендаційної системи, доки хтось не відкриє її сторінку, не залишить відгук і оцінку. Інформація з’являється лише разом із дією.

Коли даних мало, багатий гравець не чекає, поки користувачі самі завантажать PDF: він купує доступ. Форуми тут особливо цінні — довгий архів питань і відповідей, уже відфільтрований живим спілкуванням.

Першим гучним сигналом став Reddit. У квітні 2023 року компанія закрила безкоштовний API, за два місяці доступ став платним.

Клієнт Apollo для iOS закрився — розробник оцінив вартість API приблизно в 20 мільйонів доларів на рік. На початку 2024 року Reddit домовився з Google приблизно на 60 мільйонів доларів на рік за ліцензію контенту для навчання ШІ; до IPO сума подібних угод уже перевищувала 200 мільйонів доларів.

Навесні 2024 року OpenAI оголошувала партнерства майже щотижня: Stack Overflow (сайт незадовго до цього скоротив близько 28% співробітників на тлі падіння трафіку), знову Reddit, потім News Corp більш ніж на 250 мільйонів доларів за п’ять років.

Далі — Dotdash Meredith не менш ніж на 16 мільйонів, Axel Springer близько 13 мільйонів доларів на рік на строк до трьох років, Financial Times від 5 до 10 мільйонів на рік. Wiley закрила дві угоди на 21 і 23 мільйони з неназваними покупцями; Informa отримала стартові 10 мільйонів від Microsoft. У Shutterstock ліцензування для ШІ у 2023 році дало близько 104 мільйонів доларів.

Прогноз Epoch AI ще у 2024-му попереджав: загальнодоступний людський контент як паливо для навчання почне різко стискатися з 2026 року й майже вичерпається до 2032-го.

На цьому тлі 2 травня 2026 року збанкрутілий Spirit Airlines став джерелом іншого типу сировини. Google виграла аукціон корпоративних даних за 10 мільйонів доларів — йдеться про близько 100 мільйонів листів і близько 500 мільйонів повідомлень із Microsoft Teams плюс внутрішні документи; персональні дані клієнтів компанія, за її словами, не отримує.

Окремо — Anthropic. У липні 2026 року суд у Сан-Франциско затвердив мирову угоду на 1,5 мільярда доларів за позовом видавців і авторів про книжки з торентів; правовласникам близько 3000 доларів за кожен твір в угоді.

Паралельно зі справи сплив проєкт «Панама»: з 2024 року компанія скуповує паперові книжки, сканує їх для навчання Claude й знищує оригінали — мільйони уживаних томів. Легальний ланцюг володіння став дорожчим за «сірий» завантажуваний архів.

Чому це важливо

Ринок перестав сперечатися лише про «чи можна парсити відкритий веб».

Платний API, ліцензії ЗМІ й банкрутні архіви показують іншу норму: походження даних — такий самий актив, як залізо чи вугілля на заводі. Коли відкритий потік висихає, купують те, чого немає у загальному доступі: пошту компанії, внутрішні бази, відскановані книжки з зрозумілим ланцюгом володіння.

Прогноз Epoch AI і угода навколо Spirit Airlines читаються разом: публічний текст скінченний, а корпоративні архіви — наступний шар. Закони й суди наздоганяють ринок не гаслами, а цифрами в мирових угодах.

Для розробника це змінює розмову про власний продукт. Якщо ви копите логи, тікети чи корпус документів «на потім для своєї моделі», це вже не безкоштовний побічний продукт — це актив із юридичною й комерційною вагою.

І навпаки: чужий корпус без ліцензії дедалі частіше закінчується не «сірою зоною», а рахунком на мільярди, як у справі Anthropic. Якість і походження даних починають коштувати дорожче за сирий обсяг.

На практиці

Текст — огляд чужих угод, а не прайс на ваш набір даних. Має сенс читати його як карту ризиків, якщо ви навчаєте чи донавчаєте модель, закуповуєте корпус або просто зберігаєте користувацький контент.

  1. Фіксуйте походження даних: ліцензія, договір, джерело вивантаження — до того, як корпус потрапить у навчання.
  2. Не будуйте план лише на «усьому, що лежить у відкритому API»: Reddit уже показав, як швидко доступ стає платним.
  3. Відокремлюйте публічний веб, ліцензований медіаконтент і внутрішні корпоративні архіви — у кожного свій правовий режим.
  4. Якщо копите користувацькі тексти «під майбутню модель», заздалегідь опишіть згоду й мету використання — інакше актив перетворюється на позов.
  5. Стежте за судовими рамками на кшталт справи Anthropic: «завантажили з торента, але в навчання не брали» уже не виглядає безпечною відмовкою в публічному полі.

Підсумок

За кілька років коментар на форумі, стаття в газеті й стос уживаних книжок перестали бути «просто контентом» — за них платять десятки й сотні мільйонів, а за порушення авторських прав — уже мільярди.

Коло замкнулося: цифровий слід і звичайне спілкування в мережі стали сировиною, без якої завод мовних моделей не працює. Залишаючи сьогодні черговий «нічого не значущий» коментар, ви по суті створюєте актив, за який гіганти готові виписувати чеки.

Коментарі

Завантаження коментарів…