← Все статьи

Миллионы за комментарий: как корпорации скупают данные для ИИ

Reddit, медиасделки OpenAI, архив Spirit Airlines и скан книг Anthropic — почему обучение моделей всё чаще начинается с чека, а не с открытой сети.

Миллионы за комментарий: как корпорации скупают данные для ИИ
Содержание

Коротко

На Habr вышел обзор о том, как текст с форумов, новости и даже старые бумажные книги превратились в товар с ценником.

Это похоже на нефть: пока она «просто течёт», никто не считает баррели, а когда завод стоит без сырья — платят за доступ.

Автор проходит путь от платного API у Reddit и медиасделок OpenAI до банкротного аукциона Spirit Airlines и проекта Anthropic по скупке и уничтожению физических книг.

Что произошло

Бум больших языковых моделей принято отсчитывать с 2022 года и выхода ChatGPT на базе GPT-3.5.

Для обучения нужны чужие тексты, код, фото и переписка — без человеческого следа модель не из чего собирать. Автор напоминает простую картинку: новая пекарня «не существует» для рекомендательной системы, пока кто‑то не откроет её страницу, не оставит отзыв и оценку. Информация появляется только вместе с действием.

Когда данных мало, богатый игрок не ждёт, пока пользователи сами загрузят PDF: он покупает доступ. Форумы здесь особенно ценны — долгий архив вопросов и ответов, уже отфильтрованный живым общением.

Первым громким сигналом стал Reddit. В апреле 2023 года компания закрыла бесплатный API, через два месяца доступ стал платным.

Клиент Apollo для iOS закрылся — разработчик оценил стоимость API примерно в 20 миллионов долларов в год. В начале 2024 года Reddit договорился с Google примерно на 60 миллионов долларов в год за лицензию контента для обучения ИИ; к IPO сумма похожих соглашений уже превышала 200 миллионов долларов.

Весной 2024 года OpenAI объявляла партнёрства почти каждую неделю: Stack Overflow (сайт незадолго до этого сократил около 28% сотрудников на фоне падения трафика), снова Reddit, затем News Corp более чем на 250 миллионов долларов за пять лет.

Дальше — Dotdash Meredith не менее чем на 16 миллионов, Axel Springer около 13 миллионов долларов в год на срок до трёх лет, Financial Times от 5 до 10 миллионов в год. Wiley закрыла две сделки на 21 и 23 миллиона с неназванными покупателями; Informa получила стартовые 10 миллионов от Microsoft. У Shutterstock лицензирование для ИИ в 2023 году дало около 104 миллионов долларов.

Прогноз Epoch AI ещё в 2024-м предупреждал: общедоступный человеческий контент как топливо для обучения начнёт резко сжиматься с 2026 года и почти исчерпается к 2032-му.

На этом фоне 2 мая 2026 года обанкротившийся Spirit Airlines стал источником другого типа сырья. Google выиграла аукцион корпоративных данных за 10 миллионов долларов — речь о порядка 100 миллионов писем и около 500 миллионов сообщений из Microsoft Teams плюс внутренние документы; персональные данные клиентов компания, по её словам, не получает.

Отдельно — Anthropic. В июле 2026 года суд в Сан-Франциско утвердил мировое соглашение на 1,5 миллиарда долларов по иску издателей и авторов о книгах с торрентов; правообладателям около 3000 долларов за каждое произведение в соглашении.

Параллельно из дела всплыл проект «Панама»: с 2024 года компания скупает бумажные книги, сканирует их для обучения Claude и уничтожает оригиналы — миллионы подержанных томов. Легальная цепочка владения стала дороже, чем «серый» скачиваемый архив.

Почему это важно

Рынок перестал спорить только о «можно ли парсить открытый веб».

Платный API, лицензии СМИ и банкротные архивы показывают другую норму: происхождение данных — такой же актив, как железо или уголь на заводе. Когда открытый поток иссякает, покупают то, чего нет в общем доступе: почту компании, внутренние базы, отсканированные книги с понятной цепочкой владения.

Прогноз Epoch AI и сделка вокруг Spirit Airlines читаются вместе: публичный текст конечен, а корпоративные архивы — следующий пласт. Законы и суды догоняют рынок не лозунгами, а цифрами в мировых соглашениях.

Для разработчика это меняет разговор о своём продукте. Если вы копите логи, тикеты или корпус документов «на потом для своей модели», это уже не бесплатный побочный продукт — это актив с юридическим и коммерческим весом.

И наоборот: чужой корпус без лицензии всё чаще заканчивается не «серой зоной», а счётом на миллиарды, как в деле Anthropic. Качество и происхождение данных начинают стоить дороже сырого объёма.

На практике

Текст — обзор чужих сделок, а не прайс на ваш датасет. Имеет смысл читать его как карту рисков, если вы обучаете или дообучаете модель, закупаете корпус или просто храните пользовательский контент.

  1. Фиксируйте происхождение данных: лицензия, договор, источник выгрузки — до того, как корпус попадёт в обучение.
  2. Не стройте план только на «всё, что лежит в открытом API»: Reddit уже показал, как быстро доступ становится платным.
  3. Отделяйте публичный веб, лицензированный медиаконтент и внутренние корпоративные архивы — у каждого свой правовой режим.
  4. Если копите пользовательские тексты «под будущую модель», заранее опишите согласие и цель использования — иначе актив превращается в иск.
  5. Следите за судебными рамками вроде дела Anthropic: «скачали с торрента, но в обучение не брали» уже не выглядит безопасной отговоркой в публичном поле.

Итог

За несколько лет комментарий на форуме, статья в газете и стопка подержанных книг перестали быть «просто контентом» — за них платят десятки и сотни миллионов, а за нарушение авторских прав — уже миллиарды.

Круг замкнулся: цифровой след и обычное общение в сети стали сырьём, без которого завод языковых моделей не работает. Оставляя сегодня очередной «ничего не значащий» комментарий, вы по сути создаёте актив, за который гиганты готовы выписывать чеки.

Комментарии

Загрузка комментариев…