Содержание
Коротко
На Habr вышел обзор о том, как текст с форумов, новости и даже старые бумажные книги превратились в товар с ценником.
Это похоже на нефть: пока она «просто течёт», никто не считает баррели, а когда завод стоит без сырья — платят за доступ.
Автор проходит путь от платного API у Reddit и медиасделок OpenAI до банкротного аукциона Spirit Airlines и проекта Anthropic по скупке и уничтожению физических книг.
Что произошло
Бум больших языковых моделей принято отсчитывать с 2022 года и выхода ChatGPT на базе GPT-3.5.
Для обучения нужны чужие тексты, код, фото и переписка — без человеческого следа модель не из чего собирать. Автор напоминает простую картинку: новая пекарня «не существует» для рекомендательной системы, пока кто‑то не откроет её страницу, не оставит отзыв и оценку. Информация появляется только вместе с действием.
Когда данных мало, богатый игрок не ждёт, пока пользователи сами загрузят PDF: он покупает доступ. Форумы здесь особенно ценны — долгий архив вопросов и ответов, уже отфильтрованный живым общением.
Первым громким сигналом стал Reddit. В апреле 2023 года компания закрыла бесплатный API, через два месяца доступ стал платным.
Клиент Apollo для iOS закрылся — разработчик оценил стоимость API примерно в 20 миллионов долларов в год. В начале 2024 года Reddit договорился с Google примерно на 60 миллионов долларов в год за лицензию контента для обучения ИИ; к IPO сумма похожих соглашений уже превышала 200 миллионов долларов.
Весной 2024 года OpenAI объявляла партнёрства почти каждую неделю: Stack Overflow (сайт незадолго до этого сократил около 28% сотрудников на фоне падения трафика), снова Reddit, затем News Corp более чем на 250 миллионов долларов за пять лет.
Дальше — Dotdash Meredith не менее чем на 16 миллионов, Axel Springer около 13 миллионов долларов в год на срок до трёх лет, Financial Times от 5 до 10 миллионов в год. Wiley закрыла две сделки на 21 и 23 миллиона с неназванными покупателями; Informa получила стартовые 10 миллионов от Microsoft. У Shutterstock лицензирование для ИИ в 2023 году дало около 104 миллионов долларов.
Прогноз Epoch AI ещё в 2024-м предупреждал: общедоступный человеческий контент как топливо для обучения начнёт резко сжиматься с 2026 года и почти исчерпается к 2032-му.
На этом фоне 2 мая 2026 года обанкротившийся Spirit Airlines стал источником другого типа сырья. Google выиграла аукцион корпоративных данных за 10 миллионов долларов — речь о порядка 100 миллионов писем и около 500 миллионов сообщений из Microsoft Teams плюс внутренние документы; персональные данные клиентов компания, по её словам, не получает.
Отдельно — Anthropic. В июле 2026 года суд в Сан-Франциско утвердил мировое соглашение на 1,5 миллиарда долларов по иску издателей и авторов о книгах с торрентов; правообладателям около 3000 долларов за каждое произведение в соглашении.
Параллельно из дела всплыл проект «Панама»: с 2024 года компания скупает бумажные книги, сканирует их для обучения Claude и уничтожает оригиналы — миллионы подержанных томов. Легальная цепочка владения стала дороже, чем «серый» скачиваемый архив.
Почему это важно
Рынок перестал спорить только о «можно ли парсить открытый веб».
Платный API, лицензии СМИ и банкротные архивы показывают другую норму: происхождение данных — такой же актив, как железо или уголь на заводе. Когда открытый поток иссякает, покупают то, чего нет в общем доступе: почту компании, внутренние базы, отсканированные книги с понятной цепочкой владения.
Прогноз Epoch AI и сделка вокруг Spirit Airlines читаются вместе: публичный текст конечен, а корпоративные архивы — следующий пласт. Законы и суды догоняют рынок не лозунгами, а цифрами в мировых соглашениях.
Для разработчика это меняет разговор о своём продукте. Если вы копите логи, тикеты или корпус документов «на потом для своей модели», это уже не бесплатный побочный продукт — это актив с юридическим и коммерческим весом.
И наоборот: чужой корпус без лицензии всё чаще заканчивается не «серой зоной», а счётом на миллиарды, как в деле Anthropic. Качество и происхождение данных начинают стоить дороже сырого объёма.
На практике
Текст — обзор чужих сделок, а не прайс на ваш датасет. Имеет смысл читать его как карту рисков, если вы обучаете или дообучаете модель, закупаете корпус или просто храните пользовательский контент.
- Фиксируйте происхождение данных: лицензия, договор, источник выгрузки — до того, как корпус попадёт в обучение.
- Не стройте план только на «всё, что лежит в открытом
API»:Redditуже показал, как быстро доступ становится платным. - Отделяйте публичный веб, лицензированный медиаконтент и внутренние корпоративные архивы — у каждого свой правовой режим.
- Если копите пользовательские тексты «под будущую модель», заранее опишите согласие и цель использования — иначе актив превращается в иск.
- Следите за судебными рамками вроде дела
Anthropic: «скачали с торрента, но в обучение не брали» уже не выглядит безопасной отговоркой в публичном поле.
Итог
За несколько лет комментарий на форуме, статья в газете и стопка подержанных книг перестали быть «просто контентом» — за них платят десятки и сотни миллионов, а за нарушение авторских прав — уже миллиарды.
Круг замкнулся: цифровой след и обычное общение в сети стали сырьём, без которого завод языковых моделей не работает. Оставляя сегодня очередной «ничего не значащий» комментарий, вы по сути создаёте актив, за который гиганты готовы выписывать чеки.



Комментарии