Содержание
Коротко
Тим Деттмерс спорит с двумя страхами сразу: студенты боятся, что работы не останется, а аспиранты считают университетские исследования бессмысленными, пока нет дата-центра. Его ответ — сильные модели уже помещаются на обычную видеокарту и на ноутбук, а единица работы лаборатории больше не отдельная статья, а связанный набор инструментов. На неделе открытого кода он обещает показать это кодом, а не тезисами.
Что произошло
На занятии он спросил, кто боится не найти работу после выпуска. Руку подняли около восьмидесяти процентов из ста пятидесяти человек — примерно сто двадцать студентов. Параллельно ему пишут аспиранты, которые хотят скорее уйти в большую лабораторию: им кажется, что в университете исследования уже ничего не значат. Обе картины, пишет он, держатся на одной ошибке — будто будущее достанется тому, у кого больше видеокарт.
Неделя открытого кода у него устроена как один комплект, а не как россыпь заметок. Он обещает три вещи: автономные исследования на переднем крае, самый экономный из известных ему способов наращивать вычисления на этапе ответа и сжатие контекста, которое, по его словам, эффективнее того, что делают Claude Code и Codex. Обвязку агента можно направить на репозиторий с ядрами CUDA и оставить дорабатывать их без подсказок по ходу. На реализациях под Mac и Metal так получили квантованный вывод модели Qwen 3.6 35B-A3B: около 450 токенов в секунду при 1,5 бита на вес. Половинная точность занимает 16 бит на вес; при 1,5 бита та же модель занимает примерно десятую долю памяти.
Дальше — про железо, которое уже стоит на столе. Популярная локальная модель — Qwen 3.8 на 27 миллиардов параметров. Их каркас, пишет он, позволяет запустить старшего родственника, Qwen 3.8 Flash Next на 125 миллиардов, на одной видеокарте на 24 ГБ. DeepSeek V4.1 на 550 миллиардов — на AMD Strix, NVIDIA DGX Spark или MacBook со 128 ГБ памяти. Длину контекста, по его описанию, не нужно вести вручную: сжатие и обработка длинного входа встроены. Отдельно он рассказывает про связку этих частей в автономное исследование: система работает локально и, по его оценке, обходит глубокий поиск больших лабораторий, включая системы Sakana AI и ScientistOne от Google. На свежей задаче агент за два часа на машине лаборатории сдвинул нижнюю границу эвристик, собрал сильный эвристический метод, приблизился к дорогим методам, обученным моделями, и нашёл проблемы в данных, на которых область обычно оценивает себя. Общего лучшего результата по всей задаче они не достигли. Раньше та же помощь жила в боте Slack и падала; студенты писали, что бот снова молчит.
Почему это важно
Если сильная модель помещается на карту в обычном компьютере, гонка «у кого больше стоек» перестаёт быть единственным входом в исследование. Университетская лаборатория как раз сильна тем, чего у большой компании меньше: своими задачами, студентами, которые пользуются системой каждый день, и правом публиковать не одну статью, а связанные куски — обвязку, ядра, данные и разбор ошибок оценки. Деттмерс прямо говорит, что статья как единица зачёта устарела: читателю больше не нужно самому сшивать разрозненные работы.
Второй вывод — про работу, а не про «исчезновение профессий». Он не обещает, что ничего не сдвинется. Он пишет, что ломается привычный порядок «сначала база, потом задачи», а спрос на новые продукты и найм появляются уже после этой ломки. Пессимистичное чтение останавливается на беспорядке и не смотрит, что за ним. Для инженера это практичнее лозунга «ИИ всё заберёт»: смотреть, какие модели уже крутятся локально и какой контур исследования можно собрать без чужого API.
На практике
Локальный вывод не отменяет проверки качества. 1,5 бита на вес и сотни токенов в секунду — заявка автора на конкретной связке Mac и Metal, а не гарантия для любой карты. Автономный агент, которого оставляют один на один с ядрами, полезен только если есть дешёвая проверка: у них как раз было условие, что оценка должна помещаться на имеющееся железо, а задача — свежая, из последних недель.
Имеет смысл отделить обещание недели открытого кода от уже описанных замеров. Два проекта и четыре статьи он обещает выложить вместе, со сдвигом на день; имён в этом тексте ещё нет. Пока ориентир — цифры, которые он уже называет, и честная оговорка, что за два часа они не взяли лучший результат по всей задаче, зато усомнились в данных оценки.
- Прежде чем арендовать кластер, проверьте, влезает ли нужная модель в 24 ГБ или в память ноутбука в том квантовании, которое вы готовы принять по качеству.
- Для агента на своём коде заложите автоматическую проверку: без неё многочасовой прогон не отличить от красивого, но пустого отчёта.
- Смотрите не только на скорость токенов, но и на то, не ломается ли оценка задачи — автор как раз нашёл проблемы в общепринятых данных.
- Не ждите, что бот в чате заменит обвязку: у них первый вариант в
Slackбыл слишком хрупким для ежедневной работы студентов.
Итог
Текст Деттмерса — аргумент, что небольшая лаборатория выигрывает не числом видеокарт, а связкой локальных моделей, агента и открытых кусков, которыми можно пользоваться каждый день. Цифры по Qwen и DeepSeek стоит читать как отчёт автора о своём каркасе, а не как независимый сравнительный тест. Следить имеет смысл за тем, выйдут ли обещанные два проекта и четыре работы одним комплектом и подтвердят ли они эти замеры.



Комментарии