← Усі статті

Сильний ШІ на своєму залізі: чому невелика лабораторія знову в грі

Тім Деттмерс: локальний вивід великих моделей і автономні дослідження без гонитви за кількістю відеокарт.

Сильний ШІ на своєму залізі: чому невелика лабораторія знову в грі
Зміст

Коротко

Тім Деттмерс сперечається одразу з двома страхами: студенти бояться, що роботи не лишиться, а аспіранти вважають університетські дослідження безглуздими, доки немає дата-центру. Його відповідь — сильні моделі вже вміщаються на звичайну відеокарту й на ноутбук, а одиниця роботи лабораторії більше не окрема стаття, а зв’язаний набір інструментів. На тижні відкритого коду він обіцяє показати це кодом, а не тезами.

Що сталося

На занятті він запитав, хто боїться не знайти роботу після випуску. Руку підняли близько вісімдесяти відсотків зі ста п’ятдесяти людей — приблизно сто двадцять студентів. Паралельно йому пишуть аспіранти, які хочуть швидше піти у велику лабораторію: їм здається, що в університеті дослідження вже нічого не варті. Обидві картини, пише він, тримаються на одній помилці — ніби майбутнє дістанеться тому, у кого більше відеокарт.

Тиждень відкритого коду в нього влаштований як один комплект, а не як розсип нотаток. Він обіцяє три речі: автономні дослідження на передньому краї, найощадніший із відомих йому способів нарощувати обчислення на етапі відповіді і стиснення контексту, яке, за його словами, ефективніше за те, що роблять Claude Code і Codex. Обв’язку агента можна спрямувати на репозиторій з ядрами CUDA і лишити доробляти їх без підказок по ходу. На реалізаціях під Mac і Metal так отримали квантований вивід моделі Qwen 3.6 35B-A3B: близько 450 токенів на секунду при 1,5 біта на вагу. Половинна точність займає 16 біт на вагу; при 1,5 біта та сама модель займає приблизно десяту частку пам’яті.

Далі — про залізо, яке вже стоїть на столі. Популярна локальна модель — Qwen 3.8 на 27 мільярдів параметрів. Їхній каркас, пише він, дозволяє запустити старшого родича, Qwen 3.8 Flash Next на 125 мільярдів, на одній відеокарті на 24 ГБ. DeepSeek V4.1 на 550 мільярдів — на AMD Strix, NVIDIA DGX Spark або MacBook зі 128 ГБ пам’яті. Довжину контексту, за його описом, не потрібно вести вручну: стиснення і обробка довгого входу вбудовані. Окремо він розповідає про зв’язку цих частин в автономне дослідження: система працює локально і, за його оцінкою, обходить глибокий пошук великих лабораторій, включно з системами Sakana AI і ScientistOne від Google. На свіжій задачі агент за дві години на машині лабораторії зсунув нижню межу евристик, зібрав сильний евристичний метод, наблизився до дорогих методів, навчених моделями, і знайшов проблеми в даних, на яких галузь зазвичай себе оцінює. Загального найкращого результату по всій задачі вони не досягли. Раніше та сама поміч жила в боті Slack і падала; студенти писали, що бот знову мовчить.

Чому це важливо

Якщо сильна модель вміщається на карту в звичайному комп’ютері, гонитва «у кого більше стійок» перестає бути єдиним входом у дослідження. Університетська лабораторія якраз сильна тим, чого у великої компанії менше: власними задачами, студентами, які користуються системою щодня, і правом публікувати не одну статтю, а зв’язані шматки — обв’язку, ядра, дані і розбір помилок оцінки. Деттмерс прямо каже, що стаття як одиниця заліку застаріла: читачеві більше не потрібно самому зшивати розрізнені роботи.

Другий висновок — про роботу, а не про «зникнення професій». Він не обіцяє, що нічого не зрушиться. Він пише, що ламається звичний порядок «спочатку база, потім задачі», а попит на нові продукти і наймання з’являються вже після цієї ламки. Песимістичне читання зупиняється на безладі і не дивиться, що за ним. Для інженера це практичніше за гасло «ШІ все забере»: дивитися, які моделі вже крутяться локально і який контур дослідження можна зібрати без чужого API.

На практиці

Локальний вивід не скасовує перевірки якості. 1,5 біта на вагу і сотні токенів на секунду — заявка автора на конкретній зв’язці Mac і Metal, а не гарантія для будь-якої карти. Автономний агент, якого лишають наодинці з ядрами, корисний лише якщо є дешева перевірка: у них якраз була умова, що оцінка має вміщатися на наявне залізо, а задача — свіжа, з останніх тижнів.

Варто відділити обіцянку тижня відкритого коду від уже описаних замірів. Два проєкти і чотири статті він обіцяє викласти разом, зі зсувом на день; імен у цьому тексті ще немає. Поки орієнтир — цифри, які він уже називає, і чесна обмовка, що за дві години вони не взяли найкращий результат по всій задачі, зате засумнівалися в даних оцінки.

  1. Перш ніж орендувати кластер, перевірте, чи влазить потрібна модель у 24 ГБ або в пам’ять ноутбука в тому квантуванні, яке ви готові прийняти за якістю.
  2. Для агента на своєму коді закладіть автоматичну перевірку: без неї багатогодинний прогін не відрізнити від гарного, але порожнього звіту.
  3. Дивіться не лише на швидкість токенів, а й на те, чи не ламається оцінка задачі — автор якраз знайшов проблеми в загальноприйнятих даних.
  4. Не чекайте, що бот у чаті замінить обв’язку: у них перший варіант у Slack був надто крихким для щоденної роботи студентів.

Підсумок

Текст Деттмерса — аргумент, що невелика лабораторія виграє не числом відеокарт, а зв’язкою локальних моделей, агента і відкритих шматків, якими можна користуватися щодня. Цифри по Qwen і DeepSeek варто читати як звіт автора про свій каркас, а не як незалежний порівняльний тест. Стежити має сенс за тим, чи вийдуть обіцяні два проєкти і чотири роботи одним комплектом і чи підтвердять вони ці заміри.

Коментарі

Завантаження коментарів…