Зміст
Уявіть склад із сотнею вузьких спеціалістів. На кожне замовлення виходять двоє–троє, решта чекають. Рахунок за роботу невеликий — працюють небагато. Але «зарплату за присутність» склад усе одно платить усім: кожного треба десь тримати на полиці. Локальна мовна модель із сумішшю експертів (MoE) влаштована схоже. На токен рахує мало параметрів. Зберігати доводиться майже всю модель.
Кілька років тому домашній запуск упирався в одне питання: «скільки відеопам’яті в карті?». У 2026 році поруч стає інше: «скільки пам’яті система може віддати моделі і наскільки швидко ця пам’ять працює?». Нижче — практична карта вибору заліза: від формул пам’яті до збірок, міфів і чек-листа покупки. Поруч — огляд CPU, GPU, TPU та NPU і кейс міні-ПК з NPU.
Ключові висновки
MoE економить обчислення, а не місце на полицях. У моделі може бути 120 млрд параметрів загалом і кілька мільярдів активних на токен. Швидкість рахунку ближча до «легкої» моделі. Об’єм ваг — ближчий до важкої.
«Запустилась» і «комфортно користуватись» — різні цілі. Модель може відповідати на CPU з вивантаженням шарів на GPU і водночас бути занадто повільною для живого асистента в редакторі. Спочатку вирішіть, що для вас прийнятно: «відкрилась», «терпимо для фону» чи «зручно щодня».
64 ГБ оперативної пам’яті плюс 16 ГБ відеопам’яті — уже серйозний старт, а не іграшка. Разом це близько 80 ГБ фізичної пам’яті різних рівнів. Це не «80 ГБ VRAM». Але на такій машині реально жити із сумішшю експертів для коду класу 20–30B і експериментувати з більшими квантованими моделями через вивантаження.
Контекст їсть пам’ять непомітно. Довге вікно роздуває кеш ключів і значень (KV cache). Для асистента в IDE часто важливіші стабільні 8–32K, ніж теоретичний максимум із картки моделі.
Купуйте шлях зростання, а не ідеальний ПК з першого чека. Швидка пам’ять, запас слотів під RAM і нормальне охолодження важливіші за разову «топову» карту при тісній оперативці.
Що відбувається з пам’яттю, коли модель відповідає
Файл моделі — не весь рахунок. На складі лежать не лише коробки з вагами. Поруч — робочі зони: активації поточного кроку, кеш уваги, буфери рушія, запас під довгий контекст. Груба оцінка:
пам’ять ≈ ваги моделі + KV cache + накладні витрати рушія + буфери
Файл model.gguf на 18 ГБ не означає «вистачить 18 ГБ RAM». Потрібні завантаження, рантайм, кеш під обраний контекст і запас ОС. Дві фази відповіді поводяться по-різному: читання промпта (prefill) — прогріти кеш; генерація (decode) — видавати токени по одному. На слабкій шині пам’яті довгий промпт часто болючіший, ніж сама генерація.
Щільна модель і суміш експертів
Щільна (Dense) мережа на 70B майже на кожному токені ганяє велику частку параметрів. Суміш експертів тримає багато «вузьких спеціалістів» і на токені вмикає лише частину через маршрутизатор:
┌── експерт 1
├── експерт 2
токен → router ──┼── експерт 3
├── …
└── експерт N
активна лише частина
Ключова пара чисел:
усього параметрів ≠ активних параметрів
Приклад порядку величин: близько 120B загалом і 5–6B активних. Обчислень менше, ніж у щільної 70B. Але всі експерти мають бути доступні для маршрутизатора — інакше «спеціаліста» не викликати. Звідси головний тезис статті: MoE економить обчислення, але не пропорційно економить пам’ять.
Два різні стелі: рахунок і пам’ять
Будь-який локальний вивід упирається в два різні обмеження. Рахунок — терафлопси GPU/CPU, тензорні ядра, число активних параметрів. Пам’ять — VRAM, RAM, єдина пам’ять ноутбука чи міні‑ПК, і головне — пропускна здатність (DDR5, GDDR, HBM, єдина пам’ять).
Звідси парадокс: модель на 100 ГБ іноді «оживає» на машині з 64 ГБ RAM і 16 ГБ VRAM через вивантаження шарів. Але «оживає» ≠ «швидко». Повільна оперативка при величезному об’ємі — склад без навантажувачів: місця багато, замовлення повзуть.
Квантування: як ущільнити коробки на полицях
Точність зберігання ваги — це «товщина» упаковки. Орієнтири першого наближення: FP32 ≈ 4 байти на параметр, FP16/BF16 ≈ 2, INT8 ≈ 1, 4‑біт ≈ 0,5 плюс накладні витрати. Для домашнього запуску популярен формат GGUF: метадані, тензори і зручна стиковка з рушіями на кшталт llama.cpp.
Лінійка Q4_K_M, Q5_K_M, Q6_K, Q8 — компроміс розміру, якості й швидкості. Часто зручний баланс — близько Q4/Q5: модель помітно легша за повну точність, а код і дотримання інструкцій ще тримаються. Занадто агресивне стиснення б’є по міркуванню, коду й стабільності інструкцій — це вже не «безкоштовна економія», а інша модель за поведінкою.
Таблиця-оцінка для щільних моделей (порядок величин, не паспорт конкретної збірки):
| Модель | FP16 | INT8 | Q4 |
|---|---|---|---|
| 7B | ~14 ГБ | ~7 ГБ | ~4–5 ГБ |
| 14B | ~28 ГБ | ~14 ГБ | ~8–10 ГБ |
| 32B | ~64 ГБ | ~32 ГБ | ~18–22 ГБ |
| 70B | ~140 ГБ | ~70 ГБ | ~35–45 ГБ |
| 120B | ~240 ГБ | ~120 ГБ | ~60–70 ГБ |
Для MoE дивіться окрему трійку: усього параметрів, активних параметрів, розмір обраного квантування. Формула параметри × байт_на_параметр лишається стартовою, до неї завжди додають накладні витрати, KV і рантайм.
Вивантаження шарів: коли карта і процесор ділять одну модель
Три режими зручно тримати в голові.
Лише GPU — ваги в VRAM, максимальна швидкість, потрібен великий об’єм карти. Лише CPU — ваги в RAM, доступні величезні моделі, швидкість часто фонова. CPU + GPU — частина шарів на карті, частина в оперативці; з’являється ціна перенесення між «верстатом» і «складом».
Навіть 16 ГБ VRAM корисні, коли модель цілком не влізає: важкі шари, прискорення уваги, шматок кешу. Карта не зобов’язана тримати все — вона зобов’язана прискорювати те, що ви на неї поклали. Докладніше про ролі чіпів — в огляді заліза для AI.
Чому зв’язка 64 ГБ RAM + 16 ГБ VRAM цікава
Шістнадцять гігабайт відеопам’яті комфортно тримають 7–14B, частину 20–30B і невеликі MoE цілком або майже цілком. Шістдесят чотири гігабайти оперативки дозволяють зберігати великі GGUF, ганяти вивантаження і пробувати моделі важчі за карту. Сума «80 ГБ» — зручний орієнтир ємності системи, не маркетинговий слоган про єдину надшвидку пам’ять.
Практичні зони на такій машині:
- Чудово: 7–14B, близько 20B, суміші експертів для коду порядку 30B з помірним контекстом.
- Можливо: 70B у
Q4, великіMoE100B+ з помітним вивантаженням шарів. - Уже компроміс: 200B+ і особливо 400B+ — скоріше експеримент, ніж щоденний асистент.
Сусідній полюс — міні‑ПК з NPU і 64 ГБ: там виграють тиша й енергобюджет, а не пік проти дискретної карти.
Сучасні моделі, на яких варто міряти залізо
Орієнтири для стенда, а не рейтинг «найкраща модель тижня».
gpt-oss-20b — зручний клас «серйозно, але ще побутово»: дивіться повний і активний розмір, квант, швидкість читання промпта і генерації, якість коду й міркування.
gpt-oss-120b — інший клас пам’яті. Тут швидко закінчується «влізло в карту» і починається життя на RAM і вивантаженні шарів. Практичність залежить від терпимості до затримки, не лише від факту запуску.
Qwen3-Coder 30B-A3B — головний побутовий приклад суміші експертів для коду: десятки мільярдів загалом при кількох активних. На 32 ГБ RAM тісно; на 64 ГБ плюс 16 ГБ VRAM — якраз зона комфортного експерименту. Більші такі моделі зсувають полицю до 128–256 ГБ.
Порівнюйте близькі задачі: щільна 30B проти MoE ~30B; щільна 70B проти MoE 100B+. Пам’ять, активні параметри, токени в секунду й ціна заліза рідко голосують однаково.
Контекст: прихований споживач полиць
Вікно 32K — не таке ж «дешеве», як 4K. Чим довший вхід і історія, тим більший KV cache. Асистент в IDE особливо ненажерливий: поточний файл, сусіди, патч змін, помилки, шматки документації, історія діалогу. Максимум із картки моделі часто не оптимальний: виграш у «все влізло в промпт» з’їдається пам’яттю й повільним читанням промпта.
Реалістичні режими для дому — 4K / 8K / 16K / 32K, іноді 64K, якщо залізо й задача справді вимагають. Для агентів і IDE корисно читати також як ШІ‑середовища працюють з кодом.
Процесор і шина пам’яті
Число ядер само по собі погано передбачає швидкість локального виводу. Важливіша швидкість на такт (IPC), канали пам’яті, кеш, набір інструкцій і реальна пропускна здатність. На десктопі дивляться лінійки Ryzen і Core із запасом по RAM. На Apple Silicon сильна єдина пам’ять: немає жорсткої стіни «карта / оперативка», зате стелю задає обраний об’єм єдиної пам’яті і екосистема (MLX, Metal). Платформи на кшталт Ryzen AI Max з 128 ГБ єдиної пам’яті іноді цікавіші за зв’язку «звичайний ПК + 16 ГБ дискретної карти», якщо мета — великі MoE в одній коробці. Серверні CPU виправдані, коли потрібні 128–512 ГБ і кілька користувачів.
Конкретні збірки та класи задач
Ультрабюджет: 32 ГБ RAM і 8–12 ГБ VRAM — 7–14B і невеликі MoE, знайомство зі стеком. Оптимальний старт статті: 64 ГБ + 16 ГБ — gpt-oss-20b, Qwen3-Coder 30B-A3B, великі Q4 через вивантаження шарів. Просунута: 128 ГБ + 24 ГБ — більші MoE, 70B Q4, довший контекст. Робоча станція: 128–256 ГБ і 48 ГБ+ VRAM. Єдина пам’ять: порівнюйте 64 / 128 / 256 ГБ єдиної пам’яті з класичною парою RAM + дискретна GPU за ціною, пропускною здатністю і софтом.
| RAM | VRAM | Клас моделей | Сценарій |
|---|---|---|---|
| 16 ГБ | 8 ГБ | ~7B | базові проби |
| 32 ГБ | 12 ГБ | 7–20B | гарний старт |
| 64 ГБ | 16 ГБ | 20–30B MoE |
оптимальний старт |
| 128 ГБ | 24 ГБ | 30–100B+ | просунутий |
| 192 ГБ | 48 ГБ | великі MoE |
робоча станція |
| 256–512 ГБ | 48–80+ ГБ | 200–500B MoE |
верхній сегмент |
Цифри орієнтовні: конкретний GGUF і контекст завжди перепровіряйте на своєму стенді.
Міні‑ПК, звичайний ПК і «AI‑коробки»
Міні‑ПК виграють компактністю, шумом, енергобюджетом і часто об’ємом єдиної або щільної оперативки. Програють охолодженню під довге навантаження, апгрейду й дискретній GPU. Звичайний настільний ПК сильніший у карті, слотах RAM і SSD, але більший і прожорливіший. Має сенс порівнювати три підходи:
Apple Silicon → єдина пам’ять, CPU+GPU, MLX/Metal
x86 + NVIDIA → RAM + VRAM, CUDA, найзвичніший софт
Ryzen AI Max → велика єдина пам’ять + сильна iGPU/NPU
Сумісність софту вирішує не менше кремнію: CUDA, ROCm, Metal, підтримка конкретної MoE‑архітектури в рушії. Кейс з NPU на міні‑ПК показує: маркетинг «AI» не скасовує черги в один потік і дивності драйверів — див. розбір на практиці.
Програмний стек
llama.cpp — найкращий «рентген» локального виводу: шари, кванти, вивантаження шарів, метрики. Ollama і LM Studio прискорюють старт. vLLM ближче до серверного контуру. MLX — природний шлях на Apple. Transformers зручні для експериментів у Python і досліджень, але не завжди оптимальні як домашній асистент‑сервер. Загальний ландшафт фреймворків — в огляді PyTorch / TensorFlow / JAX.
Як міряти, щоб не обманути себе
Однієї цифри «токени в секунду» мало. Дивіться окремо: час до першого токена, швидкість читання промпта, швидкість генерації, пам’ять під ваги й під KV, стабільність на вашому контексті. Бенчмарк «40 токенів/с на короткому чаті» погано передбачає IDE з величезним контекстом, RAG і викликами інструментів — там вирішує повна затримка сценарію. Економіка хмари проти свого заліза — в обліку витрат шлюза LLM; про контури з пошуком по базі — в бойовому RAG.
Міні‑протокол на одну модель:
залізо → модель → квант → контекст
RAM/VRAM used → prompt tok/s → generation tok/s → TTFT
CPU-only / GPU-offload / GPU-only → нотатки про якість коду
Локальний асистент для коду на своїй машині
Типова схема домашнього контуру:
IDE → локальний API → сервер моделі → `MoE` → GPU + RAM
Зверху — Continue, агенти на кшталт Cline, OpenAI‑сумісний API, MCP і виклики інструментів. Саме тут спливають читання довгого промпта, контекст і черга: асистент «думає довго», хоча токени/с на короткому промпті був пристойним. Роль програміста поруч із моделями змінюється — про це окремий лонгрід.
Міфи, які заважають купити правильний ПК
«MoE — це маленька модель». Ні: маленькими бувають активні параметри. «Раз активно 5B, пам’яті потрібно як для 5B». Ні: полиці зайняті всіма експертами. «64 ГБ RAM замінюють 64 ГБ VRAM». Ні: різна швидкість. «Чим більше VRAM, тим завжди краще». Не обов’язково, якщо оперативки мало для ваших MoE. «Вивід на CPU марний». Ні — особливо для великих моделей і приватного фону. «Завжди вмикайте максимальний контекст». Ні: платите пам’яттю й читанням промпта.
Не варто: дуже сильний CPU при тісній RAM; дорога карта при 32 ГБ, які не розширити; повільна пам’ять «заради економії»; гнатися за терафлопсами без VRAM і без запасу оперативки.
Чек-лист покупки та шлях апгрейду
Перед оплатою перевірте: RAM ≥ 64 ГБ або реальний шлях розширення; VRAM ≥ 16 ГБ або порівнянна єдина пам’ять; висока пропускна здатність пам’яті; швидкий NVMe; охолодження під довгий вивід; Linux або потрібна вам ОС; CUDA / ROCm / Metal під стек; запас блоку живлення; шум; мережа для домашнього API.
Шлях зростання без покупки «всього одразу»:
етап 1: 64 ГБ RAM + 16 ГБ VRAM
етап 2: 128 ГБ RAM + 24 ГБ VRAM
етап 3: 128–256 ГБ + 48 ГБ VRAM
етап 4: 256–512 ГБ + кілька GPU
Ідея проста: нарощуйте ємність пам’яті й прискорення в міру того, як упираєтесь у реальний сценарій, а не в чужий скріншот.
Часті запитання
Чи можна запускати сучасні MoE без карти на 80 ГБ?
Так, якщо вистачає системної пам’яті і ви приймаєте швидкість вивантаження шарів і CPU. «Запускається» не означає «зручно як хмарний чат».
Чим 64 ГБ RAM + 16 ГБ VRAM краще, ніж 32 ГБ + 24 ГБ?
Для великих MoE часто важливіша полиця під усіх експертів, ніж зайві 8 ГБ на карті при тісній оперативці. Для щільних моделей, які цілком живуть у VRAM, перевага може бути в 24 ГБ.
Який квант обрати для коду?
Почніть з Q4_K_M / Q5_K_M і прогоніть свої задачі. Якщо ламається дотримання інструкцій або якість патчів — піднімайте точність, а не лише контекст.
Чи потрібен міні‑ПК з NPU замість десктопа?
Якщо потрібні тиша, енергобюджет і велика єдина/щільна пам’ять — так, як клас. Якщо потрібен звичний CUDA‑стек і апгрейд карти — частіше виграє звичайний ПК. Дивіться практичний кейс NPU.
Чому асистент в IDE гальмує при «нормальних» токенах/с?
Часто винні довге читання промпта, великий контекст, повторна подача файлів і інструменти. Дивіться час до першого токена й повний сценарій, не лише генерацію.
Що почитати далі
Висновок
MoE не зробив відеокарту зайвою. MoE зробив велику системну пам’ять помітно ціннішою. У домашньому локальному ШІ 2026 року зручна спрощена формула звучить так:
RAM ≈ які моделі вам взагалі доступні
VRAM ≈ наскільки швидко ви їх обробляєте
Практична стартова точка для експериментів із сумішшю експертів для коду — 64 ГБ RAM + 16 ГБ VRAM, швидка пам’ять і нормальний NVMe. Часто це цікавіше, ніж 32 ГБ оперативки при жирнішій карті, якщо ваша мета — саме великі суміші експертів, а не одна щільна модель цілком у VRAM.
Склад як і раніше має вмістити всіх спеціалістів. Питання лише в тому, скількох ви готові тримати на полицях — і наскільки швидкий у вас верстат.



Коментарі