Содержание
Представьте склад с сотней узких специалистов. На каждый заказ выходят двое–трое, остальные ждут. Счёт за работу небольшой — трудятся немногие. Но зарплату «за присутствие» склад всё равно платит всем: каждого нужно где-то держать на полке. Локальная языковая модель со смесью экспертов (MoE) устроена похоже. Считает мало параметров за токен. Хранить приходится почти всю модель.
Несколько лет назад домашний запуск упирался в один вопрос: «сколько видеопамяти у карты?». В 2026 году рядом встаёт другой: «сколько памяти система может отдать модели и насколько быстро эта память работает?». Ниже — практическая карта выбора железа: от формул памяти до сборок, мифов и чек-листа покупки. Рядом — обзор CPU, GPU, TPU и NPU и кейс мини‑ПК с NPU.
Ключевые выводы
MoE экономит вычисления, а не место на полках. У модели может быть 120 млрд параметров всего и несколько миллиардов активных на токен. Скорость счёта ближе к «лёгкой» модели. Объём весов — ближе к тяжёлой.
Запустить и комфортно пользоваться — разные цели. Модель может отвечать на CPU с выгрузкой слоёв на GPU и при этом быть слишком медленной для живого ассистента в редакторе. Сначала решите, что для вас приемлемо: «открылась», «терпимо для фона» или «удобно каждый день».
64 ГБ оперативной памяти плюс 16 ГБ видеопамяти — уже серьёзный старт, а не игрушка. Вместе это около 80 ГБ физической памяти разных уровней. Это не «80 ГБ VRAM». Зато на такой машине реально жить со смесью экспертов для кода класса 20–30B и экспериментировать с более крупными квантованными моделями через выгрузку.
Контекст ест память незаметно. Длинное окно раздувает кэш ключей и значений (KV cache). Для ассистента в IDE часто важнее стабильные 8–32K, чем теоретический максимум с карточки модели.
Покупайте путь роста, а не идеальный ПК с первого чека. Быстрая память, запас слотов под RAM и нормальное охлаждение важнее разовой «топовой» карты при тесной оперативке.
Что происходит с памятью, когда модель отвечает
Файл модели — не весь счёт. На складе лежат не только коробки с весами. Рядом — рабочие зоны: активации текущего шага, кэш внимания, буферы движка, запас под длинный контекст. Грубая оценка:
память ≈ веса модели + KV cache + накладные расходы движка + буферы
Файл model.gguf на 18 ГБ не означает «хватит 18 ГБ RAM». Нужны загрузка, рантайм, кэш под выбранный контекст и запас ОС. Две фазы ответа ведут себя по-разному: чтение промпта (prefill) — прогреть кэш; генерация (decode) — выдавать токены по одному. На слабой шине памяти длинный промпт часто больнее, чем сама генерация.
Плотная модель и смесь экспертов
Плотная (Dense) сеть на 70B почти на каждом токене гоняет большую долю параметров. Смесь экспертов держит много «узких специалистов» и на токене включает лишь часть через маршрутизатор:
┌── эксперт 1
├── эксперт 2
токен → router ──┼── эксперт 3
├── …
└── эксперт N
активна только часть
Ключевая пара чисел:
всего параметров ≠ активных параметров
Пример порядка величин: порядка 120B всего и 5–6B активных. Вычислений меньше, чем у плотной 70B. Но все эксперты должны быть доступны для маршрутизатора — иначе «специалиста» не вызвать. Отсюда главный тезис статьи: MoE экономит вычисления, но не пропорционально экономит память.
Два разных потолка: счёт и память
Любой локальный вывод упирается в два разных ограничения. Счёт — терафлопсы GPU/CPU, тензорные ядра, число активных параметров. Память — VRAM, RAM, единая память ноутбука или мини‑ПК, и главное — пропускная способность (DDR5, GDDR, HBM, единая память).
Отсюда парадокс: модель на 100 ГБ иногда «оживает» на машине с 64 ГБ RAM и 16 ГБ VRAM через выгрузку слоёв. Но «оживает» ≠ «быстро». Медленная оперативка при огромном объёме даёт склад без погрузчиков: места много, заказы ползут.
Квантование: как уплотнить коробки на полках
Точность хранения веса — это «толщина» упаковки. Ориентиры первого приближения: FP32 ≈ 4 байта на параметр, FP16/BF16 ≈ 2, INT8 ≈ 1, 4‑бит ≈ 0,5 плюс накладные расходы. Для домашнего запуска популярен формат GGUF: метаданные, тензоры и удобная стыковка с движками вроде llama.cpp.
Линейка Q4_K_M, Q5_K_M, Q6_K, Q8 — компромисс размера, качества и скорости. Часто удобный баланс — около Q4/Q5: модель заметно легче полной точности, а код и следование инструкции ещё держатся. Слишком агрессивное сжатие бьёт по рассуждению, коду и стабильности инструкций — это уже не «бесплатная экономия», а другая модель по поведению.
Таблица-оценка для плотных моделей (порядок величин, не паспорт конкретной сборки):
| Модель | FP16 | INT8 | Q4 |
|---|---|---|---|
| 7B | ~14 ГБ | ~7 ГБ | ~4–5 ГБ |
| 14B | ~28 ГБ | ~14 ГБ | ~8–10 ГБ |
| 32B | ~64 ГБ | ~32 ГБ | ~18–22 ГБ |
| 70B | ~140 ГБ | ~70 ГБ | ~35–45 ГБ |
| 120B | ~240 ГБ | ~120 ГБ | ~60–70 ГБ |
Для MoE смотрите отдельную тройку: всего параметров, активных параметров, размер выбранного квантования. Формула параметры × байт_на_параметр остаётся стартовой, к ней всегда добавляют накладные расходы, KV и рантайм.
Выгрузка слоёв: когда карта и процессор делят одну модель
Три режима удобно держать в голове.
Только GPU — веса в VRAM, максимальная скорость, нужен большой объём карты. Только CPU — веса в RAM, доступны огромные модели, скорость часто фоновая. CPU + GPU — часть слоёв на карте, часть в оперативке; появляется цена переноса между «верстаком» и «складом».
Даже 16 ГБ VRAM полезны, когда модель целиком не влезает: тяжёлые слои, ускорение внимания, кусок кэша. Карта не обязана держать всё — она обязана ускорять то, что вы на неё положили. Подробнее про роли чипов — в обзоре железа для AI.
Почему связка 64 ГБ RAM + 16 ГБ VRAM интересна
Шестнадцать гигабайт видеопамяти комфортно держат 7–14B, часть 20–30B и небольшие MoE целиком или почти целиком. Шестьдесят четыре гигабайта оперативки позволяют хранить крупные GGUF, гонять выгрузку и пробовать модели тяжелее карты. Сумма «80 ГБ» — удобный ориентир ёмкости системы, не маркетинговый слоган про единую сверхбыструю память.
Практические зоны на такой машине:
- Отлично: 7–14B, около 20B, смеси экспертов для кода порядка 30B с умеренным контекстом.
- Возможно: 70B в
Q4, крупныеMoE100B+ с заметной выгрузкой слоёв. - Уже компромисс: 200B+ и особенно 400B+ — скорее эксперимент, чем ежедневный ассистент.
Соседний полюс — мини‑ПК с NPU и 64 ГБ: там выигрывают тишина и энергобюджет, а не пик против дискретной карты.
Современные модели, на которых стоит мерить железо
Ориентиры для стенда, а не рейтинг «лучшая модель недели».
gpt-oss-20b — удобный класс «серьёзно, но ещё бытово»: смотрите полный и активный размер, квант, скорость чтения промпта и генерации, качество кода и рассуждения.
gpt-oss-120b — другой класс памяти. Здесь быстро заканчивается «влезло в карту» и начинается жизнь на RAM и выгрузке слоёв. Практичность зависит от терпимости к задержке, не только от факта запуска.
Qwen3-Coder 30B-A3B — главный бытовой пример смеси экспертов для кода: десятки миллиардов всего при нескольких активных. На 32 ГБ RAM тесно; на 64 ГБ плюс 16 ГБ VRAM — как раз зона комфортного эксперимента. Более крупные такие модели сдвигают полку к 128–256 ГБ.
Сравнивайте близкие задачи: плотная 30B против MoE ~30B; плотная 70B против MoE 100B+. Память, активные параметры, токены в секунду и цена железа редко голосуют одинаково.
Контекст: скрытый потребитель полок
Окно 32K — не такое же «дешёвое», как 4K. Чем длиннее вход и история, тем больше KV cache. Ассистент в IDE особенно прожорлив: текущий файл, соседи, патч изменений, ошибки, куски документации, история диалога. Максимум с карточки модели часто не оптимален: выигрыш в «всё влезло в промпт» съедается памятью и медленным чтением промпта.
Реалистичные режимы для дома — 4K / 8K / 16K / 32K, иногда 64K, если железо и задача правда требуют. Для агентов и IDE полезно читать также как ИИ‑среды работают с кодом.
Процессор и шина памяти
Число ядер само по себе плохо предсказывает скорость локального вывода. Важнее скорость на такт (IPC), каналы памяти, кэш, набор инструкций и реальная пропускная способность. На десктопе смотрят линейки Ryzen и Core с запасом по RAM. На Apple Silicon сильна единая память: нет жёсткой стены «карта / оперативка», зато потолок задаёт выбранный объём единой памяти и экосистема (MLX, Metal). Платформы вроде Ryzen AI Max с 128 ГБ единой памяти иногда интереснее связки «обычный ПК + 16 ГБ дискретной карты», если цель — большие MoE на одной коробке. Серверные CPU оправданы, когда нужны 128–512 ГБ и несколько пользователей.
Конкретные сборки и классы задач
Ультрабюджет: 32 ГБ RAM и 8–12 ГБ VRAM — 7–14B и небольшие MoE, знакомство со стеком. Оптимальный старт статьи: 64 ГБ + 16 ГБ — gpt-oss-20b, Qwen3-Coder 30B-A3B, крупные Q4 через выгрузку слоёв. Продвинутая: 128 ГБ + 24 ГБ — большие MoE, 70B Q4, длиннее контекст. Рабочая станция: 128–256 ГБ и 48 ГБ+ VRAM. Единая память: сравнивайте 64 / 128 / 256 ГБ единой памяти с классической парой RAM + дискретная GPU по цене, пропускной способности и софту.
| RAM | VRAM | Класс моделей | Сценарий |
|---|---|---|---|
| 16 ГБ | 8 ГБ | ~7B | базовый пробы |
| 32 ГБ | 12 ГБ | 7–20B | хороший старт |
| 64 ГБ | 16 ГБ | 20–30B MoE |
оптимальный старт |
| 128 ГБ | 24 ГБ | 30–100B+ | продвинутый |
| 192 ГБ | 48 ГБ | крупные MoE |
рабочая станция |
| 256–512 ГБ | 48–80+ ГБ | 200–500B MoE |
верхний сегмент |
Цифры ориентировочные: конкретный GGUF и контекст всегда перепроверяйте на своём стенде.
Мини‑ПК, обычный ПК и «AI‑коробки»
Мини‑ПК выигрывают компактностью, шумом, энергобюджетом и часто объёмом единой или плотной оперативки. Проигрывают охлаждению под долгий нагрузкой, апгрейду и дискретной GPU. Обычный настольный ПК сильнее в карте, слотах RAM и SSD, но больше и прожорливее. Имеет смысл сравнивать три подхода:
Apple Silicon → единая память, CPU+GPU, MLX/Metal
x86 + NVIDIA → RAM + VRAM, CUDA, самый привычный софт
Ryzen AI Max → большая единая память + сильная iGPU/NPU
Совместимость софта решает не меньше кремния: CUDA, ROCm, Metal, поддержка конкретной MoE‑архитектуры в движке. Кейс с NPU на мини‑ПК показывает: маркетинг «AI» не отменяет очереди в один поток и странностей драйверов — см. разбор на практике.
Программный стек
llama.cpp — лучший «рентген» локального вывода: слои, кванты, выгрузку слоёв, метрики. Ollama и LM Studio ускоряют старт. vLLM ближе к серверному контуру. MLX — естественный путь на Apple. Transformers удобны для экспериментов в Python и исследований, но не всегда оптимальны как домашний ассистент‑сервер. Общий ландшафт фреймворков — в обзоре PyTorch / TensorFlow / JAX.
Как измерять, чтобы не обмануть себя
Одной цифры «токены в секунду» мало. Смотрите отдельно: время до первого токена, скорость чтения промпта, скорость генерации, память под веса и под KV, стабильность на вашем контексте. Бенчмарк «40 токенов/с на коротком чате» плохо предсказывает IDE с огромным контекстом, RAG и вызовами инструментов — там решает полная задержка сценария. Экономика облака против своего железа — в учёте затрат шлюза LLM; про контуры с поиском по базе — в боевом RAG.
Мини‑протокол на одну модель:
железо → модель → квант → контекст
RAM/VRAM used → prompt tok/s → generation tok/s → TTFT
CPU-only / GPU-offload / GPU-only → заметки по качеству кода
Локальный ассистент для кода на своей машине
Типичная схема домашнего контура:
IDE → локальный API → сервер модели → `MoE` → GPU + RAM
Сверху — Continue, агенты в духе Cline, OpenAI‑совместимый API, MCP и вызовы инструментов. Именно здесь всплывают чтение длинного промпта, контекст и очередь: ассистент «думает долго», хотя токены/с на коротком промпте был приличным. Роль программиста рядом с моделями меняется — об этом отдельный лонгрид.
Мифы, которые мешают купить правильный ПК
«MoE — это маленькая модель». Нет: маленькими бывают активные параметры. «Раз активно 5B, памяти нужно как для 5B». Нет: полки заняты всеми экспертами. «64 ГБ RAM заменяют 64 ГБ VRAM». Нет: разная скорость. «Чем больше VRAM, тем всегда лучше». Не обязательно, если оперативки мало для ваших MoE. «Вывод на CPU бесполезен». Нет — особенно для крупных моделей и приватного фона. «Всегда включайте максимальный контекст». Нет: платите памятью и чтением промпта.
Не стоит: очень сильный CPU при тесной RAM; дорогая карта при 32 ГБ, которые нельзя расширить; медленная память «ради экономии»; гнаться за терафлопсами без VRAM и без запаса оперативки.
Чек-лист покупки и путь апгрейда
Перед оплатой проверьте: RAM ≥ 64 ГБ или реальный путь расширения; VRAM ≥ 16 ГБ либо сопоставимая единая память; высокая пропускная способность памяти; быстрый NVMe; охлаждение под долгий вывод; Linux или нужная вам ОС; CUDA / ROCm / Metal под стек; запас блока питания; шум; сеть для домашнего API.
Путь роста без покупки «всего сразу»:
этап 1: 64 ГБ RAM + 16 ГБ VRAM
этап 2: 128 ГБ RAM + 24 ГБ VRAM
этап 3: 128–256 ГБ + 48 ГБ VRAM
этап 4: 256–512 ГБ + несколько GPU
Идея простая: наращивайте ёмкость памяти и ускорение по мере того, как упираетесь в реальный сценарий, а не в чужой скриншот.
Частые вопросы
Можно ли запускать современные MoE без карты на 80 ГБ?
Да, если хватает системной памяти и вы принимаете скорость выгрузки слоёв и CPU. «Запускается» не значит «удобно как облачный чат».
Чем 64 ГБ RAM + 16 ГБ VRAM лучше, чем 32 ГБ + 24 ГБ?
Для больших MoE часто важнее полка под все эксперты, чем лишние 8 ГБ на карте при тесной оперативке. Для плотных моделей, которые целиком живут в VRAM, перевес может быть у 24 ГБ.
Какой квант выбрать для кода?
Начните с Q4_K_M / Q5_K_M и прогоните свои задачи. Если ломается следование инструкции или качество патчей — поднимайте точность, а не только контекст.
Нужен ли мини‑ПК с NPU вместо десктопа?
Если нужны тишина, энергобюджет и большая единая/плотная память — да, как класс. Если нужен привычный CUDA‑стек и апгрейд карты — чаще выигрывает обычный ПК. Смотрите практический кейс NPU.
Почему ассистент в IDE тормозит при «нормальных» токенах/с?
Часто виноваты длинное чтение промпта, большой контекст, повторная подача файлов и инструменты. Смотрите время до первого токена и полный сценарий, не только генерацию.
Что почитать дальше
Заключение
MoE не сделал видеокарту ненужной. MoE сделал большую системную память заметно ценнее. В домашнем локальном ИИ 2026 года удобная упрощённая формула звучит так:
RAM ≈ какие модели вам вообще доступны
VRAM ≈ насколько быстро вы их обрабатываете
Практическая стартовая точка для экспериментов со смесями экспертов для кода — 64 ГБ RAM + 16 ГБ VRAM, быстрая память и нормальный NVMe. Часто это интереснее, чем 32 ГБ оперативки при более жирной карте, если ваша цель — именно большие смеси экспертов, а не одна плотная модель целиком в VRAM.
Склад по-прежнему должен вмещать всех специалистов. Вопрос лишь в том, скольких вы готовы держать на полках — и насколько быстрый у вас верстак.



Комментарии