← Все статьи

CMP 90HX для LLM: почему майнинговая карта тормозит и что даёт «six-seven»

MoE на CMP 90HX терпимо, dense — нет: карта ограничена по типам вычислений. Модификация драйвера через V67 даёт почти ×2, но не снимает все ограничения.

CMP 90HX для LLM: почему майнинговая карта тормозит и что даёт «six-seven»
Содержание

Коротко

Автор собрал сервер на CMP 90HX (майнинговые карты NVIDIA на Ampere) и ожидал быстрый инференс (вывод) LLM. Dense-модели оказались заметно медленнее прогноза; MoE — терпимее, потому что активирует не всю сеть на каждый токен. Причина глубже настроек llama.cpp: карта избирательно ограничена по вычислительным путям. Модификация драйвера (методика pearlfortune, цепочка V67) даёт прирост почти вдвое, но не превращает CMP в полноценную RTX.

Что произошло

CMP 90HX — линейка Crypto Mining Processor, не «RTX без видеовыхода». NVIDIA позиционировала её под Ethereum-класс нагрузки: высокая пропускная способность памяти, но не полная FP32 / INT8 / матричная производительность для универсальных задач.

На практике:

  • Dense-модель на каждый токен гоняет все слои — ограничения видны сразу.
  • MoE-модель активирует часть экспертов — проблема частично маскируется.
  • Два этапа inference ведут себя по-разному: prefill (обработка входа) и decode (генерация токенов). Prefill страдает сильнее, если ограничены матричные ускорители.

Автор воспроизвёл метод снятия ограничения: на раннем этапе загрузки GPU через внутренний Booter временно подменяется область подписи (pSignatureMemdesc) на подготовленный буфер V67. Это открывает маску FEAT_OVR_PLM, после чего драйвер записывает селекторы полного вычислительного режима (SS0, SS1). Карта перезапускается (FLR) и поднимается уже без «задушенных» путей.

Программные обходы (замена DP4A на IMAD, перенос части работы на HFMA2) ускоряют отдельные ядра, но не снимают корневую проблему — карта остаётся в ограниченном режиме для других программ.

Почему это важно

Дешёвые б/у CMP-карты соблазняют для домашнего LLM-кластера: много VRAM, низкая цена. Статья — жёсткое напоминание: архитектура ≠ пригодность. Майнинговая сегментация NVIDIA — не баг прошивки, а продуктовое решение.

Для инженеров полезна механика: почему prefill и decode надо мерить отдельно, почему MoE «обманывает» бенчмарк и почему патч драйвера — высокий риск (стабильность, обновления, гарантия, безопасность).

На практике

  1. Не покупайте CMP «для LLM» без чтения бенчмарков на dense-моделях вашего размера.
  2. Разделяйте метрики: prefill (время до первого токена) и decode (токенов/с).
  3. MoE может выглядеть «нормально» там, где dense уже неприемлем — не экстраполируйте.
  4. Модификация драйвера — эксперимент, не руководство; автор явно не даёт пошаговую инструкцию для продакшена.
  5. Для стабильного inference считайте RTX / data center GPU с нормальной поддержкой в CUDA-стеке.

Итог

CMP 90HX + LLM — история про неровную производительность и продуктовую сегментацию, а не про «дешёвые 10 ГБ VRAM». Метод six-seven / V67 показывает, что ограничение снимается на уровне прошивки и драйвера — и даёт реальный, но не магический прирост. Для большинства команд проще и безопаснее не воевать с майнинговой картой, а брать железо под inference изначально.