Зміст
Коротко
Автор зібрав сервер на CMP 90HX (майнінгові карти NVIDIA на Ampere) і очікував швидкий інференс (вивід) LLM. Dense-моделі виявилися помітно повільнішими за прогноз; MoE — терпиміше, бо активує не всю мережу на кожен токен. Причина глибша за налаштування llama.cpp: карта вибірково обмежена за обчислювальними шляхами. Модифікація драйвера (методика pearlfortune, ланцюжок V67) дає приріст майже удвічі, але не перетворює CMP на повноцінну RTX.
Що сталося
CMP 90HX — лінійка Crypto Mining Processor, не «RTX без відеовиходу». NVIDIA позиціонувала її під Ethereum-клас навантажень: висока пропускна здатність пам'яті, але не повна FP32 / INT8 / матрична продуктивність для універсальних задач.
На практиці:
- Dense-модель на кожен токен ганяє всі шари — обмеження видно одразу.
- MoE-модель активує частину експертів — проблема частково маскується.
- Два етапи inference поводяться по-різному: prefill (обробка входу) і decode (генерація токенів). Prefill страждає сильніше, якщо обмежені матричні прискорювачі.
Автор відтворив метод зняття обмеження: на ранньому етапі завантаження GPU через внутрішній Booter тимчасово підміняється область підпису (pSignatureMemdesc) на підготовлений буфер V67. Це відкриває маску FEAT_OVR_PLM, після чого драйвер записує селектори повного обчислювального режиму (SS0, SS1). Карта перезапускається (FLR) і піднімається вже без «задушених» шляхів.
Програмні обходи (заміна DP4A на IMAD, перенесення частини роботи на HFMA2) прискорюють окремі ядра, але не знімають кореневу проблему — карта лишається в обмеженому режимі для інших програм.
Чому це важливо
Дешеві б/в CMP-карти спокушають для домашнього LLM-кластера: багато VRAM, низька ціна. Стаття — жорстке нагадування: архітектура ≠ придатність. Майнінгова сегментація NVIDIA — не баг прошивки, а продуктове рішення.
Для інженерів корисна механіка: чому prefill і decode треба міряти окремо, чому MoE «обманює» бенчмарк і чому патч драйвера — високий ризик (стабільність, оновлення, гарантія, безпека).
На практиці
- Не купуйте CMP «для LLM» без читання бенчмарків на dense-моделях вашого розміру.
- Розділяйте метрики: prefill (час до першого токена) і decode (токенів/с).
- MoE може виглядати «нормально» там, де dense уже неприйнятний — не екстраполюйте.
- Модифікація драйвера — експеримент, не керівництво; автор явно не дає покрокову інструкцію для продакшену.
- Для стабільного inference рахуйте RTX / data center GPU з нормальною підтримкою в CUDA-стеку.
Підсумок
CMP 90HX + LLM — історія про нерівну продуктивність і продуктову сегментацію, а не про «дешеві 10 ГБ VRAM». Метод six-seven / V67 показує, що обмеження знімається на рівні прошивки й драйвера — і дає реальний, але не магічний приріст. Для більшості команд простіше й безпечніше не воювати з майнінговою картою, а брати залізо під inference спочатку.

