Зміст
Коротко
На Хабрі — виробничий розбір стенду LLM усередині периметра: відеокарта RTX PRO 6000 Blackwell на 96 GB, Qwen3-Coder-Next-FP8 (80B, суміш експертів), vLLM і шлюз LiteLLM для 25 підключених / 16 активних розробників. Головний висновок автора: на агентському навантаженні кеш префікса вирішує більше, ніж вибір моделі й розмір карти. Після явного --enable-prefix-caching частка влучань у кеш зросла з 0% до 96,9%, а затримка на повторному префіксі впала з 31,9 с до 0,24 с.
Що сталося
Команда пройшла п’ять конфігурацій: від щільної 30B без суміші експертів до 80B із сумішшю, потім додала розбивку токенів через LiteLLM і лише тоді увімкнула кеш для гібридної архітектури. До шлюзу була одна цифра «токенів витрачено» — з неї нічого не випливало. З розбивкою стало видно відношення вхід/вихід 452:1: середній крок агента тягне близько 124 тис. вхідних токенів і віддає ~274 на виході, причому майже весь вхід читається з кешу.
Економіка чесна: оренда 131 000 ₽/міс; за сирими токенами хмара часто дешевша; за посадковими місцями й лімітами підписок картина інша. Авторський висновок, якого не планували: свій вивід моделі беруть за периметр і доступність, а не за економію на токені. Стеля стенду — не швидкість генерації токенів, а розмір пулу ключ–значення (8–9 одночасних повних контекстів).
У тексті — робочі прапорці під Blackwell, три граблі (DeepGEMM на архітектурі sm120, явний прапорець кешу префікса, безглузде урізання --max-model-len) і експлуатаційні збої LiteLLM/nginx.
Чому це важливо
Бенчмарки міряють швидкість генерації — на такому навантаженні це частки відсотка трафіку. Команди, що «ставлять велику карту і сподіваються», місяцями платять тридцятикратну затримку, не бачачи рядка читання з кешу в статистиці. Для закритого контуру з кодом замовників порівняння «свій стенд vs підписка» треба вести за лімітами й аудитом, а не за прайсом за мільйон токенів.
На практиці
- Якщо суміш експертів / гібрид і немає рядка читання з кешу в статистиці — перевірте версію
vLLMі явний--enable-prefix-caching. - Рахуйте вартість закритого завдання і частку читання з кешу, а не лише швидкість генерації на виході.
- Звіряйте білінг шлюзу з лічильниками рушія: у автора 96,9% і 97,3% збіглися.
- Не скорочуйте
--max-model-len«щоб звільнити відеопам’ять», доки не виміряєте: у розборі це лише різало контекст. - Закладіть стелю по пулу ключ–значення і витіснення чужих префіксів зі зростанням числа активних користувачів.
Підсумок
На агентському кодингу всередині контуру перемагає не «найрозумніша модель на слайді», а кеш префікса, спостережуваність токенів і чесне порівняння з підписками. Стаття — рідкісний набір цифр і конфігів, який варто прочитати до купівлі наступної карти.

