← Усі статті

Свій інференс для 25 розробників: кеш префікса важливіший за модель

Стенд на vLLM і Blackwell: hit rate кешу 96,9%, відношення вхід/вихід 452:1 і чому свій контур беруть не заради економії.

Свій інференс для 25 розробників: кеш префікса важливіший за модель
Зміст

Коротко

На Хабрі — виробничий розбір стенду LLM усередині периметра: відеокарта RTX PRO 6000 Blackwell на 96 GB, Qwen3-Coder-Next-FP8 (80B, суміш експертів), vLLM і шлюз LiteLLM для 25 підключених / 16 активних розробників. Головний висновок автора: на агентському навантаженні кеш префікса вирішує більше, ніж вибір моделі й розмір карти. Після явного --enable-prefix-caching частка влучань у кеш зросла з 0% до 96,9%, а затримка на повторному префіксі впала з 31,9 с до 0,24 с.

Що сталося

Команда пройшла п’ять конфігурацій: від щільної 30B без суміші експертів до 80B із сумішшю, потім додала розбивку токенів через LiteLLM і лише тоді увімкнула кеш для гібридної архітектури. До шлюзу була одна цифра «токенів витрачено» — з неї нічого не випливало. З розбивкою стало видно відношення вхід/вихід 452:1: середній крок агента тягне близько 124 тис. вхідних токенів і віддає ~274 на виході, причому майже весь вхід читається з кешу.

Економіка чесна: оренда 131 000 ₽/міс; за сирими токенами хмара часто дешевша; за посадковими місцями й лімітами підписок картина інша. Авторський висновок, якого не планували: свій вивід моделі беруть за периметр і доступність, а не за економію на токені. Стеля стенду — не швидкість генерації токенів, а розмір пулу ключ–значення (8–9 одночасних повних контекстів).

У тексті — робочі прапорці під Blackwell, три граблі (DeepGEMM на архітектурі sm120, явний прапорець кешу префікса, безглузде урізання --max-model-len) і експлуатаційні збої LiteLLM/nginx.

Чому це важливо

Бенчмарки міряють швидкість генерації — на такому навантаженні це частки відсотка трафіку. Команди, що «ставлять велику карту і сподіваються», місяцями платять тридцятикратну затримку, не бачачи рядка читання з кешу в статистиці. Для закритого контуру з кодом замовників порівняння «свій стенд vs підписка» треба вести за лімітами й аудитом, а не за прайсом за мільйон токенів.

На практиці

  1. Якщо суміш експертів / гібрид і немає рядка читання з кешу в статистиці — перевірте версію vLLM і явний --enable-prefix-caching.
  2. Рахуйте вартість закритого завдання і частку читання з кешу, а не лише швидкість генерації на виході.
  3. Звіряйте білінг шлюзу з лічильниками рушія: у автора 96,9% і 97,3% збіглися.
  4. Не скорочуйте --max-model-len «щоб звільнити відеопам’ять», доки не виміряєте: у розборі це лише різало контекст.
  5. Закладіть стелю по пулу ключ–значення і витіснення чужих префіксів зі зростанням числа активних користувачів.

Підсумок

На агентському кодингу всередині контуру перемагає не «найрозумніша модель на слайді», а кеш префікса, спостережуваність токенів і чесне порівняння з підписками. Стаття — рідкісний набір цифр і конфігів, який варто прочитати до купівлі наступної карти.