← Усі статті

Qwen 3.8 27B на Cerebras: ~1500 токенів/с

Qwen 3.8 27B на публічних кінцевих точках Cerebras: ~1500 токенів/с, контекст 64k/128k, без прорідження у проді.

Qwen 3.8 27B на Cerebras: ~1500 токенів/с
Зміст

Коротко

Cerebras додала Qwen 3.8 27B (qwen-3.8-27b) на публічні кінцеві точки: близько 1500 токенів/с.

Контекст — 64k на безкоштовному тарифі та 128k на платному. У спільній видачі компанія обіцяє оригінальні, непроріджені ваги.

Дослідження REAP при цьому лишає на Hugging Face, поза продакшен-API. Для команд, що порівнюють хмарний вивід моделей, це одразу два сигнали.

Перший — про затримку відповіді й інтерактивність. Другий — про те, яка архітектура стоїть за ідентифікатором моделі, а не лише за маркетинговою назвою родини.

Що сталося

В огляді моделей у документації з виводу Cerebras поруч із GPT OSS 120B (~3000 токенів/с) з’явився рядок Qwen 3.8 27B.

У моделі 27 млрд параметрів і заявлена швидкість близько півтори тисячі токенів на секунду. Формат контексту той самий: безкоштовний і платний рівні з різними лімітами.

Моделі на публічних кінцевих точках доступні і в пробному режимі, і з оплатою за фактом використання — з лімітами й тарифами.

Для виділеної потужності та угод про рівень сервісу документація відсилає до окремих виділених кінцевих точок. Публічна полиця і «продакшен-контур» тут явно розведені.

Окремий розділ про стиснення відповідає на питання, яке часто ховають у маркетингу: що саме крутиться за кінцевою точкою.

Cerebras пише, що на публічних кінцевих точках не розміщує проріджені варіанти. Усі моделі в спільній видачі — оригінальні, без зміни архітектури.

Дослідження на кшталт REAP (прорідження експертів із вагами маршрутизатора) публікують на Hugging Face, але через спільний продакшен-API їх не віддають.

Це важливо для регресій: якщо ви зафіксували якість на qwen-3.8-27b, вас не повинно тихо «з’їхати» на урізаний знімок ваг із тим самим маркетинговим ім’ям.

Для зберігання ваг застосовують вибіркове квантування лише ваг: частину шарів — у 16/8/4 біт, чутливі — у повній точності з відновленням «на льоту».

Активації, увага та кеш ключів/значень лишаються без квантування. У розділі питань і відповідей компанія обіцяє не змінювати архітектуру без попередження.

Якщо з’являться проріджені варіанти, вони вийдуть окремими кінцевими точками з явними іменами — клієнт сам обере компроміс між розміром і якістю.

Чому це важливо

Для команд з LLM у чатах, агентах і конвеєрах генерації коду «тисячі токенів на секунду» змінюють відчуття продукту.

Менше очікування на довгих відповідях, простіші інтерактивні сценарії й пакетна обробка. На практиці це впливає і на вартість очікування користувача.

Окремий ефект — скільки паралельних сесій витримує один ключ доступу за тих самих лімітів. Але швидкість без прозорості стиснення небезпечна.

Прорідження змінює архітектуру. «Тиха» підміна ваг ламає відтворюваність порівняльних тестів і регресійних перевірок.

Позиція Cerebras прагматична: публічний API = непроріджений оригінал; експериментальні зрізи — на Hugging Face.

Квантування ваг під час зберігання відокремлюють від прорідження: пам’ять економлять, топологію на існуючих кінцевих точках обіцяють не чіпати.

Для інженера сигнал простий: читати не лише «токенів на секунду», а політику стиснення, ліміт контексту тарифу й точний Model ID.

Інакше легко сплутати картку Hugging Face і те, що реально відповідає в хмарі.

Окремо варто дивитися квоти пробного тарифу: «швидко на демо» і «стабільно під навантаженням» — різні режими однієї й тієї ж публічної полиці.

Що дивитися Публічні кінцеві точки Дослідницькі зрізи
Архітектура Оригінал, без прорідження Можуть бути REAP та інші
Де взяти Документація / API Cerebras Hugging Face
Контекст 64k безкоштовно / 128k платно Залежить від картки моделі
Швидкість (заявлено) ~1500 токенів/с для Qwen 3.8 27B Не про продакшен-API

На практиці

Перш ніж переносити прод на нову кінцеву точку, зафіксуйте контракт якості, а не лише ціну за токен.

Інакше виграш у швидкості обернеться сюрпризами на довгому контексті, жорстких JSON-схемах чи ланцюжках інструментів.

Має сенс заздалегідь вирішити, що для вас важливіше: максимальна швидкість, максимальна близькість до відкритого знімка ваг чи передбачуваний рівень сервісу.

Якщо порівнюєте з локальним запуском, окремо перевірте довгий контекст і сценарії з інструментами — саме там найчастіше спливає різниця між «карткою моделі» і хмарною видачею.

  1. Звірте qwen-3.8-27b в документації: ліміти контексту (64k / 128k) і реальні квоти тарифу.
  2. Проженіть свій набір регресій (інструкції, JSON-схеми, довгий контекст) — не покладайтеся лише на чужі таблиці швидкості.
  3. Не плутайте ваги з Hugging Face (REAP та інші зрізи) з тим, що віддає продакшен-API Cerebras.
  4. Пам’ятайте: квантування ваг під час зберігання ≠ прорідження; для байт-у-байт збігу з локальним знімком уточніть формат видачі.
  5. Для угод про рівень сервісу і стабільної пропускної здатності дивіться виділені кінцеві точки.

Після пілоту зафіксуйте в тікеті точний Model ID, тариф і дату перевірки — інакше через місяць ніхто не згадає, на якому контурі ви ганяли регресії.

Публічна полиця зручна для пілота. Для продакшену з жорстким рівнем сервісу за затримкою й квотами частіше потрібен уже виділений контур.

Підсумок

Qwen 3.8 27B на Cerebras — швидкий публічний доступ до 27B-моделі з чесною розмовою про стиснення.

Оригінал в API, прорідження у дослідженнях, квантування ваг як компроміс щодо пам’яті.

Для продакшену важливі і ~1500 токенів/с, і розуміння, яка модель стоїть за кінцевою точкою — інакше бенчмарк «на папері» і поведінка в проді роз’їдуться.