Зміст
Коротко
Cerebras додала Qwen 3.8 27B (qwen-3.8-27b) на публічні кінцеві точки: близько 1500 токенів/с.
Контекст — 64k на безкоштовному тарифі та 128k на платному. У спільній видачі компанія обіцяє оригінальні, непроріджені ваги.
Дослідження REAP при цьому лишає на Hugging Face, поза продакшен-API. Для команд, що порівнюють хмарний вивід моделей, це одразу два сигнали.
Перший — про затримку відповіді й інтерактивність. Другий — про те, яка архітектура стоїть за ідентифікатором моделі, а не лише за маркетинговою назвою родини.
Що сталося
В огляді моделей у документації з виводу Cerebras поруч із GPT OSS 120B (~3000 токенів/с) з’явився рядок Qwen 3.8 27B.
У моделі 27 млрд параметрів і заявлена швидкість близько півтори тисячі токенів на секунду. Формат контексту той самий: безкоштовний і платний рівні з різними лімітами.
Моделі на публічних кінцевих точках доступні і в пробному режимі, і з оплатою за фактом використання — з лімітами й тарифами.
Для виділеної потужності та угод про рівень сервісу документація відсилає до окремих виділених кінцевих точок. Публічна полиця і «продакшен-контур» тут явно розведені.
Окремий розділ про стиснення відповідає на питання, яке часто ховають у маркетингу: що саме крутиться за кінцевою точкою.
Cerebras пише, що на публічних кінцевих точках не розміщує проріджені варіанти. Усі моделі в спільній видачі — оригінальні, без зміни архітектури.
Дослідження на кшталт REAP (прорідження експертів із вагами маршрутизатора) публікують на Hugging Face, але через спільний продакшен-API їх не віддають.
Це важливо для регресій: якщо ви зафіксували якість на qwen-3.8-27b, вас не повинно тихо «з’їхати» на урізаний знімок ваг із тим самим маркетинговим ім’ям.
Для зберігання ваг застосовують вибіркове квантування лише ваг: частину шарів — у 16/8/4 біт, чутливі — у повній точності з відновленням «на льоту».
Активації, увага та кеш ключів/значень лишаються без квантування. У розділі питань і відповідей компанія обіцяє не змінювати архітектуру без попередження.
Якщо з’являться проріджені варіанти, вони вийдуть окремими кінцевими точками з явними іменами — клієнт сам обере компроміс між розміром і якістю.
Чому це важливо
Для команд з LLM у чатах, агентах і конвеєрах генерації коду «тисячі токенів на секунду» змінюють відчуття продукту.
Менше очікування на довгих відповідях, простіші інтерактивні сценарії й пакетна обробка. На практиці це впливає і на вартість очікування користувача.
Окремий ефект — скільки паралельних сесій витримує один ключ доступу за тих самих лімітів. Але швидкість без прозорості стиснення небезпечна.
Прорідження змінює архітектуру. «Тиха» підміна ваг ламає відтворюваність порівняльних тестів і регресійних перевірок.
Позиція Cerebras прагматична: публічний API = непроріджений оригінал; експериментальні зрізи — на Hugging Face.
Квантування ваг під час зберігання відокремлюють від прорідження: пам’ять економлять, топологію на існуючих кінцевих точках обіцяють не чіпати.
Для інженера сигнал простий: читати не лише «токенів на секунду», а політику стиснення, ліміт контексту тарифу й точний Model ID.
Інакше легко сплутати картку Hugging Face і те, що реально відповідає в хмарі.
Окремо варто дивитися квоти пробного тарифу: «швидко на демо» і «стабільно під навантаженням» — різні режими однієї й тієї ж публічної полиці.
| Що дивитися | Публічні кінцеві точки | Дослідницькі зрізи |
|---|---|---|
| Архітектура | Оригінал, без прорідження | Можуть бути REAP та інші |
| Де взяти | Документація / API Cerebras |
Hugging Face |
| Контекст | 64k безкоштовно / 128k платно | Залежить від картки моделі |
| Швидкість (заявлено) | ~1500 токенів/с для Qwen 3.8 27B |
Не про продакшен-API |
На практиці
Перш ніж переносити прод на нову кінцеву точку, зафіксуйте контракт якості, а не лише ціну за токен.
Інакше виграш у швидкості обернеться сюрпризами на довгому контексті, жорстких JSON-схемах чи ланцюжках інструментів.
Має сенс заздалегідь вирішити, що для вас важливіше: максимальна швидкість, максимальна близькість до відкритого знімка ваг чи передбачуваний рівень сервісу.
Якщо порівнюєте з локальним запуском, окремо перевірте довгий контекст і сценарії з інструментами — саме там найчастіше спливає різниця між «карткою моделі» і хмарною видачею.
- Звірте
qwen-3.8-27bв документації: ліміти контексту (64k / 128k) і реальні квоти тарифу. - Проженіть свій набір регресій (інструкції, JSON-схеми, довгий контекст) — не покладайтеся лише на чужі таблиці швидкості.
- Не плутайте ваги з
Hugging Face(REAPта інші зрізи) з тим, що віддає продакшен-APICerebras. - Пам’ятайте: квантування ваг під час зберігання ≠ прорідження; для байт-у-байт збігу з локальним знімком уточніть формат видачі.
- Для угод про рівень сервісу і стабільної пропускної здатності дивіться виділені кінцеві точки.
Після пілоту зафіксуйте в тікеті точний Model ID, тариф і дату перевірки — інакше через місяць ніхто не згадає, на якому контурі ви ганяли регресії.
Публічна полиця зручна для пілота. Для продакшену з жорстким рівнем сервісу за затримкою й квотами частіше потрібен уже виділений контур.
Підсумок
Qwen 3.8 27B на Cerebras — швидкий публічний доступ до 27B-моделі з чесною розмовою про стиснення.
Оригінал в API, прорідження у дослідженнях, квантування ваг як компроміс щодо пам’яті.
Для продакшену важливі і ~1500 токенів/с, і розуміння, яка модель стоїть за кінцевою точкою — інакше бенчмарк «на папері» і поведінка в проді роз’їдуться.

