← Все статьи

Qwen 3.8 27B на Cerebras: ~1500 токенов/с

Qwen 3.8 27B на публичных конечных точках Cerebras: ~1500 токенов/с, 64k/128k контекст, без прореживания в проде.

Qwen 3.8 27B на Cerebras: ~1500 токенов/с
Содержание

Коротко

Cerebras добавила Qwen 3.8 27B (qwen-3.8-27b) на публичные конечные точки: около 1500 токенов/с.

Контекст — 64k на бесплатном тарифе и 128k на платном. В общей выдаче компания обещает оригинальные, непрореженные веса.

Исследование REAP при этом оставляет на Hugging Face, вне продакшен-API. Для команд, которые сравнивают облачный вывод моделей, это сразу два сигнала.

Первый — про задержку ответа и интерактивность. Второй — про то, какая архитектура стоит за идентификатором модели, а не только за маркетинговым названием семейства.

Что произошло

В обзоре моделей в документации по выводу Cerebras рядом с GPT OSS 120B (~3000 токенов/с) появилась строка Qwen 3.8 27B.

У модели 27 млрд параметров и заявленная скорость около полутора тысяч токенов в секунду. Формат контекста тот же: бесплатный и платный уровни с разными лимитами.

Модели на публичных конечных точках доступны и в пробном режиме, и с оплатой по факту использования — с лимитами и тарифами.

Для выделенной мощности и соглашений об уровне сервиса документация отсылает к отдельным выделенным конечным точкам. Публичная полка и «продакшен-контур» здесь явно разведены.

Отдельный раздел про сжатие отвечает на вопрос, который часто прячут в маркетинге: что именно крутится за конечной точкой.

Cerebras пишет, что на публичных конечных точках не размещает прореженные варианты. Все модели в общей выдаче — оригинальные, без изменения архитектуры.

Исследования вроде REAP (прореживание экспертов с весами маршрутизатора) публикуют на Hugging Face, но через общий продакшен-API их не отдают.

Это важно для регрессий: если вы зафиксировали качество на qwen-3.8-27b, вас не должно тихо «съехать» на урезанный снимок весов с тем же маркетинговым именем.

Для хранения весов применяют выборочное квантование только весов: часть слоёв — в 16/8/4 бит, чувствительные — в полной точности с восстановлением «на лету».

Активации, внимание и кэш ключей/значений остаются без квантования. В разделе вопросов и ответов компания обещает не менять архитектуру без предупреждения.

Если появятся прореженные варианты, они выйдут отдельными конечными точками с явными именами — клиент сам выберет компромисс между размером и качеством.

Почему это важно

Для команд с LLM в чатах, агентах и конвейерах генерации кода «тысячи токенов в секунду» меняют ощущение продукта.

Меньше ожидания на длинных ответах, проще интерактивные сценарии и пакетная обработка. На практике это влияет и на стоимость ожидания пользователя.

Отдельный эффект — сколько параллельных сессий выдерживает один ключ доступа при тех же лимитах. Но скорость без прозрачности сжатия опасна.

Прореживание меняет архитектуру. «Тихая» подмена весов ломает воспроизводимость сравнительных тестов и регрессионных проверок.

Позиция Cerebras прагматична: публичный API = непрореженный оригинал; экспериментальные срезы — на Hugging Face.

Квантование весов при хранении отделяют от прореживания: память экономят, топологию на существующих конечных точках обещают не трогать.

Для инженера сигнал простой: читать не только «токенов в секунду», а политику сжатия, лимит контекста тарифа и точный Model ID.

Иначе легко перепутать карточку Hugging Face и то, что реально отвечает в облаке.

Отдельно стоит смотреть квоты пробного тарифа: «быстро на демо» и «стабильно под нагрузкой» — разные режимы одной и той же публичной полки.

Что смотреть Публичные конечные точки Исследовательские срезы
Архитектура Оригинал, без прореживания Могут быть REAP и другие
Где взять Документация / API Cerebras Hugging Face
Контекст 64k бесплатно / 128k платно Зависит от карточки модели
Скорость (заявлено) ~1500 токенов/с для Qwen 3.8 27B Не про продакшен-API

На практике

Прежде чем переносить прод на новую конечную точку, зафиксируйте контракт качества, а не только цену за токен.

Иначе выигрыш в скорости обернётся сюрпризами на длинном контексте, жёстких JSON-схемах или цепочках инструментов.

Имеет смысл заранее решить, что для вас важнее: максимальная скорость, максимальная близость к открытому снимку весов или предсказуемый уровень сервиса.

Если сравниваете с локальным запуском, отдельно проверьте длинный контекст и сценарии с инструментами — именно там чаще всего всплывает разница между «карточкой модели» и облачной выдачей.

  1. Сверьте qwen-3.8-27b в документации: лимиты контекста (64k / 128k) и реальные квоты тарифа.
  2. Прогоните свой набор регрессий (инструкции, JSON-схемы, длинный контекст) — не полагайтесь только на чужие таблицы скорости.
  3. Не путайте веса с Hugging Face (REAP и прочие срезы) с тем, что отдаёт продакшен-API Cerebras.
  4. Помните: квантование весов при хранении ≠ прореживание; для байт-в-байт совпадения с локальным снимком уточните формат выдачи.
  5. Для соглашений об уровне сервиса и стабильной пропускной способности смотрите выделенные конечные точки.

После пилота зафиксируйте в тикете точный Model ID, тариф и дату проверки — иначе через месяц никто не вспомнит, на каком контуре вы гоняли регрессии.

Публичная полка удобна для пилота. Для продакшена с жёсткими требованиями к задержке и квотам чаще нужен уже выделенный контур.

Итог

Qwen 3.8 27B на Cerebras — быстрый публичный доступ к 27B-модели с честным разговором про сжатие.

Оригинал в API, прореживание в исследованиях, квантование весов как компромисс по памяти.

Для продакшена важны и ~1500 токенов/с, и понимание, какая модель стоит за конечной точкой — иначе бенчмарк «на бумаге» и поведение в проде разъедутся.