Qwen 3.8 27B на Cerebras: 1500 токенов в секунду

Qwen 3.8 27B available on Cerebras at 1500 tokens/s

Cerebras добавил модель Qwen 3.8 27B в свой публичный каталог, обеспечивая скорость около 1500 токенов в секунду. Модель доступна на бесплатном пробном и тарифе с оплатой по мере использования, с контекстом 64k/128k токенов. Cerebras подчеркивает, что все публичные модели не подвергаются прунингу и используют выборочную квантизацию весов для сохранения качества. Также компания делится результатами исследований по прунингу (REAP), но эти модели доступны только на Hugging Face.

Все наши публичные модели не подвергаются прунингу.
  1. nostrebored

    Лимит 150k токенов в минуту на публичном эндпоинте означает, что для многих задач программирования он, скорее всего, непригоден. Когда мы пробовали Cerebras в прошлом, нашей проблемой всегда были тарифы. Мы бы хотели не иметь дела с выделенными ресурсами и получить доступ к более гибкому пулу тарифов.

    Даже при попытке опробовать его, похоже, что наш аккаунт переместили в какое-то подвешенное состояние, где мы больше не можем добавить платежную информацию.

    ```

    Доступ к биллингу ограничен

    Самообслуживание при оплате недоступно для корпоративных аккаунтов. Пожалуйста, свяжитесь с вашей командой для дальнейших вопросов.

    ```

    У нас нет команды (они сами удалились из нашего Slack-канала после того, как мы заговорили о лимитах). Что озадачивает, так это то, что ничего из этого даже не отображается в запросе, который возвращает:

    ```

    {"message":"Model does not exist or you do not have access to it.","type":"not_found_error","param":"model","code":"model_not_found"}

    ```

    Когда на самом деле проблема в биллинге.

    Мне всегда хочется любить Cerebras, но у меня складывается впечатление, что как потребитель токенов на входе и выходе ты вообще не ценишься.

  2. gpugreg

    Мне было интересно, годится ли это для программирования, но он слишком быстр для собственного блага. Есть лимит 450 000 токенов в минуту. Я достиг этого лимита примерно за 90 секунд и сжег при этом 1,10 доллара. Это потому, что кэшированные токены учитываются в лимите токенов.

    Для сравнения, я запустил ту же задачу с DeepSeek-V4-Flash, который завершился за 172 секунды и стоил 0,024 доллара при итоговом размере контекста 55 217 токенов, в то время как Qwen3.8-27B даже близко не был к завершению с контекстом 64 178 токенов.

    Это очень эффективный способ сжигать деньги, но я бы не рекомендовал его для программирования.

    С положительной стороны, я получил бонус в 5 долларов за регистрацию, так что это были не мои собственные деньги.

  3. jasongill

    Было бы здорово, если бы они предоставили свои вычислительные мощности для этой модели через OpenRouter; самый быстрый провайдер на OpenRouter сейчас работает на скорости около 80 токенов/с https://openrouter.ai/qwen/qwen3.8-27b#providers

    Похоже, они размещают другие модели на OpenRouter, так что, возможно, Qwen3.8 скоро там появится: https://openrouter.ai/provider/cerebras

  4. pllbnk

    Всего пару дней назад я узнал о ninfer (https://github.com/Neroued/ninfer) и на RTX 5090 теперь могу получить около 200 токенов/с и более 400 токенов/с при параллельных запросах, что достаточно быстро для локальной модели такой мощности.

  5. hexa00

    Просто попробовал это на задаче среднего размера по кодингу/отладке в существующей кодовой базе, наблюдения:

    - Ввод не выглядит быстрее, чем у других моделей, он тратит много времени на чтение

    Прочитал около 5M токенов

    - Вывод потрясающий, супер быстрый, как и ожидаешь от 1500 токенов/с, думаю, это верно

    - Вызовы инструментов сбоят чаще, чем, скажем, у DS4, что приводит к потере времени на повторные попытки (например, сложные инструменты, такие как управление браузером)

    - Команды оболочки по-прежнему остаются узким местом

    В итоге я трачу примерно столько же времени на ожидание, и мне всё равно нужно читать этот вывод, так что, по крайней мере для кодинга, это на самом деле примиряет меня со скоростью 100-200 токенов/с, которую можно получить на DS4 или подобных. Может, это и есть оптимальная точка, и более высокая скорость токенов/с — не там, где находится узкое место.

    Также, возможно, моя настройка (OMP) не выполняет кэширование правильно, но это огромный фактор затрат... так что сейчас это довольно дорого.

  6. karim79

    Токены — это новейшая и величайшая бессмысленная хрень на планете. Это забавно. Не могу дождаться, чтобы увидеть мир через 1-2 года и посмеяться, оглядываясь на этот день.

  7. gardnr

    Я пользовался их тарифным планом для программирования несколько месяцев. Действительно трудно успевать за моделями. Вывод настолько быстрый. Qwen 3.8 27B, вероятно, одна из самых мощных моделей, которые они размещали на данный момент.

    Примечание: похоже, это доступно только по тарифам API с оплатой за токены. Кто-нибудь знает, внедрили ли они уже кэширование промптов? Раньше это становилось довольно дорогим для агентных задач кодинга без кэширования промптов.

  8. tacone

    Заметил, что они присутствуют на OpenRouter, но Qwen 3.8 там пока нет. Надеюсь, скоро появится.

    Для тех, кто еще не заметил, размер контекста, который они допускают для Qwen, составляет всего 128k. Всё еще интересно как специализированный субагент, но не очень подходит для длинных задач.

Ещё за этот день

2026-09-03