Qwen 3.8 27B, Cerebras에서 초당 1500토큰으로 실행

Qwen 3.8 27B available on Cerebras at 1500 tokens/s

Cerebras Inference가 공개 엔드포인트에서 Qwen 3.8 27B 모델을 초당 약 1500토큰의 속도로 제공합니다. 이 모델은 270억 개의 파라미터를 가지며, 무료 및 종량제 티어에서 사용할 수 있습니다. Cerebras는 공개 모델의 무결성을 강조하며, 모든 모델이 프루닝되지 않은 원본 버전임을 밝힙니다. 가중치 저장 시 선택적 양자화를 적용하지만, 품질에 민감한 레이어는 전체 정밀도로 유지하고 활성화, 어텐션, KV 캐시는 완전한 정밀도로 처리합니다. 프루닝 연구 모델(REAP)은 Hugging Face에서만 제공됩니다.

우리는 모든 공개 모델이 프루닝되지 않은 원본 버전임을 보장합니다.
  1. nostrebored

    공개 엔드포인트의 150k TPM 제한은 많은 코딩 작업에 사실상 사용할 수 없음을 의미합니다. 과거에 Cerebras를 시도했을 때, 우리의 문제는 항상 속도 제한이었습니다. 우리는 전용을 처리하지 않고 더 유연한 속도 풀에 접근할 수 있기를 원합니다.

    시도조차 해보면, 우리 계정이 청구 정보를 추가할 수 없는 어떤 림보 상태로 이동된 것 같습니다.

    ```

    Billing access restricted

    Self-serve billing is not available on Enterprise accounts. Please contact your team for further questions.

    ```

    우리에게는 팀이 없습니다(그들은 속도 제한에 대해 이야기한 후 우리 Slack 채널에서 스스로를 제거했습니다). 당혹스럽게도, 이 중 어느 것도 요청에 나타나지 않으며, 요청은 다음을 반환합니다:

    ```

    {"message":"Model does not exist or you do not have access to it.","type":"not_found_error","param":"model","code":"model_not_found"}

    ```

    실제 오류는 청구에 관한 것인데도 말이죠.

    저는 항상 Cerebras를 좋아하고 싶지만, 토큰을 넣고 빼는 소비자로서 당신은 전혀 가치 있게 여겨지지 않는다는 느낌을 받습니다.

  2. gpugreg

    이것이 프로그래밍에 좋은지 궁금했지만, 너무 빨라서 오히려 문제입니다. 분당 450,000 토큰 제한이 있습니다. 저는 약 90초 만에 이 제한에 도달했고 그 과정에서 $1.10을 태웠습니다. 캐시된 토큰이 토큰 제한에 포함되기 때문입니다.

    비교를 위해, 저는 동일한 작업을 DeepSeek-V4-Flash로 실행했는데, 172초 만에 완료되었고 최종 컨텍스트 창 크기가 55217 토큰으로 $0.024가 들었습니다. 반면 Qwen3.8-27B는 64178 컨텍스트 창으로 완료조차 되지 않았습니다.

    이것은 돈을 태우는 매우 효율적인 방법이지만, 프로그래밍에는 추천하지 않습니다.

    긍정적인 면으로, $5 가입 보너스를 받았기 때문에 제 돈은 아니었습니다.

  3. jasongill

    그들이 이 모델의 추론 용량을 OpenRouter를 통해 제공한다면 좋을 텐데요; 현재 OpenRouter에서 가장 빠른 제공자는 약 80tps입니다 https://openrouter.ai/qwen/qwen3.8-27b#providers

    그들은 OpenRouter에 다른 모델들을 호스팅하는 것 같으니 Qwen3.8도 곧 거기에 있을지도 모릅니다: https://openrouter.ai/provider/cerebras

  4. pllbnk

    며칠 전에 ninfer(https://github.com/Neroued/ninfer)에 대해 알게 되었는데, RTX 5090에서 이제 약 200 tok/s를 얻을 수 있고 동시 요청 시 400 tok/s 이상을 얻을 수 있습니다. 이 정도 강도의 로컬 모델에게는 충분히 빠릅니다.

  5. hexa00

    기존 코드베이스에서 중간 규모의 코딩/디버깅 문제로 방금 시도해 보았습니다. 관찰 결과:

    - 입력은 다른 모델보다 빠르지 않아 보입니다. 읽는 데 많은 시간을 소비합니다.

    약 5M 토큰을 읽었습니다.

    - 출력은 훌륭합니다. 1500t/sec에서 기대하는 대로 매우 빠릅니다. 정확하다고 생각합니다.

    - 도구 호출은 DS4보다 더 자주 실패합니다. 이로 인해 재시도에 시간이 낭비됩니다(예: 브라우저 제어와 같은 복잡한 도구).

    - 셸 명령은 여전히 다소 병목 현상입니다.

    순 효과는 기다리는 시간이 거의 같고 여전히 그 출력을 읽어야 한다는 것입니다. 따라서 적어도 코딩의 경우, DS4 등에서 얻을 수 있는 100-200t/sec와 실제로 타협하게 됩니다. 아마도 그것이 좋은 최적점일 수 있으며 더 빠른 t/sec가 병목이 아닐 수 있습니다.

    또한 제 설정(OMP)이 캐시를 올바르게 수행하지 않을 수도 있지만, 그것은 엄청난 비용 요인입니다... 그래서 현재는 꽤 비쌉니다.

  6. karim79

    토큰은 지구상에서 가장 새롭고 훌륭한 말도 안 되는 것입니다. 재미있네요. 1-2년 후의 세상과 오늘을 돌아보는 우스꽝스러움을 기대합니다.

  7. gardnr

    저는 그들의 Coding Plan을 몇 달 동안 사용했습니다. 모델을 따라잡는 것이 정말 어렵습니다. 출력이 너무 빠릅니다. Qwen 3.8 27B는 그들이 지금까지 호스팅한 모델 중 가장 강력한 모델 중 하나일 것입니다.

    편집: 이것은 API 토큰 가격으로만 제공되는 것 같습니다. 프롬프트 캐싱을 도입했는지 아는 사람 있나요? 프롬프트 캐싱 없이는 에이전트 코딩 작업에 꽤 비쌌습니다.

  8. tacone

    그들이 OpenRouter에 있다는 것을 알아차렸지만 Qwen 3.8은 아직 없습니다. 곧 거기에 있기를 바랍니다.

    아직 알아차리지 못한 사람들을 위해, 그들이 Qwen에 허용하는 컨텍스트 크기는 128k에 불과합니다. 전문화된 하위 에이전트로는 여전히 흥미롭지만 긴 작업에는 적합하지 않습니다.

이 날의 다른 글

2026-09-03