Qwen, 차세대 Qwen4 기반 'Qwen3.8-Flash-Next' 공개 예고, 125B MoE 모델
Qwen 3.8-Flash-Next releasing tomorrow (125B a6B)
Qwen이 차세대 Qwen4 아키텍처를 기반으로 한 멀티모달 MoE 모델 'Qwen3.8-Flash-Next'를 2026년 8월 26일 공개할 예정이다. 총 125B 파라미터에 활성 파라미터 6B로, FP8 버전도 함께 출시된다. 이번 조기 공개는 커뮤니티가 곧 출시될 Qwen4 모델 제품군에 대비할 수 있도록 하기 위한 것이다.
Qwen3.8-Flash-Next는 차세대 Qwen4 아키텍처를 기반으로 구축된 멀티모달 MoE 모델입니다.
HN 토론
164- SwellJoe
드디어 128GB Strix Halo나 GB10 기기를 살 이유가 생겼네요. 아니면 새 Mac Studio를 고려할 이유도요.
저는 Strix Halo와 데스크톱에 듀얼 32GB GPU를 갖고 있는데, 후자가 로컬 모델 실행에는 거의 항상 더 낫습니다. 메모리 대역폭이 더 높아서 훨씬 빠르거든요. 64GB에서 큰 컨텍스트로 충분히 돌아가는 Qwen 27B나 Gemma 31B보다 나은 모델이 그냥 없었습니다.
그리고 MoE라면 거의 쓸만한 속도로 돌아갈 겁니다.
- ddtaylor
저는 Qwen 모델을 매우 좋아하지만, OpenRouter로 그 위에 뭔가를 만드는 것은 고통스러웠습니다.
OpenRouter는 훌륭한 일을 많이 하고, 다양한 모델을 그렇게 쉽게 사용할 수 있다는 점이 정말 좋습니다. 공급자가 아직 제 요구에 맞고 가격이 훨씬 저렴한 구형 모델을 단계적으로 없앨 때도 좋죠. 정말 윈윈인 것 같습니다.
하지만 문제는 많은 Qwen 모델이 거의 용량이 없거나 너무 불안정해서 말 그대로 코드에 공급자 블랙리스트/화이트리스트를 잔뜩 넣어야 한다는 것입니다. OpenRouter가 이 문제를 해결하려는 시도가 있지만 효과가 없습니다. 사실 OpenRouter에는 문서화된 정말 멋진 것들이 많지만, 코드를 읽어보면 아직 구현되지 않았거나 실제로 거기에 없는 경우가 많아서 아쉽습니다.
OpenRouter에 이 문제로 연락을 시도했고 과거에 그들과 함께 일하는 데 관심이 있었지만, 적절한 사람에게 연락하기 어렵고 그들은 매우 빠르게 성장하고 있습니다. Stripe에 인수되면 어떤 면에서는 그 문제들이 가속화될 것 같습니다. 그들이 결국 이 모든 문제를 해결할 것이라고는 의심의 여지가 없고, 그렇게 빠르게 그렇게 많이 확장하는 것은 정말 어려운 일이므로 그들에게 박수를 보냅니다. 하지만 그 과정은 꽤 실망스러웠고 제 열정을 꺾었습니다.
- notnullorvoid
이것이 FreeToken과 같은 추론 엔진과 어떻게 교차할지 흥미로울 것입니다. FreeToken은 MoE 모델의 작업을 CPU/RAM과 GPU/VRAM에 분산하는 것을 개선합니다.
경쟁력 있는 모델을 로컬에서 좋은 속도로 실행하는 데 중고 3090과 약간의 DDR4만 있으면 된다면, 우리는 로컬 AI의 해를 맞이할지도 모릅니다.
- fcanesin
- syntaxing
정말 기대됩니다. 27B는 Strix Halo로 돌리기 벅차고, Laguna 2.1은 도구 호출에 대해 어리석은 짓을 할 수 있습니다.
- vegnus
저는 m1 max 64gb 맥북이 있습니다. 3.8 27b를 10 tok/s 이상으로 돌릴 방법이 있을까요, 아니면 그냥 포기해야 할까요? 3.6 a3b는 좋지만 그만큼 좋지는 않습니다.
- big-chungus4
"우리는 커뮤니티가 다가오는 Qwen4 모델의 전체 제품군을 준비할 수 있도록 이러한 아키텍처 개선 사항을 미리 공개합니다."
이 말은 "전체 제품군"에 4B와 같은 더 작은 모델도 포함될 것이라는 희망을 줍니다.
- Catloafdev
이것이 Deepseek v4 Flash와 어떻게 비교되는지 매우 궁금합니다. 만약 더 나쁘다면 그들이 이걸 출시하지 않았을 거라고 가정해야 합니다.