Qwen3.8-Flash-Next: 1/9 학습 비용으로 더 강력한 성능, Qwen4 아키텍처 미리보기

Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency

Qwen3.8-Flash-Next: 1/9 학습 비용으로 더 강력한 성능, Qwen4 아키텍처 미리보기

Qwen 팀이 Qwen4 아키텍처의 초기 프리뷰인 Qwen3.8-Flash-Next의 가중치를 공개했습니다. 이 모델은 Gated DeltaNet(GDN)과 Qwen Sparse Attention(QSA)의 하이브리드 어텐션, 4개 브랜치의 Gated Residual, N-gram Embedding, 그리고 Muon 옵티마이저를 도입했습니다. 125B 파라미터(활성 6B)와 추가 51B N-gram 임베딩으로 구성되며, Qwen3.7-Plus 대비 학습 비용은 약 1/9로 줄었음에도 코딩 및 오피스 작업에서 더 뛰어난 성능을 보여줍니다. 기본 262K 토큰 컨텍스트를 지원하며, YaRN으로 1M 토큰까지 확장 가능합니다. API는 곧 제공될 예정이며, QwenCloud에서 0.16달러/백만 입력 토큰, 0.47달러/백만 출력 토큰에 서비스됩니다.

간단히 말해, GDN은 효율적으로 '기억'하고 QSA는 정확하게 '검색'합니다.

이 날의 다른 글

2026-08-26