Qwen 团队刚开源 180B 级 Qwen3.8-Flash-Next:Qwen4 架构的抢先预览,单卡 DGX Spark 就能跑
阿里 Qwen 团队 8-26 正式开源了 Qwen3.8-Flash-Next——一款定位为「Qwen4 架构预览」的多模态 MoE 模型,主模型 125B 参数 + 51B N-gram 嵌入表,每个 token 激活 6B 参数。这是 2026 年开源大模型里硬件门槛最低的 100B+ 级别模型之一,本文把官方仓库(HuggingFace / ModelScope 都已同步)的硬性事实拆给你看。
三个你必须先知道的硬数据
– 总参数量:125B 主模型 + 51B N-gram 嵌入 = 176B(不是 180B,官方表述是 125B + 51B)。单 token 激活 6B。
– 硬件门槛:单卡 NVIDIA DGX Spark(128GB VRAM)+ NVFP4 量化。普通消费级显卡(4090 / 5090 / Mac M 系列)跑不了主模型——硬约束,不是优化建议。
– 官方发布日期:2026-08-26 今日(仓库 README News 字段确认)。
四个架构创新(区别于 Qwen3 系列)
Qwen 团队把 Qwen3-Next 的设计「正式」推进到 Qwen3.8 系列:
1. GDN + QSA 混合注意力:Gated DeltaNet 压缩历史 + Qwen Sparse Attention 用轻量索引器在微块粒度选重要 context,长序列 attention 成本显著降低。
2. Gated Residual(GR):残差流扩展到 4 个分支,由动态门控读写,强化跨层信息流和训练稳定性。
3. N-gram Embedding:用局部上下文查表,把模型容量做大的同时计算量增加极少;嵌入表可卸载到 host memory 异步预取。
4. Muon 优化器:围绕正交化精度、Muon/AdamW 分工、融合参数拆分重新调整 scaling law。
训练成本只有 Qwen3.7-Plus 的约 1/9,但代码和办公任务能力更强(官方 benchmark 在 blog 里有)。
部署成本真实清单
| 部署方案 | 硬件 | 速度参考 | 来源 |
|—|—|—|—|
| 单卡 DGX Spark + NVFP4 | 128GB VRAM | 180-226 tok/s | SSHdotCodes 部署 repo |
| 2× DGX Spark + SGLang TP2 + NVFP4 | 256GB 总 VRAM | Day-0 production | tonyd2wild 官方部署 |
| 2× DGX Spark + vLLM + MTP spec decode | 256GB 总 VRAM | MTP 推测解码 | OsakaTX 部署 |
| 16GB VRAM(UD-IQ1_S 极端量化) | 实验性 | 不可生产 | hocestnonsatis 极客实验 |
重点说一遍:社区里有过 16GB 跑起来的极端 case,但那是用 llama.cpp 量化到 1-bit、丢失大量精度、跑出 demo 而已。如果你的目标是生产推理,至少 128GB 单卡。
该跟进的 3 个真实信号
1. NVFP4 量化是否成熟:NVFP4 是 NVIDIA 在 2026 上半年推的新格式,需要 Blackwell + CUDA 13+ 完整支持。早期部署 repo 普遍提到”GB10 lockup””QS 模式调整”等稳定性问题——生产环境别急上。
2. Qwen4 正式版的预热:Qwen 团队明确说这是”Qwen4 架构预览”。如果 Qwen4 在 2026 Q4 推出,Qwen3.8-Flash-Next 的推理栈、量化方案、benchmark 都将是 Qwen4 的事实标准。提前用熟它就是提前布局。
3. API 价格:QwenCloud 已经支持 OpenAI / Anthropic 兼容 API,对中文场景和大上下文需求,单价大概率比 GPT-5.6 / Claude 4 便宜一个数量级——值得纳入生产候选。
怎么用最划算
– 普通开发者:直接调 QwenCloud API 或 QwenWork(阿里新出的 AI 办公平台)。本地 4G/8G/24G 显卡就别折腾 176B 模型,浪费时间。
– 有 DGX Spark 资源的研究团队:用 SGLang + NVFP4 起服务,跟上 Qwen4 生态。
– 预算有限的中小团队:等 1-2 个月社区出 4-bit 量化 + 单卡 A100 / H100 兼容版(一定会有),不要现在追 128GB 单卡。
一句话结论
Qwen3.8-Flash-Next 是 2026 年开源大模型的「Qwen4 试金石」,架构信号 + 训练效率信号比模型本身更重要。别被「180B 跑单卡」标题党忽悠——NVFP4 + 128GB 是硬门槛。普通用户用 API 就好,本地跑等社区后续量化。
🔥 关注LC智趣厅
👇 关注不错过
— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn