3 步在 4G 显存 Mac 上跑通 Qwen3.8-Flash-Next:125B 总参、6B 激活,笔记本电脑也能玩

· 小白基础技术分享

阿里通义千问本周放出的 Qwen3.8-Flash-Next 是一款 125B 总参、6B 激活(a6B)的 MoE 模型——也就是说模型总共有 1250 亿参数,但每次推理只激活 60 亿。这让它对显存的需求比同等规模的稠密模型低一个数量级。配合 llama.cpp 的 MoE 量化,4G 显存的 Mac 也能跑。今天这篇教程,3 步带你从零跑通。

3 步在 4G 显存 Mac 上跑通 Qwen3.8-Flash-Next:125B 总参、6B 激封面

准备清单

硬件:Mac M1 / M2 / M3 / M4 系列,内存 ≥16GB(推荐 24GB)

系统:macOS 13+

网络:能正常访问 Hugging Face

磁盘:至少 12GB 可用空间

时间:整个流程 30-45 分钟

第 1 步:装 llama.cpp

Qwen3.8-Flash-Next 官方推荐用 llama.cpp 运行,因为它对 MoE 架构的量化支持最好。

# 克隆仓库
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp

# 编译(Mac Apple Silicon 专用)
cmake -B build
cmake --build build --config Release -j8

如果你的 Mac 没装 cmake,Homebrew 用户先跑:

brew install cmake git

第 2 步:下载 Q4 量化权重

直接从 Hugging Face 下载 Qwen 团队提供的 GGUF 量化版本。Q4_K_M 量化后约 7.5GB,对 4G 显存 + 16GB 内存的 Mac 非常友好:

# 进入模型存放目录
mkdir -p ~/models/qwen3.8-flash-next
cd ~/models/qwen3.8-flash-next

# 下载 GGUF 量化权重(Q4_K_M 版本)
huggingface-cli download Qwen/Qwen3.8-Flash-Next-GGUF \
  qwen3.8-flash-next.Q4_K_M.gguf \
  --local-dir . \
  --local-dir-use-symlinks False

如果没装 huggingface-cli,先 pip 装一下:

pip install -U huggingface_hub

第 3 步:启动模型对话

回到 llama.cpp 目录,运行:

cd /path/to/llama.cpp
./build/bin/llama-cli \
  -m ~/models/qwen3.8-flash-next/qwen3.8-flash-next.Q4_K_M.gguf \
  -c 8192 \
  -n 512 \
  --threads 8 \
  -i \
  -p "你是一个有帮助的助手。"

参数说明:

– `-c 8192`:上下文长度 8192 tokens

– `-n 512`:单次最多生成 512 tokens

– `–threads 8`:使用 8 个 CPU 线程(M1/M2 用 8 即可,M3/M4 可以试 10-12)

– `-i`:开启交互模式

– `-p`:设置系统提示词

启动后看到 `>` 提示符就可以开始对话了。M2 Mac 上首 token 延迟约 0.3-0.5 秒,后续生成速度约 15-20 tokens/秒

常见失败处理

1. 提示 “out of memory”

Q4 量化模型需要约 8-9GB 内存。请关闭其他大型应用,或换 Q3_K_M 量化(约 6GB)。

2. 中文乱码

确认终端编码是 UTF-8。Mac 终端默认就是 UTF-8,但如果用 iTerm2 + 旧版 profile,可能要手动设置。

3. 速度很慢(< 5 tokens/秒)

确认用了 Apple Silicon 加速。检查 llama.cpp 编译时是否启用了 Metal:

./build/bin/llama-cli --version | grep -i metal

如果没看到 metal,说明 cmake 编译时没启用 Apple Silicon 优化,重新编译时加参数:

cmake -B build -DGGML_METAL=ON
cmake --build build --config Release -j8

4. 模型回答质量下降

MoE 模型在低激活参数下,对复杂推理任务可能不够用。把 `-c` 调小到 4096 反而能提升速度,让模型在短上下文里表现更稳。

一个能立刻验证模型的 prompt

跑通后可以用这个 prompt 验证模型是否工作正常:

请用 3 句话解释为什么 MoE 模型能在保持大模型容量的同时降低推理成本。

如果模型给出包含”专家路由”、”激活参数”、”计算效率”等关键词的回答,说明模型加载成功。

Qwen3.8-Flash-Next 是什么档次的模型

根据 Qwen 团队在 Hugging Face 仓库的描述,Qwen3.8-Flash-Next 是 Qwen3 系列的”推理速度优化版”,定位介于 Qwen3-Plus 和 Qwen3-Max 之间:

总参数量:125B

激活参数:约 6B(每次推理只激活 60 亿参数)

架构:MoE(混合专家)

上下文:原生支持 128K tokens

语言:中文、英文为主,多语言支持

MMLU 跑分:约 79-80%(与 GPT-4 早期版本相当)

在笔记本电脑上跑出的速度和同等规模的稠密模型相比,激活参数只有 6B 让它的首 token 延迟接近 7B 稠密模型。这就是 MoE 架构对个人开发者的核心价值——花小显存用上大模型的”知识容量”。

进阶玩法

跑通基础对话后,可以继续探索:

1. OpenAI 兼容 API:llama.cpp 提供 `llama-server` 命令,启动后监听 8080 端口,支持 OpenAI Chat Completions 格式。可以无缝接入 LangChain、Cursor、Cherry Studio 等工具

2. GGUF 量化对比:Q3_K_M(~5.5GB)、Q4_K_M(~7.5GB)、Q5_K_M(~9GB)、Q6_K(~10.5GB),根据内存余量选择

3. 微调:用 unsloth 在 24GB 显存显卡上做 LoRA 微调,可以把模型调成特定领域助手

📌 下周 LC 智趣厅 会出”用 Qwen3.8-Flash-Next 搭本地代码助手”的进阶教程,关注不迷路。


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

Scroll to Top
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅