在家跑AI烧不起钱?双卡混搭80 tok/s实战指北

· 科技资讯

你真需要每月花200美元订阅AI吗?

当Codex月费涨到 100美元,Claude订阅不断加价,你有没有想过一个问题——这些钱到底是在买AI服务,还是在给云厂商交”算力房租”?

在家跑AI烧不起钱?双卡混搭80 tok/s实战指北封面

最近Hacker News上两条帖子火得不行:一条是[「AI Coding at Home Without Going Broke」](https://news.ycombinator.com/item?id=48518969)(216分/197条评论),另一条是[「RTX 5080 + RTX 3090 Setup: 80 Tok/s on Qwen 3.6 27B Q8」](https://news.ycombinator.com/item?id=48515454)(181分/62条评论)。两条帖子的核心指向同一件事:在家自建AI推理环境,不但可行,而且比你想象的便宜得多

双卡混搭的魔法:80 tok/s是怎么跑出来的

最让人眼前一亮的实战案例来自开发者 iMil。他搞了一套令人拍案叫绝的组合:一块 RTX 5080(16GB) 配上一块二手RTX 3090(24GB),跑 Qwen 3.6 27B Q8量化版,推理速度直接飙到 80-91 tok/s

这个速度什么概念?作为对比,HN上有网友用一块 4090加两块Tenstorrent p150卡,同样跑Qwen 3.6 27B,只有30 tok/s。iMil这套方案快了近三倍。

关键配置细节如下:

### 硬件准备

| 组件 | 规格 | 说明 |

|——|——|——|

| 主板 | 华硕 Prime X570-Pro | 支持PCIe x16拆分为双x8,这是双卡的关键 |

| GPU 1 | RTX 3090 24GB(二手) | 插主槽,Ampere架构 |

| GPU 2 | RTX 5080 16GB | 通过PCIe 4.0延长线接第二槽,Blackwell架构 |

| 显存合计 | 40GB VRAM | 足够装下27B Q8模型 + 230K上下文KV缓存 |

### BIOS设置(至关重要)

很多人双卡翻车就倒在BIOS这一步。必须用UEFI启动(不能用传统BIOS/MBR模式),同时开启 Above 4G DecodingResizable BAR,PCIe分叉设为x8/x8。

### 驱动与编译

由于两块卡架构不同(Ampere vs Blackwell),必须用标准的 `nvidia-open` 驱动,不能用打过补丁的第三方驱动。编译llama.cpp时,CMake要同时指定两种架构:

-DCMAKE_CUDA_ARCHITECTURES="86;120"

注意 NCCL必须关掉(`-DGGML_CUDA_NCCL=OFF`),实测中它反而拖慢速度。

### 推理参数的精妙之处

启动参数有几个值得细品的细节:

`-sm tensor -ts 2,3`:tensor级别的张量分割,2份放GPU0,3份放GPU1,按计算能力均衡分配

`–spec-type ngram-mod,draft-mtp –spec-draft-n-max 3`:投机解码组合拳,ngram复制粘贴 + 多token预测,草稿接受率高达 77.3%

`-ctk q8_0 -ctv q8_0 –kv-unified`:KV缓存Q8量化,统一跨GPU管理

`-fa on`:开启Flash Attention

实测数据令人振奋:单token生成时间11.35ms,整段474 token输出仅需5.4秒

预算友好的硬件采购策略

HN评论区里有几条省钱金句值得记下来:

### 二手3090是性价比之王

一位网友一年前以 390欧元(约3000人民币)入手了二手RTX 3090 24GB。关于”矿卡恐惧”,另一位网友gsora给出了专业解释:矿工通常降压降频运行GPU,实际损耗比打游戏还小。只要买回来清灰换硅脂,再战三年不成问题。

### 中国制造带来惊喜

网友 avyeed_desa 分享了一个极客味十足的方案:用 25美元的中国产双Oculink扩展卡,配合两个 Minis Forum DEG1外接显卡坞,再利用闲置电源组起了多GPU系统。他的评价就两个字:”能用。”

### PCIe延长线别省

iMil用的是阿里速卖通上的一根 PCIe 4.0延长线,确保第二张卡跑满x8带宽。实际验证命令:`lspci -vvv | grep LnkSta`,看到 `Speed 16GT/s, Width x8` 就对了。

单卡方案:一块3090也能起飞

如果你预算有限,一块3090也有惊艳选择。开发者社区实测 Qwen 3.6 35B MoE(混合专家模型),在单张RTX 3090上的表现:

| 指标 | 数值 |

|——|——|

| 模型大小 | 12.4 GB VRAM |

| 推理速度 | ~111 tok/s |

| 原生上下文 | 262K tokens |

| KV缓存 @262K | 仅 2.7 GB(Q8量化) |

Qwen 3.6的Mixture of Experts架构是秘密武器:40层中只有10层是注意力层,其余30层用固定大小的循环状态,KV缓存只从注意力层增长。这意味着在单张24GB显卡上,你还有约7GB的充裕余量。

本地部署 vs 云服务:算一笔明白账

HN讨论中支持本地部署的核心理由很犀利:

成本视角:有网友指出,OpenRouter上Qwen 3.6 27B的价格是 每百万token约3美元。如果你每天重度使用,一年下来的API费用可能足够买下整套设备。更关键的是,本地跑完就完了,边际成本只等于电费

隐私与控制:一位网友说得直白——”我宁愿拥有生产资料,而不是租用生产资料。”当某个国家的政策一变,云的开关可能瞬间关上。而且本地部署给你的是 logprobs、采样器堆栈、LoRA微调 这些云服务永远给不了的东西。

闲置功耗很低ThunderSizzle 实测,显存中加载着模型但空闲时的功耗只有 ~30W,不是想象中的”电老虎”。

你的第一个本地AI环境

总结一条现实可行的路径:

1. 入门级(~3000元):一张二手3090,跑Qwen 3.6 35B MoE,111 tok/s,覆盖日常编码和对话

2. 进阶级(~8000元):二手3090 + RTX 5080,80+ tok/s,27B全精度Q8,230K上下文

3. 主板别省:选支持PCIe分叉的X570/Z690级别,这是双卡的根本保障

4. 用免费模型:Qwen系列开源且商用友好,社区量化版本丰富,更新活跃

HN上一条高赞评论很适合收尾——来自 sieste:”我开始更喜欢本地Qwen 3.6加上pi agent,而不是Claude Code了。Qwen的幻觉和胡话反而更容易识别,因为它没那么多花哨的词汇包装。Claude越来越绕,绕出一堆难以收拾的烂摊子。”

有时候,简单直接就是最好的。2026年,本地AI已经不只是极客的玩具——它是一件你用得起、跑得动、真正属于自己的生产工具。


*参考来源:*

– *Hacker News #17: [AI Coding at Home Without Going Broke](https://news.ycombinator.com/item?id=48518969)*

– *Hacker News #21: [RTX 5080 + RTX 3090 Setup: 80+ Tok/s on Qwen 3.6 27B Q8](https://news.ycombinator.com/item?id=48515454)*

– *iMil.net 技术博客: [RTX 5080 + RTX 3090 Setup](https://imil.net/blog/posts/2026/rtx-5080-+-rtx-3090-setup-80+-tok-s-on-qwen-3.6-27b-q8/)*


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

滚动至顶部
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅