Mac本地跑大模型不再折腾:omlx今天发0.6.1,SSD缓存+菜单栏管理,还吃上了Qwen3.5

· 科技资讯

Apple Silicon 用户跑本地大模型,终于不折腾了

在 Mac 上跑本地大模型,一直是”看着美好、上手劝退”的事:命令行装环境、配内存、找量化格式、调性能……折腾两小时,生成速度还不一定理想。今天在 GitHub Trending 上的 omlx 正在改变这件事——它是一个为 Apple Silicon 打造的本地 LLM 推理服务器,今天刚发布 v0.6.1,新增 Qwen3.5 的 ANE 预填充支持,项目已积累近 1.9 万 star。

一句话定位:把”在 Mac 上跑大模型”变成”装个 App 一样简单”。

它解决了什么痛点

三个最真实的痛点:

第一,内存不够用。 Mac 统一内存再大,跑 70B 模型也会爆。omlx 的杀手锏是 SSD 缓存(offloading)——把暂时不用的模型权重换出到 SSD,需要时再换回内存,让小内存 Mac 也能跑大模型。虽然速度比全内存慢,但”能跑”和”跑不动”是质的区别。

第二,命令行劝退。 omlx 自带 macOS 菜单栏管理,不用记一堆命令:点菜单栏图标就能启动/停止服务、看显存占用、切换模型。对”想要本地 AI 但不想当运维”的用户非常友好。

第三,推理速度。 它利用 Apple Silicon 的 ANE(神经网络引擎) 加速,今天 v0.6.1 新增 Qwen3.5 的 ANE 预填充支持,还引入了”双 ANE/GPU 混合提示词处理”的实验特性,在 M 系列芯片上进一步压榨性能。

和同类方案比强在哪

本地推理赛道有不少选手,各有侧重:

| 方案 | 特点 | 适合谁 |

|——|——|——–|

| omlx | SSD 缓存 + 菜单栏 + ANE 加速 + 连续批处理 | 想省心的 Mac 用户 |

| Ollama | 生态大、模型多、跨平台 | 命令行熟练工、需要广泛兼容 |

| LM Studio | 图形界面友好 | 纯 GUI 用户,不太碰终端 |

| llama.cpp | 底层引擎,性能极致 | 硬核玩家、嵌入式场景 |

omlx 的差异化在于“服务器化”和”Apple 原生”:它不只是个 GUI,而是带连续批处理(continuous batching)的推理服务器,可以服务多请求,适合做本地 API、接给其他工具用;同时深度绑定 Apple Silicon,把 ANE 和 SSD 用到了极致。

上手成本

如果你已经有 Homebrew,安装非常简单:

# 安装(Homebrew 或直接下载 dmg)
brew install jundot/tap/omlx

# 启动服务
omlx serve --model Qwen3.5-7B-Instruct-Q4_K_M.gguf

# 测试生成
curl http://localhost:8080/v1/completions \
  -H "Content-Type: application/json" \
  -d '{"model": "Qwen3.5-7B-Instruct-Q4_K_M.gguf", "prompt": "你好,介绍一下你自己", "max_tokens": 128}'

模型文件放到指定目录后,菜单栏点一点就能管理。适合谁:有 M 系列 Mac、想要本地离线推理、又不想折腾命令行的开发者。 不适合谁:没有 Mac 的用户(当前仅支持 Apple Silicon)、需要超大模型且对速度有苛刻要求的场景。

限制与提醒

仅支持 Apple Silicon(M 系列),Intel Mac 和 Windows 用不了

– SSD 换出模式速度明显低于全内存运行,追求极致性能还是得加大内存

– 项目迭代很快(今天连发 0.6.1),大版本升级时注意配置兼容

一句话结论:如果你有一台 M 系列 Mac,又一直想试试本地跑大模型,omlx 是目前”性价比最高的不折腾方案”——今天又涨了 96 颗星,还刚吃上 Qwen3.5,值得现在就装一个试试。


🔥 关注LC智趣厅,每天第一时间看懂 AI 行业大事。

👇 觉得有用,点个赞让更多人看到。


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

Scroll to Top
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅