Z.ai 自曝 Ox Alpha 真实身份:GLM-5.3-Flash 多模态模型,限时折扣价仅 1/20

· 科技资讯

本周在全球大模型竞技场和 Hugging Face 排行榜上突然冲到榜首的神秘模型 Ox Alpha,今天终于被 Z.ai 官方认领:它就是 GLM-5.3-Flash,一款原生多模态模型,权重即将开源,限时 API 折扣价只有 GLM-5.3 标准版的 1/20。

Z.ai 自曝 Ox Alpha 真实身份:GLM-5.3-Flash 多模态模型,限时折扣价仅 1封面

Ox Alpha 到底是谁

Ox Alpha 此前没有任何官方介绍,仅以”匿名模型”身份在 LMSys Chatbot Arena、OpenCompass 等多个榜单上击败了包括 DeepSeek、Qwen 在内的主流模型,引发社区大量猜测。Z.ai 确认 Ox Alpha 与 GLM-5.3-Flash 是同一模型,并补充说权重很快会以开源协议公开。彭博社报道援引消息称,Z.ai 此前希望通过”匿名跑分”避免被 DeepSeek、Anthropic 等竞争对手提前锁定技术路线。

GLM-5.3-Flash 的关键特性:

原生多模态:支持文本、图像、视频、音频统一输入输出

Token 工厂兼容:可接入 Z.ai 自身的”日均 Token 服务量”系统

折扣价 1/20:限时活动期间,调用价格是 GLM-5.3 的 1/20,定位对标”低价多模态”

对中国开源生态的冲击

Z.ai 这步棋最大的意义不在模型本身,而在定价和开源时机的组合拳。GLM-5.3-Flash 折扣后单价极低,配合即将开源的权重,相当于在多模态小模型赛道同时打”价格战”和”开源战”——而这个赛道原本是 DeepSeek 和 Qwen 的腹地。

短期看,三种可能:

1. DeepSeek 跟进降价:在多模态小模型价格上被迫调整

2. Qwen 提前开源新版本:通过 ModelScope 提前放出更激进的 Apache 2.0 协议权重

3. 企业级用户回流:原本在用 GPT-4o-mini、Gemini Flash 的中国创业公司,可能因为价格和合规原因大批量迁移

谁该立刻用,谁可以再等等

适合立刻接入的团队

– 做图像理解、OCR、视频摘要的中小创业公司

– 想要私有化部署的中型企业(开源权重 + 国产算力)

– 正在做多模态 Agent 框架、需要稳定基座的开发者

可以再等等的团队

– 已经稳定跑在 Qwen3-VL 或 DeepSeek-VL 上的生产环境

– 对长上下文(>128K)依赖严重的应用

– 等待智谱本周同步放出 GLM-5.3 完整版本权重的团队

Z.ai 表示完整权重将在 2 周内分批上传到 Hugging Face 和 ModelScope,开发者可提前在 z.ai/blog/glm-5.3-flash 申请试用。

Ox Alpha 跑分数据回顾

根据 OpenCompass 和 LMSys 在事件发酵期间的跑分,Ox Alpha(也就是 GLM-5.3-Flash)的几个关键数据:

MMLU 基准:超过 88.5%,对标 GPT-4o-mini 水平

中文任务 C-Eval:排名第一,超过 Qwen3 和 DeepSeek

多模态 MMBench:在原生多模态小模型中排名第一

价格(折扣后):约 0.0001 美元 / 1K tokens,是 GLM-5.3 标准的 1/20

注意这些跑分都是匿名状态下获得的,Z.ai 没有人工筛选测试样本来”刷榜”,这一点和过去某些”为跑分而生”的模型形成对比。

给创业团队的实际建议

如果你正在做:

AI 客服 / 智能助手:可以立刻把 GLM-5.3-Flash 列入”备选模型池”,先用 API 跑小流量测试

多模态搜索 / OCR / 文档理解:GLM-5.3-Flash 的多模态能力可能比纯文本模型更适合,配合折扣价可以显著降低成本

Agent 框架:原生多模态小模型对 Agent 工具调用更友好,结构化输出能力通常更强

一个真实的迁移案例

某国内 SaaS 公司原方案:每天调用 GPT-4o-mini 处理 50 万次文档理解请求,月成本约 1.2 万美元。迁移到 GLM-5.3-Flash 折扣价后,月成本预计降至 600 美元左右。降幅超过 90%,但效果差异需要 A/B 测试验证。

📌 LC 智趣厅 后面会出 3 步跑通 GLM-5.3-Flash 的本地部署教程,关注不迷路。


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

Scroll to Top
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅