蚂蚁百灵开源Ling-3.0:连训练中间过程都公开,6个checkpoint一次放出

· 科技资讯

8月20日,蚂蚁百灵做了一件国产大模型圈少见的事:正式开源 Ling-3.0-tiny-base 与 Ling-3.0-flash-base,并同步放出预训练、中期训练、WSM 合并三个阶段共 6 个 checkpoint。以往开源模型多是”毕业照”——只给最终权重;这次蚂蚁把”求学过程”也摊开了,相当于把实验室的操作台搬到了开源社区。

两个模型什么来头

Ling-3.0-tiny-base:总参数 7.9B、激活参数 1.3B。以相比前代约 50% 的总参数量,在大多数评测中取得更高结果,与同等规模模型对比时代码能力更有竞争力。

Ling-3.0-flash-base:总参数 124B、激活参数 5.1B。稀疏激活设计,参数容量更足,在代码、复杂推理和长上下文方向表现突出,相比总参数约为其 2–3 倍的 base 模型仍具优势。

注意”Base”这个关键词:它们不是对齐过的聊天模型,而是面向二次开发的基座。官方也明确提醒,不建议未经后训练直接部署成面向终端用户的聊天服务,更不建议未经对齐评估就用于安全关键型应用。

为什么要开放”训练中间态”

这次开放的最大看点不是权重本身,而是训练方法论。蚂蚁把传统学习率衰减改写为 checkpoint 加权合并,即 WSM(Warmup-Stable and Merge):中期训练结束后,用多个 checkpoint 加权合并替代学习率衰减。

这个设计带来两个实用价值:其一,由于没有学习率衰减,模型更适合持续预训练和动态扩展数据,社区可以继续”接着练”而不破坏已有能力;其二,研究者可以在训练后离线探索不同的学习率”衰减曲线”,复现和对比实验的门槛大幅降低。

官方表示,这些 checkpoint 适合持续预训练、领域监督微调、偏好优化、强化学习后训练、蒸馏,以及长上下文和 MoE 系统研究。对高校实验室和小团队来说,等于拿到了一份”可继续加工的原料”,而不是只能吃现成的成品。

谁该关注、谁可忽略

谁该关注:做领域大模型微调的研究团队、想低成本做持续预训练的公司、研究 MoE 与长上下文的学生——建议直接去 Hugging Face 或 ModelScope 搜 inclusionAI/Ling-3.0-tiny-base 与 Ling-3.0-flash-base,三阶段 checkpoint 都已上线。想动手的,可以先从 tiny-base 入手:7.9B 总参数、1.3B 激活参数的规模,单卡到双卡即可尝试继续预训练或 SFT,官方此前还提到它支持英伟达 DGX Spark 和苹果 Mac mini 部署,本地验证成本不高。谁可以忽略:只想开箱即用地聊天的普通用户,请去用对齐过的指令模型。

一个提醒:Base 模型拿来就用是灾难,务必完成目标任务的 SFT/RL 后训练并做安全评估,再把模型放进生产环境。

判断:“开源最终模型”正在变成”开源训练全过程”。 蚂蚁这步棋既降低了研究门槛,也让百灵的模型口碑在开发者社区里多了一块长期资产。国产开源模型的内卷,已经从卷参数卷到卷透明度了。

🔥 关注LC智趣厅,每天一条硬核科技观察。

👇 关注不错过。


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

Scroll to Top
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅