
蚂蚁百灵近期开源了 Ling-3.0-tiny-base 和 Ling-3.0-flash-base 两款基座模型,并同步放出预训练、中期训练及 WSM 合并共 6 个检查点,开发者可根据自身需求选择任意训练阶段作为起点进行二次开发。
在开源大模型领域,开放最终权重已成常态,但将训练过程中的关键节点一并交出,却并不多见。近期,蚂蚁百灵团队针对开发者对基座模型的呼声,一次性放出了 Ling-3.0-tiny-base 和 Ling-3.0-flash-base 两款模型的 6 个训练检查点,覆盖预训练、中期训练及 WSM 合并等多个阶段。这一动作的意义不仅在于提供更多选择,更在于它改变了大模型二次开发的游戏规则——开发者不再只能拿到一个“成品”,而是可以像搭积木一样,从最适合自己需求的环节介入训练流程。
过去,开源模型社区的主流做法是发布已经过完整后训练(如指令微调、人类反馈对齐)的版本。但对于预算有限或研究目标特殊的开发者而言,一个已经“定型”的模型往往难以深度改造。正如一位开发者在 Hugging Face 社区所反馈的,相比一个现成的聊天模型,研究社区更渴望一个能够自由塑造的基座。
蚂蚁百灵此次的回应颇具针对性。根据官方发布的信息,此次开放的 6 个检查点分为三类:一是完成大规模预训练但未经中期训练与合并的权重;二是完成中期训练但尚未进行 WSM 合并的权重;三是已完成 WSM 合并但未进行后训练的最终 Base 权重。这种梯度式的开放结构,让开发者可以根据自身算力与目标,灵活选择训练的“入口”。
从技术角度看,这种策略的价值在于对计算资源的重新分配。对于许多高校实验室或初创团队而言,从头预训练一个百亿级模型几乎是不可能的任务,但基于一个高质量的 Base 模型进行领域适配则现实得多。蚂蚁百灵提供的这种“半成品”模式,恰好填补了从零训练与直接使用成品之间的空白地带。
此次开源中,一个值得关注的技术细节是 WSM(Warmup-Stable and Merge)方案。在传统的大模型预训练中,学习率通常遵循“上升-稳定-衰减”的曲线,而 WSM 则用多个检查点的加权合并取代了最后的学习率衰减阶段。
这种设计的优势在于,模型不会因为学习率的强制归零而陷入局部最优,反而更适合在后续阶段进行持续预训练或动态数据扩展。对于研究者来说,他们甚至可以在训练结束后,通过离线方式探索不同的学习率衰减曲线,这在以往的训练流程中是难以想象的灵活性。
这一机制与 DeepSeek 团队在开源其 MoE 模型时强调的“无学习率衰减”理念有异曲同工之妙,都指向了同一个趋势:大模型训练正在从固定的流水线作业,转向更灵活、更可干预的动态过程。
Ling-3.0-tiny-base 的总参数量为 7.9B,激活参数仅 1.3B,属于典型的“小而精”模型。其总参数量约为前代 Ling-2.5-mini-base 的一半,但在代码能力等多项评测中反而有所提升。对于预算敏感的强化学习研究、模型行为分析以及高校教学场景,这款模型提供了极低的试错成本。
相比之下,Ling-3.0-flash-base 则定位高端,总参数量达到 124B,激活参数 5.1B。它在代码生成、复杂推理和长上下文处理方面表现突出,即便与总参数量是其 2 至 3 倍的部分开源模型相比,综合成绩依然具备竞争力。官方资料显示,这款模型更适合作为大型代码库训练底座、专业推理 Agent 或金融、医疗等垂直领域的持续预训练基础。
值得注意的是,两款模型虽然规模悬殊,却共享同一套训练方案。这意味着开发者可以先在 Tiny 模型上以极低成本验证训练策略,验证有效后再将同样的方法迁移到 Flash 模型上,从而规避了在超大模型上反复试错的高昂成本。
蚂蚁百灵此次的开放策略,放在国内大模型开源浪潮中审视,有其独特的坐标。与 DeepSeek 强调的极致性价比推理不同,也与智谱 GLM 侧重智能体应用的路线有所区别,百灵此次主打的差异化在于“训练过程的透明度”。
从行业趋势看,国内开源模型正在从单纯的性能竞赛,转向对开发者体验的深度挖掘。无论是 ModelScope 社区对中文场景的优化,还是 Hugging Face 上海外开发者对 Base 模型的呼声,都表明下一阶段的竞争焦点将是如何更好地服务于二次开发者。蚂蚁百灵通过开放 6 个检查点,实际上是在构建一个更紧密的开发者生态——当开发者深度参与到模型的定制化训练中,其对平台的粘性将远超单纯下载权重的关系。
尽管开放力度空前,但蚂蚁百灵团队也给出了明确的使用边界。Base 模型并未经过指令对齐,不适合直接部署为面向终端用户的聊天服务;在涉及安全关键型应用时,必须完成额外的对齐与评估。这一提醒至关重要——基座模型的自由度与风险并存,开发者需要具备相应的技术能力与责任意识。
两者的核心差异在于参数规模与定位。Tiny-base 总参数量 7.9B、激活参数 1.3B,适合低成本验证训练策略、预算敏感的强化学习研究;Flash-base 总参数量 124B、激活参数 5.1B,面向代码、复杂推理和长上下文等高性能场景,适合作为专业领域模型的训练底座。
WSM(Warmup-Stable and Merge)是一种面向大模型预训练的学习率方案。它通过将多个训练检查点进行加权合并,替代传统的学习率衰减阶段,使模型更适合持续预训练和动态扩展数据,同时允许研究者在离线状态下探索不同的学习率衰减策略。
开发者可以根据自身需求选择不同的训练起点:预训练检查点适合从头进行领域适配,中期训练检查点适合在已有基础上继续优化,最终 Base 检查点则适合直接进行监督微调或强化学习后训练。由于 Tiny 与 Flash 采用统一训练方案,可先在 Tiny 上验证策略再迁移至 Flash。
不建议直接部署。Base 模型未经过指令对齐和人类反馈优化,不适合直接面向终端用户提供服务。若用于生产环境或安全关键型应用,必须完成针对具体任务的后训练、评估和验证。
inclusionAI/Ling-3.0-tiny-base 或 inclusionAI/Ling-3.0-flash-base 即可找到对应仓库及其预训练、中期训练版本。Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

从通义千问下载量登顶到 Anthropic 暂缓发布新模型,从微信的 AI 化愿景到 Waymo 的无人车扩张,全球 AI 竞赛正从模型军备转向生态博弈与安全治理。本文梳理近期科技行业关键动态,解读巨头们的战略转向与行业深层逻辑。

Writer 发布基于开源模型 GLM-5.2 后训练的 Palmyra X6,通过优化智能体框架而非堆砌参数,帮助企业降低最高 50% 的 Token 成本,揭示 AI 部署从拼参数转向省 Token 的新趋势。

OpenAI发布gpt-oss-safeguard-120b和gpt-oss-safeguard-20b两款开源安全审核模型,基于Apache 2.0许可,支持政策驱动的推理内容分类,具备完整思维链输出和结构化输出能力。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。