蚂蚁百灵开源Ling-3.0 tiny/flash Base模型,开放6大训练关键节点
8月21日,蚂蚁百灵近日宣布,在已开源Ling-3.0-tiny和Ling-3.0-flash模型的基础上,进一步将Ling-3.0-tiny-base与Ling-3.0-flash-base正式开源。除最终Base checkpoint外,团队还同步开放了两个模型预训练和中期训练的权重checkpoint,共计6个checkpoints,覆盖了预训练、中期训练和WSM合并三个关键阶段,为开发者提供了多个可继续训练的起点。
其中,Ling-3.0-tiny-base总参数量7.9B,激活参数1.3B,以相比前代约50%的总参数量在多数评测中取得更高成绩,代码能力尤为突出;Ling-3.0-flash-base总参数量124B,激活参数5.1B,在代码、复杂推理和长上下文方向表现突出,对比参数量约为其2–3倍的部分Base模型仍具优势。
官方表示,这些checkpoints适合用于持续预训练、领域监督微调、偏好优化、强化学习后训练、蒸馏,以及长上下文和MoE系统研究。但需特别提醒的是,Base Model并非已完成指令对齐的聊天模型,不建议未经后训练便直接部署为面向终端用户的聊天服务,任何生产使用都应完成面向具体任务的后训练、评估与验证。
此次开源的一大技术亮点是WSM(Warmup-Stable and Merge)方案——以多checkpoint加权合并替代传统学习率衰减,使模型更适合持续预训练和动态扩展数据,也支持训练后离线探索不同学习率“衰减曲线”。两款Base模型采用统一训练方案,开发者可先在tiny-base上低成本验证策略,再将有效方法扩展至flash-base。
这一举措直接回应了社区此前在Hugging Face上提出的“希望开放Base模型”的呼声。从开放已完成训练的模型权重,到开放训练过程中的关键节点,蚂蚁百灵正在将“开源”的边界从“成品交付”向“可继续塑造的基座”延伸,为社区提供了更具研究价值的开放底座。