蚂蚁百灵开源Ling-3.0-tiny模型:1.3B激活参数MoE架构
8月12日,蚂蚁百灵大模型今日在Hugging Face平台正式开源Ling-3.0-tiny模型,这是一款主打低成本本地部署的轻量级混合推理MoE模型。该模型总参数量为79亿(7.9B),但推理时每Token仅激活约13亿(1.3B)参数,以极低的实际计算成本实现了不俗的综合能力。
在架构设计上,Ling-3.0-tiny采用了高效混合线性架构,将KDA(Kimi Delta Attention)和MLA(多头潜在注意力)按3:1比例交替堆叠,并配备包含128个路由专家的稀疏MoE前馈网络,在上下文处理能力和计算成本之间实现了良好平衡。官方同步提供了BF16、FP8和INT4三种权重版本,适配不同硬件平台的部署需求。
性能方面,该模型在Artificial Analysis Intelligence Index评价体系中获得25分,仅比参数量更大的Gemma-4-26B-A4B低1分,同时高于gpt-oss-120B、Qwen3.5-9B等模型。在智能体任务维度,其Agentic Index得分16分,甚至高于Gemma-4-31B。
针对本地部署优化,Ling-3.0-tiny已在英伟达DGX Spark和Apple Silicon MacBook/Mac mini等设备上完成验证。实测数据显示,在M4 Pro芯片的MacBook上,推理速度可达86-90 Token/s,8K上下文长度下峰值内存占用仅约8.34GiB,全程本地推理无需云端调用。该模型支持通过`enable_thinking`参数灵活切换快速响应与多步骤推理模式,为代码辅助、知识工作流和本地AI智能体应用提供了低成本、高隐私的解决方案。