蚂蚁百灵开源Ling-3.0-tiny模型:1.3B激活参数MoE架构

2026-08-12 10:24:48   |   弘乐   |   614

8月12日,蚂蚁百灵大模型今日在Hugging Face平台正式开源Ling-3.0-tiny模型,这是一款主打低成本本地部署的轻量级混合推理MoE模型。该模型总参数量为79亿(7.9B),但推理时每Token仅激活约13亿(1.3B)参数,以极低的实际计算成本实现了不俗的综合能力。

在架构设计上,Ling-3.0-tiny采用了高效混合线性架构,将KDA(Kimi Delta Attention)和MLA(多头潜在注意力)按3:1比例交替堆叠,并配备包含128个路由专家的稀疏MoE前馈网络,在上下文处理能力和计算成本之间实现了良好平衡。官方同步提供了BF16、FP8和INT4三种权重版本,适配不同硬件平台的部署需求。

性能方面,该模型在Artificial Analysis Intelligence Index评价体系中获得25分,仅比参数量更大的Gemma-4-26B-A4B低1分,同时高于gpt-oss-120B、Qwen3.5-9B等模型。在智能体任务维度,其Agentic Index得分16分,甚至高于Gemma-4-31B。

针对本地部署优化,Ling-3.0-tiny已在英伟达DGX Spark和Apple Silicon MacBook/Mac mini等设备上完成验证。实测数据显示,在M4 Pro芯片的MacBook上,推理速度可达86-90 Token/s,8K上下文长度下峰值内存占用仅约8.34GiB,全程本地推理无需云端调用。该模型支持通过`enable_thinking`参数灵活切换快速响应与多步骤推理模式,为代码辅助、知识工作流和本地AI智能体应用提供了低成本、高隐私的解决方案。

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字、图片等内容的真实性、完整性、及时性本站不作任何保证或承诺,请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时发送相关信息至bireading@163.com,本站将会在48小时内处理完毕。

蚂蚁百灵开源Ling-3.0-tiny模型:1.3B激活参数MoE架构

2026-08-12 10:24:48 浏览量: 614 作者: 弘乐

8月12日,蚂蚁百灵大模型今日在Hugging Face平台正式开源Ling-3.0-tiny模型,这是一款主打低成本本地部署的轻量级混合推理MoE模型。该模型总参数量为79亿(7.9B),但推理时每Token仅激活约13亿(1.3B)参数,以极低的实际计算成本实现了不俗的综合能力。

在架构设计上,Ling-3.0-tiny采用了高效混合线性架构,将KDA(Kimi Delta Attention)和MLA(多头潜在注意力)按3:1比例交替堆叠,并配备包含128个路由专家的稀疏MoE前馈网络,在上下文处理能力和计算成本之间实现了良好平衡。官方同步提供了BF16、FP8和INT4三种权重版本,适配不同硬件平台的部署需求。

性能方面,该模型在Artificial Analysis Intelligence Index评价体系中获得25分,仅比参数量更大的Gemma-4-26B-A4B低1分,同时高于gpt-oss-120B、Qwen3.5-9B等模型。在智能体任务维度,其Agentic Index得分16分,甚至高于Gemma-4-31B。

针对本地部署优化,Ling-3.0-tiny已在英伟达DGX Spark和Apple Silicon MacBook/Mac mini等设备上完成验证。实测数据显示,在M4 Pro芯片的MacBook上,推理速度可达86-90 Token/s,8K上下文长度下峰值内存占用仅约8.34GiB,全程本地推理无需云端调用。该模型支持通过`enable_thinking`参数灵活切换快速响应与多步骤推理模式,为代码辅助、知识工作流和本地AI智能体应用提供了低成本、高隐私的解决方案。

,

Copyright ©2018 铋读网 All Rights Reserved.

京ICP备18051707号

京公网安备 11011302001633号