蚂蚁集团开源百灵系列首个原生多模态模型Ling-3.0-flash-VL,引入视觉反馈闭环机制
9月9日,蚂蚁集团宣布推出并开源百灵系列首个原生多模态大模型Ling-3.0-flash-VL。该模型基于Ling-3.0-flash的MoE架构拓展,总参数量124B,单次推理激活5.5B参数,原生支持图像、文本与视频输入,上下文窗口达256K Token。
模型引入“视觉反馈闭环”机制,将任务推进为“观察→行动→验证→修正”的持续闭环,使模型在医疗报告解读、前端代码生成及GUI自动化等场景中能基于视觉反馈持续修正执行结果。训练层面,通过原生多模态联合训练,视觉信息引入对文本能力带来正向提升,在Artificial Analysis Intelligence Index v4.1.1评估中较纯文本版本提升4分。
实际应用测试中,模型在图片转网页任务中可理解布局与组件关系并生成代码,并通过渲染对比自我修正;在Image-to-WebDev Arena评测中得分高于GPT-5.4。作为GUI Agent时可识别界面结构并完成跨工具操作;医疗报告解读场景中支持跨文档数据整合与风险标识。
技术层面,模型引入任意分辨率视觉编码器与VideoRoPE,语言主干沿用42层混合架构(KDA与Gated MLA交替排列,比例5:1),124B总参数下单次推理仅激活5.5B参数,支持低延迟响应及长文档、长视频分析。目前模型已在Ling Studio上线并提供免费体验,BF16和FP8版本已在Hugging Face及ModelScope平台开源,FP4和INT4版本计划近期发布。