Meta开源30B模型Muse Glimmer:专为本地AI智能体打造,可在单卡24GB显存运行

2026-08-11 13:19:01   |   弘乐   |   523

8月11日,Meta今日正式发布AI模型Muse Glimmer,并在Apache 2.0许可协议下开源其模型权重。这款拥有300亿参数(30B)的模型,专为全天候常驻运行的本地智能体(Agent)工作流深度优化,标志着Meta在开源AI领域的再次加码。

Muse Glimmer的核心突破在于其对消费级硬件的友好适配。官方表示,通过应用4bit量化技术,模型权重被压缩至20GB以下,可在配备24GB或32GB显存的Mac或PC上本地运行,且实测验证这种压缩对智能体任务性能的影响微乎其微,几乎没有任何衰减。该模型由Meta Superintelligence Labs从其旗舰闭源模型Muse Spark蒸馏而来,集成多步推理、工具调用、多模态理解(文本+图像)和故障恢复等核心能力,适用于日程管理、文件整理、代码编写等高度依赖个人数据的日常场景,所有计算均在本地完成,无需连接云端。

在性能表现上,Muse Glimmer在多项主流基准测试中展现出同尺寸级别的强劲实力。与Google的Gemma4-31B和阿里巴巴的Qwen3.6-27B相比,Muse Glimmer在MCP Atlas(75.5 vs 54.2/62.5)、DeepSearch QA(74.6 vs 61.7/71.1)和WildClawBench(47.6 vs 37.6/43.2)等多项测试中均取得领先。第三方机构Artificial Analysis的评估也显示,Muse Glimmer的综合指标超越了Claude Haiku 4.5,并接近Gemini 3.5 Flash-Lite。

为了提升本地推理速度,Muse Glimmer还采用了名为DFlash的推测解码技术,利用一个轻量级的“实习生”模型快速生成令牌草案,再由主模型进行并行校验。这一机制在RTX 5090上实现了3.1倍的解码加速,吞吐量达到每秒233个令牌;在M5 Max和M4 Max上的加速分别为1.8倍和1.5倍,足以支撑无延迟感的实时交互。随着Hugging Face开放下载以及对llama.cpp、MLX、Ollama等框架的支持,Muse Glimmer有望成为开发者构建本地AI智能体的热门选择。

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字、图片等内容的真实性、完整性、及时性本站不作任何保证或承诺,请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时发送相关信息至bireading@163.com,本站将会在48小时内处理完毕。

Meta开源30B模型Muse Glimmer:专为本地AI智能体打造,可在单卡24GB显存运行

2026-08-11 13:19:01 浏览量: 523 作者: 弘乐

8月11日,Meta今日正式发布AI模型Muse Glimmer,并在Apache 2.0许可协议下开源其模型权重。这款拥有300亿参数(30B)的模型,专为全天候常驻运行的本地智能体(Agent)工作流深度优化,标志着Meta在开源AI领域的再次加码。

Muse Glimmer的核心突破在于其对消费级硬件的友好适配。官方表示,通过应用4bit量化技术,模型权重被压缩至20GB以下,可在配备24GB或32GB显存的Mac或PC上本地运行,且实测验证这种压缩对智能体任务性能的影响微乎其微,几乎没有任何衰减。该模型由Meta Superintelligence Labs从其旗舰闭源模型Muse Spark蒸馏而来,集成多步推理、工具调用、多模态理解(文本+图像)和故障恢复等核心能力,适用于日程管理、文件整理、代码编写等高度依赖个人数据的日常场景,所有计算均在本地完成,无需连接云端。

在性能表现上,Muse Glimmer在多项主流基准测试中展现出同尺寸级别的强劲实力。与Google的Gemma4-31B和阿里巴巴的Qwen3.6-27B相比,Muse Glimmer在MCP Atlas(75.5 vs 54.2/62.5)、DeepSearch QA(74.6 vs 61.7/71.1)和WildClawBench(47.6 vs 37.6/43.2)等多项测试中均取得领先。第三方机构Artificial Analysis的评估也显示,Muse Glimmer的综合指标超越了Claude Haiku 4.5,并接近Gemini 3.5 Flash-Lite。

为了提升本地推理速度,Muse Glimmer还采用了名为DFlash的推测解码技术,利用一个轻量级的“实习生”模型快速生成令牌草案,再由主模型进行并行校验。这一机制在RTX 5090上实现了3.1倍的解码加速,吞吐量达到每秒233个令牌;在M5 Max和M4 Max上的加速分别为1.8倍和1.5倍,足以支撑无延迟感的实时交互。随着Hugging Face开放下载以及对llama.cpp、MLX、Ollama等框架的支持,Muse Glimmer有望成为开发者构建本地AI智能体的热门选择。

,

Copyright ©2018 铋读网 All Rights Reserved.

京ICP备18051707号

京公网安备 11011302001633号