谷歌为Gemma 4推出MTP起草器:推理速度最高提升3倍

2026-05-07 17:16:02   |   文白不白   |   1859

5月7日,谷歌于5月5日发布博文,宣布为Gemma 4系列AI模型推出多Token预测起草器,利用推测解码架构,使推理速度最高可提升3倍。

Gemma 4作为谷歌目前能力最强的开源模型,在发布仅数周内下载量已突破6000万次。此次推出的MTP起草器,旨在不降低输出质量或推理逻辑的前提下,突破推理效率的极限。

据介绍,当前标准大语言模型的推理通常受限于内存带宽,导致严重的延迟瓶颈。处理器需要耗费大量时间将数十亿参数从显存传输至计算单元,造成计算资源利用率不足。为解决这一核心痛点,谷歌为Gemma 4系列引入了推测解码技术,将重型目标模型(如Gemma 4 31B)与轻量级起草器(MTP模型)配对使用。

该起草器利用闲置算力,在短时间内预测多个未来Token,再由目标模型并行验证这些令牌。若预测通过,模型可在单次前向传递中确认整个序列,从而大幅缩短生成时间。实测数据显示,在Apple Silicon芯片上,当batch sizes设置为4至8时,Gemma 4 26B模型实现了约2.2倍的本地加速。开发者可利用该技术在个人电脑及消费级显卡上流畅运行复杂的离线编程与智能体工作流,同时显著降低边缘设备的能耗。

此次更新主要面向对低延迟要求极高的应用场景,包括聊天机器人、编程助手、自主智能体及移动端应用。开发者能够在资源受限的环境中部署先进的语言模型,无需牺牲响应速度或计算精度,进一步拓展AI应用的边界。

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字、图片等内容的真实性、完整性、及时性本站不作任何保证或承诺,请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时发送相关信息至bireading@163.com,本站将会在48小时内处理完毕。

谷歌为Gemma 4推出MTP起草器:推理速度最高提升3倍

2026-05-07 17:16:02 浏览量: 1859 作者: 文白不白

5月7日,谷歌于5月5日发布博文,宣布为Gemma 4系列AI模型推出多Token预测起草器,利用推测解码架构,使推理速度最高可提升3倍。

Gemma 4作为谷歌目前能力最强的开源模型,在发布仅数周内下载量已突破6000万次。此次推出的MTP起草器,旨在不降低输出质量或推理逻辑的前提下,突破推理效率的极限。

据介绍,当前标准大语言模型的推理通常受限于内存带宽,导致严重的延迟瓶颈。处理器需要耗费大量时间将数十亿参数从显存传输至计算单元,造成计算资源利用率不足。为解决这一核心痛点,谷歌为Gemma 4系列引入了推测解码技术,将重型目标模型(如Gemma 4 31B)与轻量级起草器(MTP模型)配对使用。

该起草器利用闲置算力,在短时间内预测多个未来Token,再由目标模型并行验证这些令牌。若预测通过,模型可在单次前向传递中确认整个序列,从而大幅缩短生成时间。实测数据显示,在Apple Silicon芯片上,当batch sizes设置为4至8时,Gemma 4 26B模型实现了约2.2倍的本地加速。开发者可利用该技术在个人电脑及消费级显卡上流畅运行复杂的离线编程与智能体工作流,同时显著降低边缘设备的能耗。

此次更新主要面向对低延迟要求极高的应用场景,包括聊天机器人、编程助手、自主智能体及移动端应用。开发者能够在资源受限的环境中部署先进的语言模型,无需牺牲响应速度或计算精度,进一步拓展AI应用的边界。

,

Copyright ©2018 铋读网 All Rights Reserved.

京ICP备18051707号

京公网安备 11011302001633号