谷歌为Gemma 4推出MTP起草器:推理速度最高提升3倍
5月7日,谷歌于5月5日发布博文,宣布为Gemma 4系列AI模型推出多Token预测起草器,利用推测解码架构,使推理速度最高可提升3倍。
Gemma 4作为谷歌目前能力最强的开源模型,在发布仅数周内下载量已突破6000万次。此次推出的MTP起草器,旨在不降低输出质量或推理逻辑的前提下,突破推理效率的极限。
据介绍,当前标准大语言模型的推理通常受限于内存带宽,导致严重的延迟瓶颈。处理器需要耗费大量时间将数十亿参数从显存传输至计算单元,造成计算资源利用率不足。为解决这一核心痛点,谷歌为Gemma 4系列引入了推测解码技术,将重型目标模型(如Gemma 4 31B)与轻量级起草器(MTP模型)配对使用。
该起草器利用闲置算力,在短时间内预测多个未来Token,再由目标模型并行验证这些令牌。若预测通过,模型可在单次前向传递中确认整个序列,从而大幅缩短生成时间。实测数据显示,在Apple Silicon芯片上,当batch sizes设置为4至8时,Gemma 4 26B模型实现了约2.2倍的本地加速。开发者可利用该技术在个人电脑及消费级显卡上流畅运行复杂的离线编程与智能体工作流,同时显著降低边缘设备的能耗。
此次更新主要面向对低延迟要求极高的应用场景,包括聊天机器人、编程助手、自主智能体及移动端应用。开发者能够在资源受限的环境中部署先进的语言模型,无需牺牲响应速度或计算精度,进一步拓展AI应用的边界。