Google Research·· 2026-06-27精选AI 评分60
Google Research 用冻结多 token 预测加速 Pixel 上的 Gemini Nano 模型
Accelerating Gemini Nano models on Pixel with frozen Multi-Token Prediction
AI 导读
Google Research 宣布一种新架构,将多 token 预测(MTP)头附加到冻结的 Gemini Nano v3 模型上,以加速 Pixel 9 和 10 系列上的端侧推理。相比独立草稿模型,MTP 在 Pixel 9 上带来 50% 或以上的速度提升,并节省约 130MB 内存,同时保持输出与主模型逐位一致。该方案已用于 AI 通知摘要和校对等功能,减少能耗并提升电池续航。
推荐理由
原文给出冻结骨干加 MTP 头的端侧加速方案,读者可据此判断其相对独立草稿模型的效率优势。
来源:Google Research · research.google