← 返回 PaperDaily 视觉与图像

Google DeepMind最新Gemma 4:31B冲上开源榜前列

Gemma 4最有意思的地方,不是单纯把参数做大,而是把“思考模式”、长上下文效率、无编码器多模态和量化推理一起打包了。开源模型里这种“性能、效率、部署”三线并进的做法,确实值得认真看。

Google DeepMind最新Gemma 4:31B冲上开源榜前列
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
Gemma 4最有意思的地方,不是单纯把参数做大,而是把“思考模式”、长上下文效率、无编码器多模态和量化推理一起打包了。开源模型里这种“性能、效率、部署”三线并进的做法,确实值得认真看。


原论文信息如下:
论文标题:
Gemma 4 Technical Report
发表日期:
2026年07月
发表单位:
Google DeepMind
原文链接:
https://arxiv.org/pdf/2607.02770v1.pdf

Gemma 4来了:小模型如何凭“思考”击败大模型?

Gemma 4最有意思的地方,不是“又做大了一点”,而是把几件看起来互相打架的事硬凑到了一起:更强的推理、更省的显存、更快的解码、还能看图听音。开源模型常见的老毛病是“能力上去了,部署也上天了”,这次 Google DeepMind 试图把这口锅一起端稳。
插图
图1:Gemma 4 的多任务解码器结构中,MTP drafter 直接复用主模型的激活和 KV cache,用更小的代价提前“猜”后续 token,为 speculative decoding 提速。
这篇报告的核心信号很明确:Gemma 4 不只是一个更大的模型,而是一套面向真实部署场景的“效率优先”开源多模态家族。它覆盖 2.3B、4.5B、12B、31B 以及一个 MoE 版本,既能做文本推理,也能做图像和音频理解,还把长上下文、量化、推理加速一起考虑进去了。说白了,这不是单点炫技,更像是一次“开源模型工程化总动员”。

首次引入“思考模式”,推理能力飙升

先把“思考模式”说人话:模型以前常常是“看见题就答题”,现在改成“先在脑子里写草稿,再把答案端出来”。这类做法并不神秘,行业里常叫 thinking mode,中文可理解为思考模式。它的目标不是让模型学会装深沉,而是让模型在数学、代码、复杂推理等任务上多走一步,减少拍脑袋式输出。
Gemma 4 的做法很直接:在指令微调阶段加入思考模式,让模型在回答前先生成一段 reasoning trace,也就是推理轨迹。这和 OpenAI 在 2024 年提出的思考式输出思路一致,区别在于 Gemma 4 把它做成了开源家族的默认能力之一,而不是只给少数大模型开小灶。
为什么这个动作有效?因为很多推理题并不是“知道答案”就够了,关键在于中间步骤不能乱。思考模式会把模型从“直接输出最终句子”改成“先构造中间状态,再做最终决策”。这相当于给模型加了一个临时草稿纸,虽然会多花一点 token,但通常能换来更稳的推理质量。对数学、编程、科学问答这类任务,这个代价往往值得。
更关键的是,Gemma 4 不是只把“思考”当成口号。报告里的静态基准显示,31B 和 26B-A4B 在 AIME 2026、LiveCodeBench、Codeforces Elo、GPQA Diamond 等任务上都明显强于上一代 Gemma 3 27B。这里的信号很清楚:思考模式不是花架子,而是确实把模型往“更会解题”方向推了一截。
插图
图2:图像按长宽比重采样的流程示意。先把图像缩放到合适的 pooled patches,再送入视觉编码器,最后把得到的 soft tokens 交给 LLM backbone。
这里还有一个容易被忽略的点:思考模式并不等于无限加长输出。Gemma 4 仍然要控制效率,所以它把“更会想”和“别太慢”一起考虑了。否则模型一边思考一边把显存烧穿,那就不是智能,是 CPU 疼。

两大“瘦身”绝技:编码器去哪了?KV缓存怎么省?

Gemma 4 真正像工程团队干出来的地方,在于它不满足于“把模型做强”,而是继续追问:能不能更省显存、更省带宽、更省部署成本? 这部分才是很多开源模型从 demo 走向产品的分水岭。
先说长上下文。上下文一长,KV cache 就像滚雪球,越滚越大。KV cache 可以理解成模型在生成过程中保存的“记忆本子”,每生成一个 token 都要翻看过去的信息。问题是,翻得越多,内存越爆。Gemma 4 的处理方式很务实:采用局部注意力 + 全局注意力的混合结构,并保持大约 5:1 的比例;同时在全局层里复用 keys 作为 values,再配合 p-RoPEpartial Rotary Position Embedding,部分旋转位置编码)来做位置表示。这样一套组合拳下来,全局 KV cache 体积最多能省掉 37.5%。
插图
图3:保持图像长宽比的重采样算法。算法的核心不是把图硬裁成方块,而是尽量在 token 数受限的情况下保留图像结构信息。
再说多模态编码器。很多多模态模型的套路是“图像一套编码器,音频一套编码器,最后都喂给大语言模型”,看起来很完整,实际上参数和内存都在偷偷长胖。Gemma 4 给出了两条路线:E2B、E4B、31B 等模型保留冻结的视觉和音频编码器,而 12B 版本直接走统一的无编码器架构,把原始图像 patch 和 40ms 音频块直接投影到 LLM embedding 空间里。
这一步看着“偷工减料”,其实是非常典型的工程取舍。图像侧不再依赖一个 550M 的重编码器,而是用一个大矩阵乘法加二维坐标位置嵌入;音频侧则把 16kHz 的原始波形切成 40ms 一段,直接投影。好处很现实:参数更少、碎片更少、部署更轻。坏处也有,统一投影对输入质量和训练稳定性要求更高,不是随便砍编码器就能稳的。
量化也是 Gemma 4 的硬菜之一。报告里提到采用 QAT,即 Quantization-Aware Training,量化感知训练。它的意思不是训练完再粗暴压缩,而是在训练时就让模型适应低比特表示。这样做的意义很直接:能在尽量少掉点精度的前提下,把参数内存和推理延迟压下来。对于端侧和边缘设备来说,这种优化往往比“再涨 1 个点”更值钱。
插图
图4:Gemma 4 的参数规模与模块拆分示意。不同尺寸模型在视觉、音频、嵌入层和 drafter 上的参数分配不同,体现出“按场景配料”的设计思路。
更妙的是,Gemma 4 还专门做了 MTP drafter。MTP 是 Multi-Token Prediction,中文就是多 token 预测。它配合 speculative decoding 使用,思路是先让一个轻量 drafter 猜后续 token,再由主模型验证。Gemma 4 的实现还把全词表投影砍成了 cluster top-k 选择,把最后一层矩阵乘法从 262k 级别压到 4096 级别,推理速度自然会好看很多。
这一套“编码器瘦身 + KV cache 省电 + MTP 加速”的组合,说明 Gemma 4 不是只在 benchmark 上刷分,而是认真在回答一个老问题:开源大模型到底能不能既强又能跑。这比单纯堆参数更接近产业现实。

性能实测:小模型如何挑战大模型?

如果只看结构,Gemma 4 已经很会讲故事;真正决定它是不是“纸面强者”的,还是实验。报告里最值得看的不是某个单项分数,而是小模型在多个维度上同时追近甚至超过上一代大模型
插图
表1:Gemma 4 不同模型的参数量、编码器与 drafter 配置。可以看到,模型并不是简单按参数堆叠,而是按任务和硬件约束做了差异化设计。
插图
表2:Arena Text 人类偏好评测结果。Gemma 4 31B 在开源密集模型中位居前列,说明它不仅是“自嗨型强”,而且在人类侧评里也站得住。
先看文本。Table 5 里,Gemma 4 31B 在 MMLU Pro、AIME 2026、LiveCodeBench、Codeforces Elo、GPQA Diamond 等任务上都明显优于 Gemma 3 27B。最扎眼的是代码和高难推理相关指标,提升幅度非常实在。尤其是 Codeforces Elo 从上一代的三位数直接跳到 2000+,这类变化说明它不是“会说话”,而是更会拆题、推导和写代码了。
插图
表3:Gemma 4 与 Gemma 3 27B 的综合基准对比。31B 版本在几乎所有文本任务上都更强,E2B 甚至能用更少参数逼近旧款大模型的水平。
更有意思的是,小模型并没有被牺牲掉。E2B 大约用 10 倍更少的参数,表现却接近 Gemma 3 27B;E4B 在视觉任务上甚至能全面压过上一代同级模型。这里的逻辑很清楚:不是所有收益都来自参数数量,架构和训练方式才是大头。如果训练管线和推理设计足够好,小模型也能做得很能打。
插图
表4:视觉基准结果。Gemma 4 在多项视觉问答和文档理解任务上显著超过上一代,说明“思考模式”并不只对纯文本有用,视觉理解同样吃这一套。
视觉任务里,Gemma 4 31B 在 MMMUPro、MATH-Vision、InfographicVQA 等任务上都比 Gemma 3 27B 更强,尤其是文档类和信息图类任务,说明它对复杂版式、图文混排和细粒度视觉推理更有把握。这个结果和前面提到的思考模式是互相呼应的:图像理解不是单纯“看见像素”,而是要把视觉内容翻译成可推理的结构化信息。
插图
表5:长上下文与检索类任务结果。Gemma 4 在 32k 和 128k 场景下都保持了很强的稳定性,说明前面那套 KV cache 优化不是纸上谈兵。
音频侧也不弱。Table 7 和 Table 8 显示,Gemma 4 在 CoVoST 翻译和 FLEURS 语音识别上,相比对应规模的 Gemma 3n 有稳定提升,而且 12B 版本甚至不依赖专门音频编码器,也能拿到有竞争力的表现。这里最值得记住的是:更轻的架构没有拖垮性能,反而把存储和延迟一起压下来了。
插图
表6:音频任务结果。Gemma 4 在翻译和识别上都优于上一代对应规模模型,同时音频编码器体积还大幅缩小,属于“瘦身但不掉队”的典型案例。
长上下文部分也很有说服力。Table 9 里,Gemma 4 在 RULER、LOFT、GraphWalks、MTOB 等任务上对 Gemma 3 有明显提升,尤其在 128k 这种长上下文场景里,依然能保持较高准确率。这说明它不仅“能塞进去”,还真的“能记住、能用上”。对需要长文档分析、代码仓库理解、客服知识库检索的场景,这一点非常关键。

开源与安全:Gemma 4的全方位承诺

Gemma 4 的另一个现实意义,是它把“开源”这件事做得更像产品,而不是口号。报告明确强调了 Apache 2.0 许可、量化版本、端侧友好设计,以及对安全和责任的系统性处理。对于开发者来说,这意味着不是只能看论文流口水,而是真的有机会拿来改、拿来跑、拿来部署。
安全部分没有讲虚的。Gemma 4 在训练前后都做了数据过滤,尽量剔除隐私、毒性、错误自我识别等内容;评测时也强调在不加安全过滤的情况下测试模型原生行为,以便更真实地看清风险边界。报告里明确提到,模型在安全测试中较前代有明显改进,同时不必要的拒答保持较低。这个平衡其实很难,很多模型要么太松,要么太怂,Gemma 4 至少在这个维度上没有摆烂。
不过也得说句实话:Gemma 4 的强项主要还是“工程整合能力”。它不是那种单独发明一个全新范式、让整个领域改写教材的工作,而是把思考模式、多模态、长上下文、量化、MTP、无编码器这些成熟或半成熟组件,做了一个很完整、很能落地的系统拼装。这个价值不小,但也意味着它的创新更偏“体系化优化”,而不是某个点上的惊天一刀。
如果把 Gemma 4 放到行业里看,它传递的信号很明确:未来开源模型的竞争,不再只是“谁更大”,而是谁能在有限算力下,把能力、速度、内存和安全一起做好。这类工作对普通从业者的意义也很直接——真正可用的模型,往往不是最会刷榜的那个,而是最能稳定进系统的那个。
插图
图5:长上下文性能对比图。Gemma 4 在 32k 和 128k 场景下都保持了较高准确率,说明其注意力与缓存优化确实有效。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文解决什么问题? 它解决的是“开源多模态模型怎么同时做到更强、更省、更能部署”。Gemma 4 不只提升文本、图像、音频能力,还专门处理了长上下文、量化和推理速度问题。

“思考模式”到底是什么意思? 就是模型在正式回答前,先生成一段中间推理过程,也叫 reasoning trace。它的作用是让模型在数学、代码和复杂问答里少犯低级错误,但也会带来一定输出开销。

无编码器架构为什么重要? 因为它把视觉和音频输入直接投影到 LLM 空间,省掉了大编码器带来的参数、显存和碎片化问题。代价是训练和输入表示要更精细,但一旦做稳,部署会轻很多。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆

创新点不属于“凭空开宗立派”,但把思考模式、长上下文优化、无编码器多模态、MTP 和量化感知训练系统性整合,工程完成度很高。

实验合理度:★★★★☆

对比覆盖文本、视觉、音频、长上下文和人类偏好评测,且与上一代 Gemma 3 / 3n 的对照清晰,能说明设计确实起作用。

学术研究价值:★★★★☆

对开源多模态、推理模式、长上下文和端侧部署都有参考价值,属于能给后续工作提供系统模板的那类报告。

稳定性:★★★★☆

从报告看,模型在多项基准上表现稳定,但无编码器和强量化路线对训练、输入质量和硬件实现仍有要求。

适应性以及泛化能力:★★★★☆

文本、图像、音频和长上下文都覆盖到了,泛化面不错;但真正落地时仍要看具体场景的数据分布和延迟约束。

硬件需求及成本:★★★★☆

相较同级大模型更友好,QAT、MTP 和缓存优化都在为部署省钱;但大版本训练和推理仍然不是轻量设备能随便吃下的。

复现难度:★★★☆☆

模型已开源,但训练细节、数据清洗和系统级优化不少,完整复现不算轻松。

产品化成熟度:★★★★☆

量化版本、开源许可和多模态能力都很实用,已经接近可部署形态;但高安全要求场景仍需额外策略和评测。

可能的问题:更像系统工程整合型成果,单点原创性不算极强;无编码器和低比特路线对训练稳定性与硬件实现要求高。


主要参考文献

Gemma Team. Gemma 4: Technical Report. arXiv, 2026.
W.-L. Chiang et al. Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. 2024.
B. Jacob et al. Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference. CVPR 2018.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
Gemma 4把“会说”升级成“会想”,还顺手把多模态、长上下文和端侧效率一起拎起来了。想看开源模型怎么把性能、速度和内存三件事同时平衡,进群继续聊,别让好论文只停留在标题里。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。