Google DeepMind最新Gemma 4:31B冲上开源榜前列
Gemma 4最有意思的地方,不是单纯把参数做大,而是把“思考模式”、长上下文效率、无编码器多模态和量化推理一起打包了。开源模型里这种“性能、效率、部署”三线并进的做法,确实值得认真看。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
Gemma 4最有意思的地方,不是单纯把参数做大,而是把“思考模式”、长上下文效率、无编码器多模态和量化推理一起打包了。开源模型里这种“性能、效率、部署”三线并进的做法,确实值得认真看。
这篇论文最有意思的地方,不是又训练了一个奖励模型,而是把“奖励”这件事倒过来做了:让预训练多模态大模型回读提示词,看图能不能把原话读回来。结果很直接——不用偏好标注,不用再养模型,照样能把文生图强化学习带起来。
医学分割最难的不是“切得准”,而是“接口太多”。这篇论文把视觉示例、点框交互、文本指令和2D/3D影像统一到一个Transformer序列里,思路很硬,工程味也很足。
Apple Music 的搜索问题很典型:热门词好搜,长尾、拼写错误、跨语言查询最难办。ELISE 的厉害之处不在“模型更大”,而在于把语义召回、旧词项检索和分布校准接到一起,最后还真在全球线上实验里把转化率和无结果率一起打下来了。
这篇论文最有意思的地方,不是又堆了多少花活,而是把小型视觉语言模型的“考试成绩”拆成了两件事:先能不能把答案写出来,再谈会不会想。结果很不客气——很多提升其实来自解析格式和 token 预算,不是复杂搜索。
这篇论文最有意思的地方,不是把机器人“说得更像人”,而是先承认一件很现实的事:顾客很多时候根本没开口,机器人却已经该接话了。15.3%的回应由无声动作触发,这个数字很扎眼,也很适合拿来反思纯语音对话系统的盲区。
这篇论文把一个很现实的问题挑明了:多模态大模型不是不会说细节,而是细节一多就更容易“翻车”。GRANFACT、层级评测和RP-DPO三件套,正好把“说得更细”和“说得更准”这对老冤家拎到台面上狠狠干一架。
自动驾驶最怕的不是“不会开”,而是“开错了还直接上路”。这篇 DriveVer 很有意思:不重训大模型,偏偏把活放到测试时做二次验证和修正,34M 参数、80ms 推理,工程味很足。
多模态大模型最烦的,不是不会想,而是训练时偷看答案、推理时却只能裸奔。AMVL直接把这个“作弊窗口”堵上,用双向KL同时管住先验和后验,思路很硬,实验也够实在。
Pocket FM这篇不是单纯“让模型会写故事”,而是把“角色怎么想、世界发生了什么、下一步该往哪走”拆成一套闭环系统。更关键的是,Atlas 还专门负责抓长篇里的情节打脸,终于不是只会写,连自查也安排上了。
热成像检测最烦的不是“看不见”,而是“看见了也不知道它叫什么”。这篇 Thermal-Det 直接把开放词汇、语言引导和跨模态蒸馏塞进热成像里,还真把零样本检测做出了像样的结果,属于能落到真实场景的那种活儿。
这篇论文最有意思的地方,不是“又做了一个剪枝”,而是把ViT到底在看什么这件事,往因果层面往前拽了一步。它不靠重训,直接定位并切掉那些专门走背景捷径的注意力头,思路很狠,实验也够硬。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球