大模型不需要深:一个递归技巧让数独生成器小5倍快3倍
模型大≠能力强?这篇来自洛桑联邦理工学院(EPFL)等机构的工作,直接把「递归循环」这一此前只在自回归模型里验证过的思路,正式引入了掩码扩散模型(MDM)。结果相当亮眼:一个6层Transformer循环5次,参数省5倍,模型小了,效果反而吊打30层模型!更绝的是,推理时去噪步数还能砍掉近3倍。龙哥觉得,这可能是近期最实用的模型「瘦身」思路之一。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
模型大≠能力强?这篇来自洛桑联邦理工学院(EPFL)等机构的工作,直接把「递归循环」这一此前只在自回归模型里验证过的思路,正式引入了掩码扩散模型(MDM)。结果相当亮眼:一个6层Transformer循环5次,参数省5倍,模型小了,效果反而吊打30层模型!更绝的是,推理时去噪步数还能砍掉近3倍。龙哥觉得,这可能是近期最实用的模型「瘦身」思路之一。
拼参数时代要终结了?EPFL等机构提出递归掩码扩散模型(R-MDM),让模型在每次去噪时“循环思考”多次。仅6层循环5次的模型,效果竟吊打30层大模型,推理还快了2.7倍!这不就是AI界的“以小博大”新范式吗?
越狱攻击的“流畅性”和“成功率”就像鱼和熊掌,之前的GCG虽然成功率不错但写出的后缀简直不是人话,而基于改写的方法虽然流畅却容易丢失攻击意图。普林斯顿这篇论文直接用扩散模型替代梯度,解决了这个“既要又要”的悖论,在多个模型上取得SOTA,甚至对Mistral-7B达到了100%的攻击成功率,而且能完美绕过困惑度和守卫模型检测。如果你想了解攻击的最新范式,这一
宇宙中最剧烈的伽马射线暴发,需要地球最强的“眼睛”来捕捉。CTAO就是这双眼睛,而ACADA系统则是操控这双眼睛的“数字大脑”。这篇论文详细展示了如何构建一个能管理上百台望远镜、处理每秒几十Gb数据流、并能在4秒内响应宇宙瞬变事件的超级控制软件。对于研究大型分布式系统、实时数据处理和天文信息学的读者来说,这是一份来自全球最大在建天文台的一手架构设计文档。
当VLM面对一张4K图片里的微小文字或长尾知识时,现有模型不是“看瞎了”就是“知识库不够用”。SenseSearch巧妙地把“搜索”和“裁剪”两个看似不相关的能力,通过强化学习捏合成了一个统一的推理智能体。更关键的是,它开源了所有代码和数据集,让社区可以直接复现并续写。这项工作的完成度和效果都相当扎实,值得细细品味。
一般的VLM只会当“答题机器”,这篇来自马里兰大学、UCLA和MBZUAI的工作,却让模型学会了“问问题”,而且问得越来越好。无需人工标注,模型自己就能在问答之间形成“进化闭环”,看到QG分数飙升82%,龙哥直呼过瘾。
别再被TTA4CLIP的参数更新给骗了!清华这篇论文用20多个方法的大规模实验揭开了真相:所谓的“最优”方法,其成功很少来自更强劲的梯度更新。证据的质量和与之对齐的代理才是真正的引擎。本文不仅是一次透彻的方法论剖析,更是一份帮你避开复杂优化陷阱的指南手册。
大模型多语言能力虽强,但在斯洛伐克语这种仅有500万使用者的语言上,效果会打多大折扣?本文不仅给出了教科书式的基准测试,更告诉你:通过巧妙的“词汇裁剪+定向微调”,一个仅45M参数的开源小模型就能追平商业API,这对于所有小语种研究者来说都是一剂强心针。
继2026年6月聊过AI看视频学抓瓶子后,这篇Mana又来了!UC Berkeley、CMU、斯坦福、亚马逊四家联手,把灵巧操作关节工具的难题,变成一串“动画关键帧”来解决。一分钟标注,零样本迁移,成功率高达70%!这操作,值得每个机器人从业者了解。
差分隐私模型的水分有多大?市面上多数一次运行审计方法,在把金丝雀得分拍成二值猜测时,扔掉了大量宝贵信息。这篇佐治亚理工的工作别出心裁,抓住得分序列本质上趋近高斯的特性,直接用高斯对做审计,硬是把隐私下界给翻倍了,堪称“睁眼看世界”的典范。
当你想保护自己的照片不被AI拿去“换脸”,现有方法都是在图像上加点看似“聪明”的扰动。但武大这项研究告诉你:别跟扩散模型死磕了,让它自我怀疑才是王道!一句话:用魔法打败魔法,效果直接翻三倍。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球