港中文·微众AI等提出SinkPruner:先清注意力“下水道”再精剪
想要看懂SinkPruner,得先搞清楚一件事:多模态大模型(Multimodal Large Language Models,MLLM)里,最烧钱的其实不是“看”,而是“看完之后怎么记、怎么算”。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
想要看懂SinkPruner,得先搞清楚一件事:多模态大模型(Multimodal Large Language Models,MLLM)里,最烧钱的其实不是“看”,而是“看完之后怎么记、怎么算”。
想象一下这样的场景:医院的影像科里,一张胸部X光片总是和病历表格里那串诊断代码、年龄、性别等信息绑在一起出现。
当全世界都在卷Agent能力时,这篇由Stony Brook University和Old Dominion University合作的论文,罕见地将目光投向了最容易被忽视的用户群体——盲人。它用一份扎实的、基于真实世界1258条指令的实证数据,狠狠给“无所不能”的计算机使用代理(CUA)泼了盆冷水:最强模型成功率也仅52.5%。
想搞清空心阴极灯里原子蒸气到底有多密、有多热?杜伦大学这篇把银原子吸收谱从“经验判断”变成了“定量可算”。模型简单、拟合漂亮、代码开源,对做原子物理、量子传感、激光稳频的读者来说是个不错的参考样板。
推荐系统平时只知道"你爱看什么",却说不清"视频里哪一秒、哪个画面真正打动你"。这篇论文设计了一套反事实测试:把证据片段替换掉,看模型还坚不坚持原先的判断。结果扎心——不少模型定位很准,但证据判断相当糊弄。值得所有做视频推荐、时间定位和可解释推荐的读者一读。
一堆AI医生会诊,居然还会“抱团跑偏”?把肺癌晚期患者往肿瘤科一推,完全无视血氧已经掉到危险线。华南理工等机构最近祭出新框架MASGR,把松散群聊升级成结构化推理图,再请来“仲裁官”把关,转诊准确率一口气顶到95.3%。
方向感差不是智商问题,而是注意力投错了地方。这篇论文用20人的VR眼动实验抓出了路痴和认路高手的本质差异,再把这个差异翻译成VLM提示词,做成了混合现实导航系统——直接让场景识别率提升22%,地标回忆数量翻倍。导航软件终于开始考虑“让你记住路”而不是“替你走完路”了。
视频生成卷到今天,画面早就不稀奇了,但大部分模型要么不出声,要么声音是后期硬贴上去的。阿里DreamX团队直接把声音和画面“打包生成”,还只用了7B参数就敢对标22B/33B的大块头,并且开源了2K精炼器,值得想搞多模态生成的朋友细品。
拍文档照片最怕什么?阴影、模糊、歪斜、摩尔纹——哪怕是最强多模态模型也会当场翻车。直接拿恢复工具全图修一遍?可能越修越糟糕。华南理工这篇论文给了个聪明的解法:让模型自己判断“现在能不能答”,不能答再精准修复,修坏了还能自动回滚。全程免训练,效果逼近人类专家。
大模型靠语言"封神",但如果视觉才是通往AGI的真路呢?OpenAI、DeepMind、斯坦福等21位学者联合发布白皮书,正面挑战"语言中心主义"——看完这篇,你对AGI路径的理解可能要重构。
当开源视频数据集还在几百万视频级别徘徊时,LAION直接把数字拉到了8000万视频、1000万小时,还一口气验证了视频、音频、图像三种模态的预训练效果。这种级别的数据弹药,对做多模态研究的团队来说,值得好好研究。
又一篇零样本视频修复的狠活。天津大学团队把文本到图像扩散模型用出了花:不用训练就能修视频,还支持文本、图像两种参考输入,推理速度直接砍到三分之一,时序一致性指标WE降到原来的五分之一。被视频闪烁折磨过的同学,这篇值得重点研究。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球