广工等三校提出RVSD:剪掉67%视觉token,视觉大模型反而更少幻觉
大型视觉语言模型(LVLMs)的视觉幻觉问题,本质上是个“看图说话翻车现场”——模型明明没看见那个物体,却说得言之凿凿。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
大型视觉语言模型(LVLMs)的视觉幻觉问题,本质上是个“看图说话翻车现场”——模型明明没看见那个物体,却说得言之凿凿。
写代码时如果发现bug,你会不会把错误日志贴到代码最前面,一边看一边改?清华与Z.ai这篇新作就是干这个的:让大模型先自己想一遍,把推理草稿提到长正文前面再来一次,GraphWalks上准确率直接从29.2%飙到81.8%!
扩散模型天天做图,这次被一位独立学者硬生生掰成了MCMC全局采样器。不用变分目标,只靠标准去噪训练加一堆MALA样本,就能在550维贝叶斯后验上实现跨模式跳转,冷启动一两轮直达平衡区。这事儿有意思,值得一读。
EEG基础模型已经多到“选择困难”,但这篇论文发现:没有哪个基座模型能对所有脑电样本通吃。昆山杜克大学提出的EEG-AS把模型选择做成逐样本的智能决策,推理时只跑一个轻量锚定模型,却能隔空猜测其他所有基座模型的预测行为,平均准确率从53.7%飙到66.9%。做脑电基座模型部署、神经解码评测的朋友值得一读。🎯
当思维链还在“一字一句”硬凹推理时,这篇论文直接让冻结的LLM在“脑内”用向量打草稿。仅训练1130万参数,就在符号推理上把零样本思维链拉高26.7个点,推理延迟还更低。是时候重新审视“推理必须说出口”这个前提了。
想要看懂SinkPruner,得先搞清楚一件事:多模态大模型(Multimodal Large Language Models,MLLM)里,最烧钱的其实不是“看”,而是“看完之后怎么记、怎么算”。
大模型的"三好学生"人设,一换语言就崩?麦考瑞大学等机构给乌尔都语做了套"文化体检",人工逐句改造三大经典对齐基准,结果GPT-4o-mini的诚实度直接掉了20个百分点,安全护栏也形同虚设。🤚
要说清楚这篇论文在解决什么问题,得先从一张血管造影图说起。
东北大学提出RegionCache,专治多轮图像编辑的重复计算病:连续编辑轮次中平均81%-92%区域根本不变,却每次都把整张图重新生成一遍。RegionCache用跨注意力把“没变的语义”映射到“没变的区域”,直接复用缓存隐藏状态,只重算真正被改的地方,在PixArt-α上拿到1.43-2.55倍端到端加速,画质基本不掉。有代码,值得跑一跑。
视频生成卷到今天,画面早就不稀奇了,但大部分模型要么不出声,要么声音是后期硬贴上去的。阿里DreamX团队直接把声音和画面“打包生成”,还只用了7B参数就敢对标22B/33B的大块头,并且开源了2K精炼器,值得想搞多模态生成的朋友细品。
高棉语这种低资源小语种,连词与词之间都没有空格,OCR完还得单独做分词。这篇论文直接端到端二合一,一个CTC解码器同时吐字符和词边界,合并任务延迟大幅下降,精度还不掉队。低资源语言NLP的工程落地,值得一看。
1985年,Hillas提出了一套简洁的图像参数化方法,将切伦科夫相机记录的光斑压缩成长度、宽度、大小、方向等参数。这套方法高效,被IACT数据分析沿用至今。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球