广工等三校提出RVSD:剪掉67%视觉token,视觉大模型反而更少幻觉
大型视觉语言模型(LVLMs)的视觉幻觉问题,本质上是个“看图说话翻车现场”——模型明明没看见那个物体,却说得言之凿凿。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
大型视觉语言模型(LVLMs)的视觉幻觉问题,本质上是个“看图说话翻车现场”——模型明明没看见那个物体,却说得言之凿凿。
让AI准确渲染又长又密的文字,是图像生成的“最后一公里”。复旦携手小红书放出一招“位置锚定”新设计,把文字准确率直接拉高一大截,海报再密也不怕了。
当思维链还在“一字一句”硬凹推理时,这篇论文直接让冻结的LLM在“脑内”用向量打草稿。仅训练1130万参数,就在符号推理上把零样本思维链拉高26.7个点,推理延迟还更低。是时候重新审视“推理必须说出口”这个前提了。
想要看懂SinkPruner,得先搞清楚一件事:多模态大模型(Multimodal Large Language Models,MLLM)里,最烧钱的其实不是“看”,而是“看完之后怎么记、怎么算”。
模型总爱“看背景下菜碟”?哈工大团队提出SAGE,不靠任何人工标注,用聚类子标签驱动扩散模型定向补数据,直接把最差组精度拉到89.5%,专治各种“背景骗局”。
拍完夜景想发朋友圈,结果暗部一团黑、亮部还偏色?这篇新南威尔士大学的工作把分块扩散模型玩出了新花样:分块尺寸随时间步渐进增大,既保住局部细节又协调全局亮度,4K图像推理提速80倍,显存仅需8.8GB,简直是低光增强领域的"效率控"福音。
1985年,Hillas提出了一套简洁的图像参数化方法,将切伦科夫相机记录的光斑压缩成长度、宽度、大小、方向等参数。这套方法高效,被IACT数据分析沿用至今。
传统生成式检索有个"中看不中用"的槽点:每个语义ID都要逐层解码,重型Transformer要在线跑好几遍,工业场景根本扛不住。中国科大联合美团提出CHAP,把多步解码压成单次Transformer加轻量残差块,线上A/B测试支付订单量直接涨了2.98%,看完只想说一句:这才是能落地的检索新范式。
这篇论文精准踩中当前视觉领域两大热点:Mamba架构与遥感显著目标检测。南京大学团队用“平滑-细节分治”的思路,把局部Mamba留给浅层细节、全局Mamba留给深层语义,配上门控跨尺度融合,在三大基准上全面刷新SOTA,窄目标F指标涨幅直接冲到1.46个百分点。代码已开源,适合想做遥感分割、结构保持任务的读者直接复现上手。
先聊一个很多人每天都会碰到、但完全没意识到的问题:你手机相册里那一张张照片,绝大多数都是JPEG格式。JPEG为什么能统治世界这么多年?因为它用一个巧妙的"分块变换+量化"策略,用很小的体积换来了还算能看的画质。
全心脏分割( Whole-Heart Segmentation,WHS )是医学影像分析中的一项经典任务:给定一张心脏区域的CT或MRI扫描图,模型需要把七个关键结构完整勾画出来——左心室心肌( Myocardium,M。
继大模型推理能力在数学、代码领域大杀四方之后,法国索邦大学与SYSTRAN团队把「思考」带进了机器翻译:让模型先从检索到的相似示例里精准切出可复用的平行片段,再动笔翻译。实验覆盖6种语言16个领域,BLEU、COMET与MetricX全面超越传统k-shot与草稿式推理,思路清奇且落地性强,值得每一位NLP从业者细读。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球