广工等三校提出RVSD:剪掉67%视觉token,视觉大模型反而更少幻觉
大型视觉语言模型(LVLMs)的视觉幻觉问题,本质上是个“看图说话翻车现场”——模型明明没看见那个物体,却说得言之凿凿。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
大型视觉语言模型(LVLMs)的视觉幻觉问题,本质上是个“看图说话翻车现场”——模型明明没看见那个物体,却说得言之凿凿。
模拟存内计算(CIM)这几年在AI硬件圈几乎成了“低功耗加速器”的代名词:它把矩阵向量乘法直接塞进存储阵列内部,省掉了芯片上最烧钱、最耗电的数据搬运,用来跑需要几十上百次迭代的扩散模型,理论能效相当诱人。
让AI准确渲染又长又密的文字,是图像生成的“最后一公里”。复旦携手小红书放出一招“位置锚定”新设计,把文字准确率直接拉高一大截,海报再密也不怕了。
当所有文生图评测还在卷画质和指令跟随,UIUC这次直接把“答案藏在图里”的推理题丢给模型。2000道题、9个主流生成模型,最强Gemini 3 Pro也只拿64.6分。想看生成模型到底有多少“真推理”,这片试金石值得收藏。
大模型生成视频"看起来美,动起来假"的顽疾有解了。这篇来自四川大学的工作,不去堆算力,而是给视频生成装上"物理事件链"大脑,用可量化的物理公式约束每个中间状态,在PhyGenBench上把物理贴合度均值提升到72.5%,值得做视频生成与世界模型的朋友细读。
每次看到给医学图像分割加文本引导的工作,龙哥都会问一句:那行文字到底起多大作用?这篇论文用5个预训练医学视觉语言模型和4种融合算子做了系统性交叉实验,还提出一个轻量诊断工具做证据解耦,把“换融合头不涨点、去文本却崩盘”这类反直觉现象掰开揉碎了讲清楚,值得做多模态医学影像的读者花几分钟细读。
一个韩国人用中文说“昨天吃了sushi”,sushi到底该按中文腔读还是日文原味读?首尔大学这篇论文,专治语音合成里的“中英混读尴尬症”:不加训、不加模块,光靠推理阶段的巧劲,就能让夹在句子里的外语短语瞬间回到母语腔。
跨本体泛化是VLA从“会干活”走向“干得了所有机器人”的必经关卡,但“零样本”这个词在圈里长期被用得很随意。本论文用严格受控的基准把四种本体变化拆开细测,给出可复现的量化结论:换表征涨15个点、扩源多样性涨18个点、仅5%目标本体预训练数据再涨13.4个点。做机器人的朋友读完能少走不少弯路。
视频流一帧一帧地来,模型能不能不串号、不手抖、不跟丢?西安交大联合EngineAI提出TempoGround,让视觉语言模型在流式输入下连续输出稳定的2D/3D框,3D精度平均提升7.5。这套“状态感知课程预测+强化学习”的组合拳,值得做具身智能和多模态感知的同学认真看一眼。
分东西还要分任务?谁拿了好东西,谁多干了活,算法能分得大家都别红眼吗?一群做理论的人把这事儿掰扯清楚了——给每个参与者不同"权重"时,四校联合研究终于破解了混合了吗哪的难题,首次给出通用的高效分配方法。
低剂量CT(LDCT)的临床价值不用多说——辐射剂量降低了,患者风险下来了,可图像里的噪声就上去了。泊松-高斯混合噪声趴在投影数据里,重建出来的图像出现条纹和伪影,直接影响医生下诊断。传统去噪方法靠人工先验,效果有限;
扩散模型天天做图,这次被一位独立学者硬生生掰成了MCMC全局采样器。不用变分目标,只靠标准去噪训练加一堆MALA样本,就能在550维贝叶斯后验上实现跨模式跳转,冷启动一两轮直达平衡区。这事儿有意思,值得一读。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球