LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12851 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:多模态

共 200 篇
Fraunhofer研究所新作:用「概念流树」替代扁平瓶颈,信息泄露减少40%!
视觉与图像

Fraunhofer研究所新作:用「概念流树」替代扁平瓶颈,信息泄露减少40%!

概念瓶颈模型(CBM)一直在“可解释性”与“信息泄露”间走钢丝——模型学会用“车门”、“挡风玻璃”来识别猫?Fraunhofer研究所这篇论文用“层次化决策树”把概念空间拆成多个局部子空间,让每个预测只走自己的专属路径,从根本上堵死了信息泄露的后门!效果还跟平铺直叙的CBM不相上下。

CVPR 2026接收!QR-Prompt把残差变提示,少样本增量学习性能飙升
视觉与图像

CVPR 2026接收!QR-Prompt把残差变提示,少样本增量学习性能飙升

少样本增量学习(FSCIL)一直是个“鱼和熊掌”都想兼得的难题,既要记住旧知识,又要快速学会新类别。CVPR 2026的这篇QR-Prompt,把VLM的残差特征做成“小纸条”,既稳定又灵活,在三个基准数据集上都刷了新SOTA。对于搞小样本、增量学习的朋友,这篇是必读品了。

机器人视觉新范式:不再看图识字,而是看“手”学动作
视觉与图像

机器人视觉新范式:不再看图识字,而是看“手”学动作

传统视觉编码器(如CLIP、DINOv2)再强大,也是用猫狗图片、风景照训练的,它根本不知道“抓杯子”需要看哪儿。这篇UC Berkeley和NVIDIA的CAIP,用地表最强的“人类第一人称操作视频”(Ego4D等)作为训练数据,让视觉编码器学会了看“手”和“物体接触点”。这招“用人类手部姿态代理机器人动作”,直接让灵巧操作任务成功率飙升30%,而且抗干扰

40%任务效率提升!重庆大学提出ExS2D:零双臂数据训练双臂机器人
视觉与图像

40%任务效率提升!重庆大学提出ExS2D:零双臂数据训练双臂机器人

想让家里的扫地机器人帮你搬桌子?想给它找俩搭子?这篇重庆大学的新研究带来一个“骚操作”:让你的单臂机器人不用练习,直接点亮“双打”天赋。不需要昂贵耗时的双臂演示数据,它们通过一个精巧的层次化框架,就让机器人自己学会左右开弓。一句话总结:白嫖单臂数据,通吃双臂任务。🤚

告别Sora幻觉,数据视频进入可编辑时代
视觉与图像

告别Sora幻觉,数据视频进入可编辑时代

做汇报还在手动敲PPT、剪GIF动图?港科广的DataMagic直接端到端解决:上传表格+一句话,自动生成带配音、动画、配乐的数据故事视频。新引入的DVSpec规范确保图表和数据的绑定关系一清二楚,再也不用担心AI“算错”数字。更香的是,这还是个“能编辑的视频”,直接划界面改图表、抠文本,甚至指点AI加新镜头,整个数据呈现流程变得前所未有的丝滑。

新范式!腾讯等把问题“写”在图片上,7B模型碾压GPT-4o,VMCBench夺冠!
视觉与图像

新范式!腾讯等把问题“写”在图片上,7B模型碾压GPT-4o,VMCBench夺冠!

多模态大模型推理时总“走神”答非所问,主要原因是文本指令和图像位置对不上号。这篇腾讯等联合完成的工作Timage,用了个极聪明的解法——直接把问题当作文字水印“写”在图片的恰当位置,让模型一眼就能看到该看的地方。效果惊人,7B小模型在VMCBench上干翻了GPT-4o,还不需要任何微调!

告别VAE解码瓶颈!让生成器自己当评委,视频对齐又快又准
视觉与图像

告别VAE解码瓶颈!让生成器自己当评委,视频对齐又快又准

继2026年6月推过AVDM2、DenseDPO等视频生成加速和对齐方法后,今天这篇城大新作PRISM,直接把视频生成模型本身变成了最懂行且最快速的“评委”。以往用大视觉语言模型当裁判,又慢又贵,还得等视频全生成完。PRISM反其道而行之,冻结生成模型,在满是噪声的潜伏空间里就能精准打分,还能在生成早期就淘汰烂片,推理提速7.6倍。这波操作,值得所有做视频生

NUS新方法给VLM配探照灯:GPT-4o、Gemini看图提升2-6个点
视觉与图像

NUS新方法给VLM配探照灯:GPT-4o、Gemini看图提升2-6个点

你遇到过吗?让VLM读个图表或者扫描PDF,模型说得头头是道:“我要先看y坐标然后对比...”结果最后答案错得一塌糊涂! 这不是推理能力不行,是 证据没入眼 。今天聊的NUS新研究SPOT-E,用一招「熵塑形」给VLM搭了个探照灯,冻结主干模型不用训,直接让GPT-4o、Gemini看图能力上一个台阶~

上海交大最新研究:多设备智能体执行失败,真的不用全局重规划?
视觉与图像

上海交大最新研究:多设备智能体执行失败,真的不用全局重规划?

多设备协同的AI智能体,一张发票报销就能牵扯出手机、电脑、多个在线系统。一旦CPU烧了、网络崩了,传统方案就是粗暴“全部重来”。上海交大这项研究告诉你,根本不需要!分层恢复,小毛病本地解决,大毛病再上全局判断,这才是智能体该有的“情商”。

DeepMind最新警告:AI越强越不合作?揭秘“唯我论”超级智能的隐患
视觉与图像

DeepMind最新警告:AI越强越不合作?揭秘“唯我论”超级智能的隐患

DeepMind终于出手,这次不谈算力,不聊模型,而是直接戳中了整个AI领域的“灵魂痛点”——我们的AI,从根上就不懂合作。这篇论文像一盆冷水,泼醒了还在疯狂堆数据、跑benchmark的各位同行。它告诉我们,超级智能的关键不在于“多强”,而在于“多合群”。不适合在“唯我独尊”的范式下闭门造车的研究者都该读读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球