LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12787 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:多模态

共 200 篇
盲人用电脑有多难?Stony Brook最新研究:AI助手成功率仅52.5%,理想与现实差距有多大?
视觉与图像

盲人用电脑有多难?Stony Brook最新研究:AI助手成功率仅52.5%,理想与现实差距有多大?

当全世界都在卷Agent能力时,这篇由Stony Brook University和Old Dominion University合作的论文,罕见地将目光投向了最容易被忽视的用户群体——盲人。它用一份扎实的、基于真实世界1258条指令的实证数据,狠狠给“无所不能”的计算机使用代理(CUA)泼了盆冷水:最强模型成功率也仅52.5%。

视频推荐只会"哪里相关"?反事实测试揭开"是否真有证据"的谎言
视觉与图像

视频推荐只会"哪里相关"?反事实测试揭开"是否真有证据"的谎言

推荐系统平时只知道"你爱看什么",却说不清"视频里哪一秒、哪个画面真正打动你"。这篇论文设计了一套反事实测试:把证据片段替换掉,看模型还坚不坚持原先的判断。结果扎心——不少模型定位很准,但证据判断相当糊弄。值得所有做视频推荐、时间定位和可解释推荐的读者一读。

UW最新研究:VLM+MR给路痴导航,场景识别提升22%
视觉与图像

UW最新研究:VLM+MR给路痴导航,场景识别提升22%

方向感差不是智商问题,而是注意力投错了地方。这篇论文用20人的VR眼动实验抓出了路痴和认路高手的本质差异,再把这个差异翻译成VLM提示词,做成了混合现实导航系统——直接让场景识别率提升22%,地标回忆数量翻倍。导航软件终于开始考虑“让你记住路”而不是“替你走完路”了。

发票拍照总翻车?华南理工精准恢复关键区域,让文档问答更靠谱
视觉与图像

发票拍照总翻车?华南理工精准恢复关键区域,让文档问答更靠谱

拍文档照片最怕什么?阴影、模糊、歪斜、摩尔纹——哪怕是最强多模态模型也会当场翻车。直接拿恢复工具全图修一遍?可能越修越糟糕。华南理工这篇论文给了个聪明的解法:让模型自己判断“现在能不能答”,不能答再精准修复,修坏了还能自动回滚。全程免训练,效果逼近人类专家。

图像恢复|天津大学ZVRM:零样本视频修复提速近3倍,时序闪烁减八成
视觉与图像

图像恢复|天津大学ZVRM:零样本视频修复提速近3倍,时序闪烁减八成

又一篇零样本视频修复的狠活。天津大学团队把文本到图像扩散模型用出了花:不用训练就能修视频,还支持文本、图像两种参考输入,推理速度直接砍到三分之一,时序一致性指标WE降到原来的五分之一。被视频闪烁折磨过的同学,这篇值得重点研究。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球