LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12787 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:大视觉语言模型

共 101 篇
发票拍照总翻车?华南理工精准恢复关键区域,让文档问答更靠谱
视觉与图像

发票拍照总翻车?华南理工精准恢复关键区域,让文档问答更靠谱

拍文档照片最怕什么?阴影、模糊、歪斜、摩尔纹——哪怕是最强多模态模型也会当场翻车。直接拿恢复工具全图修一遍?可能越修越糟糕。华南理工这篇论文给了个聪明的解法:让模型自己判断“现在能不能答”,不能答再精准修复,修坏了还能自动回滚。全程免训练,效果逼近人类专家。

Apple最新研究:视频推理不再"画未来",延迟降5倍+
视觉与图像

Apple最新研究:视频推理不再"画未来",延迟降5倍+

这篇来自Apple的新研究直接把“视觉思维”做进了训练:模型在训练时预测未来帧的潜在表示,推理时不再生成中间图像,端到端延迟比显式视觉CoT降低5倍以上,同时在6个评测设置上稳定超越纯文本后训练。对视频理解、实时预测和统一多模态模型感兴趣的同学值得细读。

李飞飞参与,斯坦福&Google新作:让VLM当裁判,图像压缩更懂人眼
视觉与图像

李飞飞参与,斯坦福&Google新作:让VLM当裁判,图像压缩更懂人眼

这篇论文把“谁来判断压缩图像好不好”这个老问题翻出了新花样。斯坦福和谷歌团队发现,Gemini 2.5-Flash这类通用视觉语言模型,竟然能零样本复现人眼的相似度判断,干脆把它请来当裁判,用偏好优化把扩散自编码器训得更懂人眼。结果在多个基准和上万次用户评测里直接干到第一梯队。想看看VLM怎么当评委、这条路能省多少人工标注成本?这篇值得一读。

LVLM遇模态缺失就“趴窝”?TTSD-FAR用0.629%参数把F1从0.48救回0.51
视觉与图像

LVLM遇模态缺失就“趴窝”?TTSD-FAR用0.629%参数把F1从0.48救回0.51

传感器掉线、字幕丢失、画面损坏……LVLM一遇模态缺失就肉眼可见地“降智”。这篇TTSD-FAR偏偏只更新0.629%的参数,就把50%文本缺失下的F1从趴窝的0.4785拉回0.5124,还顺手解决了持续适应的漂移问题。方法不算复杂,思路非常实用,值得所有做多模态落地的朋友读一读。

机器人也学会“先想后做”?τ₀-VLA用世界模型引导测试时计算,长时程任务成功率45%
视觉与图像

机器人也学会“先想后做”?τ₀-VLA用世界模型引导测试时计算,长时程任务成功率45%

当大模型学会“思考”后,机器人也该学学“先想后做”了。本论文把大模型里的测试时计算扩展到了机器人子任务规划中,用世界模型预测、价值模型评分、束搜索择优,让机器人在面对长时程任务时不再“走一步算一步”。四项真实世界长时程任务平均成功率45%,值得所有做机器人决策的朋友读一读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球