LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12820 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:大视觉语言模型

共 101 篇
中山大学最新研究:让自动驾驶先“脑补”未来,再“反思”轨迹,4B模型SOTA效果亮眼8B
视觉与图像

中山大学最新研究:让自动驾驶先“脑补”未来,再“反思”轨迹,4B模型SOTA效果亮眼8B

大多数自动驾驶模型都是“一条路走到黑”,直接生成轨迹,却不知道这轨迹未来会导出什么结果。中山大学等机构提出的IRR-Drive模型,让智能体先“预设意图”,再通过预测未来BEV可视化地“反思”一遍,最后才修正轨迹。这种做法在NAVSIM v1/v2两个权威榜单上都拿到SOTA,而且仅用4B参数就能干翻不少8B模型,性价比拉满。

CVPR 2026:当降熵成为陷阱,SPOT-E用锚点保住证据
视觉与图像

CVPR 2026:当降熵成为陷阱,SPOT-E用锚点保住证据

大模型能说会道,但遇到要细看图表、小字的地方,经常"看走眼"还"自信满满"。孙海伦团队从"答案熵"入手,发现模型在不确定时会表现出更高熵值,但盲目降熵反而让模型走上捷径。SPOT-E巧妙设计了一个视觉"聚光灯",配合强化学习,只调光照不调模型,让GPT-4o和开源模型在多个密集证据任务上获得稳定提升,思路清奇又实用。

北卡罗来纳大学夏洛特分校最新研究,ACE模块让VLM调用减少75%
视觉与图像

北卡罗来纳大学夏洛特分校最新研究,ACE模块让VLM调用减少75%

长视频问答(LVQA)一直是个“烧钱”的活,把一小时的视频全喂给大视觉模型,光是token就能上百万。而TIMEPROVE给出的策略很聪明:先派轻量级的动作检测器去“探路”,生成几个高概率的答案假设,最后才让大模型去“拍板”验证。结果呢?效果涨了7.3%,成本却降了93%。这种“先猜后验”的思路,值得每个做视频理解的人关注。

仅用7%成本就吊打全场?北卡大学提出TIMEPROVE,让长视频问答学会“先找证据再说话”
视觉与图像

仅用7%成本就吊打全场?北卡大学提出TIMEPROVE,让长视频问答学会“先找证据再说话”

长视频问答一直是个“贵”且“难”的活儿——处理一小时视频,光视觉token就超200万。北卡大学夏洛特分校的TIMEPROVE,提供了极其优雅的解决思路:先用轻量级的动作检测模块“侦察”出关键证据片段,再只把这些精挑细选的短片段送给VLM做“终审”。结果准确率涨了7.3%,VLM调用次数锐减75%,推理成本暴跌93%!这简直就是给LVQA这个“烧钱”领域的一

新范式!腾讯等把问题“写”在图片上,7B模型碾压GPT-4o,VMCBench夺冠!
视觉与图像

新范式!腾讯等把问题“写”在图片上,7B模型碾压GPT-4o,VMCBench夺冠!

多模态大模型推理时总“走神”答非所问,主要原因是文本指令和图像位置对不上号。这篇腾讯等联合完成的工作Timage,用了个极聪明的解法——直接把问题当作文字水印“写”在图片的恰当位置,让模型一眼就能看到该看的地方。效果惊人,7B小模型在VMCBench上干翻了GPT-4o,还不需要任何微调!

告别VAE解码瓶颈!让生成器自己当评委,视频对齐又快又准
视觉与图像

告别VAE解码瓶颈!让生成器自己当评委,视频对齐又快又准

继2026年6月推过AVDM2、DenseDPO等视频生成加速和对齐方法后,今天这篇城大新作PRISM,直接把视频生成模型本身变成了最懂行且最快速的“评委”。以往用大视觉语言模型当裁判,又慢又贵,还得等视频全生成完。PRISM反其道而行之,冻结生成模型,在满是噪声的潜伏空间里就能精准打分,还能在生成早期就淘汰烂片,推理提速7.6倍。这波操作,值得所有做视频生

NUS新方法给VLM配探照灯:GPT-4o、Gemini看图提升2-6个点
视觉与图像

NUS新方法给VLM配探照灯:GPT-4o、Gemini看图提升2-6个点

你遇到过吗?让VLM读个图表或者扫描PDF,模型说得头头是道:“我要先看y坐标然后对比...”结果最后答案错得一塌糊涂! 这不是推理能力不行,是 证据没入眼 。今天聊的NUS新研究SPOT-E,用一招「熵塑形」给VLM搭了个探照灯,冻结主干模型不用训,直接让GPT-4o、Gemini看图能力上一个台阶~

32.7%提升背后:VLM+规则工具箱混合评估新范式
视觉与图像

32.7%提升背后:VLM+规则工具箱混合评估新范式

自动驾驶评估就像考试打分。传统规则死板,遇到避让、绕行等“合理违章”就给负分;纯VLM评估虽有上下文理解,却难胜任精细安全判断。英伟达团队这次祭出杀手锏—— DriveJudge ,让VLM当“考官”,根据场景决定哪些规则该用、哪些该放一马,既保住了规则的物理严谨,又拿捏了上下文的柔性。看完绝对拍大腿:这才是评估该有的样子!

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球