LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12809 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:大视觉语言模型

共 101 篇
AI · PAPER
视觉与图像

清华自进化新框架:让机器人学会自己找“坑”,失败率狂降67%!

机器人训练有个“鬼打墙”现象:数据越采越多,失败率却纹丝不动。清华这篇工作直接告诉机器人“哪里不行补哪里”——用一个轻量关键性模型引导数据采集,失败率最高降67%,还顺手解决了VLA微调的平台期问题。思路极简,效果很硬,值得一读。

AI · PAPER
视觉与图像

四大缩放维度首次系统对比:本地CUA堆算力不如“选对维度”

这篇来自汉阳大学的实证研究,把本地电脑使用代理的推理时扩展拆成上下文、时间、结构、并行四个维度逐项考察。结论有点反直觉:额外算力常常不是提升成功率,而是把失败模式从“死循环”改写成“假成功”。对做本地部署的团队来说,这是一份难得的避坑指南。

AI · PAPER
视觉与图像

哈工大等提出PRISM:让AI画画学会“看图自改”,TIFA飙至91.4%新SOTA

文生图提示优化一直是热门,但之前的方法要么只看文本要么只给分数,缺少结构化图像诊断。PRISM另辟蹊径,用一个VLM同时当裁判和教练,先看图挑毛病再针对性改提示,最后用强化学习让模型越改越好。在TIFA上从76.1飙升到91.4,关键是可解释性极强——每个修改都有理有据。

AI · PAPER
视觉与图像

GPT-5.4全剂量“虚构”,Claude词触发“看人下菜”

想象一下,你带了一张胸片给AI看病,结果图片没传上去,AI却根据你的年龄和肤色直接编了个诊断——这不是科幻,是今天这篇ICMR 2026论文的实锤发现。Claude、GPT-5.4和Gemini集体“翻车”,而且翻得很有规律:65岁白人男性=黑色素瘤,32岁黑人女性=结节病。更离谱的是,有些AI文字说“没图”,但结构化的诊断字段却填得满满当当。对AI安全感兴

AI · PAPER
视觉与图像

快手&南开RecoReward:用推荐器反馈训练描述生成,召回提升40%,推理零用户信息

这篇论文巧妙解决了多模态推荐中一个两难问题:既要利用用户行为信号优化描述,又要保持推理时纯内容生成。快手和南开提出的RecoReward用推荐器作为训练时的“裁判”,让MLLM学会生成对推荐更友好的描述,离线全面领先,在线也有实实在在的提升。思路新颖,工程上也很实用,值得做推荐系统的同学关注。

Sony AI新作:仅$2000成本,1.5B模型同时搞定图像理解与生成,SOTA还省钱!
视觉与图像

Sony AI新作:仅$2000成本,1.5B模型同时搞定图像理解与生成,SOTA还省钱!

统一多模态模型(UMM)过去要么贵得离谱(训练成本几万美元、数据上亿),要么理解与生成总得二选一。Sony AI这篇Argus-Unified直接掏出“混合视觉令牌”方案,把预训练VLM的视觉编码器冻住,只花$2000和1500万数据就训出比7B模型还强的理解能力,生成效果也不拉胯。对搞低预算落地的团队来说,这是一份很实在的参考。

AI · PAPER
视觉与图像

把代码转成图片发给AI,Token能省86%?Anthropic、OpenAI、Gemini 实测揭秘

把代码转成图片发给AI真的能省Token吗?这篇论文用675次真实API调用,把Anthropic、OpenAI、Gemini三家计费黑盒捅了个透。龙哥看完直呼:省钱是有套路,但踩坑也是一踩一个准,尤其Gemini的小代码场景能让你多掏6倍钱。搞编码助手的朋友,这篇不可不读。

9大消融实验验证:比亚迪混合世界模型凭什么成为自动驾驶新标杆
视觉与图像

9大消融实验验证:比亚迪混合世界模型凭什么成为自动驾驶新标杆

当自动驾驶世界模型还在像素级预测的"精细"与潜变量预测的"鲁棒"之间二选一时,比亚迪团队直接端出了一盘"混合大餐"——HyWorldVLA。预训练阶段同时预测像素和潜变量,既保住了细粒度时空建模,又继承了潜变量的抗噪能力。NAVSIM v1/v2双榜夺冠不是最惊艳的,雨雾场景下PDMS高达86.87(竞品仅60+)才真正让人眼前一亮。一句话:不做选择,全都要

一张黑图就能蒸馏?VCSD让Qwen3-VL全系飙升4.77%
视觉与图像

一张黑图就能蒸馏?VCSD让Qwen3-VL全系飙升4.77%

自蒸馏方法通常需要特权答案或视觉证据标注来制造教师-学生不对称性,而本论文来自马里兰大学等机构,提出一个极其简洁的替代方案:只需要一张内容擦除的黑色图像,与原始图像下教师模型的预测做对比,就能构建出有效的自蒸馏目标。在Qwen3-VL和Qwen3.5全系模型上,VCSD稳定提升1.86%-4.77%,且无需外部教师、推理时零开销。方法既巧妙又实用,值得关注。

西交大提出Quant Experts:token级量化补偿
视觉与图像

西交大提出Quant Experts:token级量化补偿

量化论文最怕两件事:一是把模型压小了,二是把精度也一起压没了。Quant Experts 这篇的思路很实在,不跟“全局统一补偿”死磕,而是把重要通道分成全局稳定和 token 相关两类,再用共享专家和路由专家分工处理,72B 模型在 W4A6 下还能追回 5.09% 平均精度,确实有点东西。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球