LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12851 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:多模态

共 200 篇
告别“似是而非”,StyleDoctor一招提升风格一致性50%
视觉与图像

告别“似是而非”,StyleDoctor一招提升风格一致性50%

AI画画火了这么久,但你有没有发现,让它“精准复刻”某种画风,比如水墨、印象派、卡通,结果总有点“似是而非”? 核心问题在于,现有的“人类偏好奖励模型”能判断美丑,却根本不懂“风格”这回事。CVPR 2026的这篇StyleDoctor,就像给AI配上了一位严格的“美术史教授”,专门用来评估和引导风格生成。这项工作还配套了一个涵盖1000种风格、40万对样本

CVPR 2026夺冠!商汤&清华让VLM学会“边想边搜边裁剪”,开源7B模型碾压GPT-4o-mini
视觉与图像

CVPR 2026夺冠!商汤&清华让VLM学会“边想边搜边裁剪”,开源7B模型碾压GPT-4o-mini

当VLM面对一张4K图片里的微小文字或长尾知识时,现有模型不是“看瞎了”就是“知识库不够用”。SenseSearch巧妙地把“搜索”和“裁剪”两个看似不相关的能力,通过强化学习捏合成了一个统一的推理智能体。更关键的是,它开源了所有代码和数据集,让社区可以直接复现并续写。这项工作的完成度和效果都相当扎实,值得细细品味。

清华年度研究:TTA4CLIP的证据质量比调参重要百倍?
视觉与图像

清华年度研究:TTA4CLIP的证据质量比调参重要百倍?

别再被TTA4CLIP的参数更新给骗了!清华这篇论文用20多个方法的大规模实验揭开了真相:所谓的“最优”方法,其成功很少来自更强劲的梯度更新。证据的质量和与之对齐的代理才是真正的引擎。本文不仅是一次透彻的方法论剖析,更是一份帮你避开复杂优化陷阱的指南手册。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球