LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1655 篇文章

PaperDaily 数据库收录 论文拆解 12858 研究思路 385 AI 资讯 210 开源项目 164 科研招聘 128 学习资料 8 热点主题 503 论文成功模式 1625

视觉与图像

共 747 篇
AI · PAPER
视觉与图像

大连理工ACM MM 2026:视图不齐也能聚类,ACC提升近6%

多视图聚类最怕数据对不齐:设备故障、存储分离,大量样本的视图配对关系直接丢失。大连理工这篇ACM MM 2026工作,用锚点图加匈牙利算法的双重对齐策略,把对齐从“一次完成”升级为“二次校准”,在六个数据集上ACC最高比第二名提升5.97%,还顺手缓解了单次对齐误差大的老毛病。想看看GCN怎么在错位数据里找回结构的,这篇值得读。

AI · PAPER
视觉与图像

四大缩放维度首次系统对比:本地CUA堆算力不如“选对维度”

这篇来自汉阳大学的实证研究,把本地电脑使用代理的推理时扩展拆成上下文、时间、结构、并行四个维度逐项考察。结论有点反直觉:额外算力常常不是提升成功率,而是把失败模式从“死循环”改写成“假成功”。对做本地部署的团队来说,这是一份难得的避坑指南。

AI · PAPER
视觉与图像

视频阴影去除新SOTA!杭电等高校新方法,0.82dB领先

夏天在景区拍照,最难缠的不是人潮,而是地上那道怎么躲都躲不开的影子。照片还能靠后期硬修,一到视频里影子跟着物体动起来,简直是在考验修图师的心脏。今天这篇AAAI 2027论文《WildShadowRemover》,把“去除视频阴影”这件事直接交给视频扩散模型来搞定。看完只能说一句:还是让模型去扛吧,人眼真的看不过来。

AI · PAPER
视觉与图像

比单图SR强太多?多视图+序列人脸超分还能顺便提升Re-ID

人脸超分一直有个尴尬:单张低清图怎么补也补不出真实五官。这篇韩国三校合作的工作干脆“摇人”——把同一个人的多张低清监控图凑在一起,用Transformer把身份特征统一起来,再靠级联网络一步步把脸“画”清晰,顺便把行人再识别也推进了一把。思路简单粗暴,效果却很能打。

AI · PAPER
视觉与图像

南科大BlindPSNR:让低光增强自动选最优,Top-1达89.5%

还在手动挑低光增强参数?这篇论文发现7个主流无参考质量评估指标在候选选择任务上全军覆没(Top-1准确率全部为0%),并推出BlindPSNR——不依赖任何参考图就能预测PSNR,在场景未见数据上Top-1准确率飙到89.5%,后悔值仅0.026dB,代码已开源。对任何要落地低光增强的团队都是一份实用参考。

1200个视觉依赖问题拷问四大模型:渲染偏差让3D推理暴跌15%
视觉与图像

1200个视觉依赖问题拷问四大模型:渲染偏差让3D推理暴跌15%

继6月聊过商汤“思考with images”之后,团队进一步追问:模型画出来的中间状态,到底是真用了还是仅仅装样子?为此他们构造了1200个视觉依赖样本的See2ThinkBench,并设计了可干预的VAoT协议。结果扎心:模型选动作挺准,但渲染忠实度平均只有60%,3D场景下错误反馈能让准确率暴跌15个百分点——画图推理,远没想象中靠谱。

AI · PAPER
视觉与图像

几何深度学习新范式:一招让网格模型“听懂”内在几何,手指关节都能变形

继2025年PoissonNet霸榜网格学习之后,蒙特利尔大学团队终于把注意力机制按网格几何的“本性”改造了一番——内在且三角化无关。结果直接拉满:高频信号预测PSNR暴增6dB,手指变形细节从未如此清晰,而且代码和实验都开源可复现,看完就想动手试试。

AI · PAPER
视觉与图像

哈工大等提出PRISM:让AI画画学会“看图自改”,TIFA飙至91.4%新SOTA

文生图提示优化一直是热门,但之前的方法要么只看文本要么只给分数,缺少结构化图像诊断。PRISM另辟蹊径,用一个VLM同时当裁判和教练,先看图挑毛病再针对性改提示,最后用强化学习让模型越改越好。在TIFA上从76.1飙升到91.4,关键是可解释性极强——每个修改都有理有据。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球