LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12823 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

视觉与图像

共 717 篇
ACM MM'26最新:福州大学仅增0.07M参数,低光色彩还原不再跑偏
视觉与图像

ACM MM'26最新:福州大学仅增0.07M参数,低光色彩还原不再跑偏

低光增强里"提亮容易、校色难"的老大难问题,这篇论文算是啃到点子上了。福州大学提出的CAGE框架,用可解释的颜色空间变换方案做色彩校正,还能像插件一样直接塞进现有模型里,成本低到可以忽略。在低光图像处理这个长期刚需的赛道上,这活儿干得漂亮。

遥感分割的黑盒难题,被熵中心XAI破解了?
视觉与图像

遥感分割的黑盒难题,被熵中心XAI破解了?

深度模型在遥感分割里跑得欢,可它凭什么这么分?黑盒不拆,谁敢拿去搞灾情评估和土地利用监测?本文提出熵中心XAI方法,用熵不确定性给分割模型的决策画热力图,还顺手设计了一个H-SIT评估框架揪出“假重要区域”,在WHU数据集上把Grad-CAM、Score-CAM和Seg-Sobol都甩在身后,值得一读。

世界模型规划总翻车?VIScore三个维度直接定位病根
视觉与图像

世界模型规划总翻车?VIScore三个维度直接定位病根

潜在世界模型越来越火,可学界一直缺一把能解释“为什么这个模型规划成功、那个却失败”的尺子。本文从SIGReg与VISReg的受控对比入手,把诊断对象从单一编码器扩展到编码器+预测器+规划器三件套,提出VIScore;相关度冲到0.75以上,校准误差还能低于常量拟合,属于世界模型方向稀缺的工具型工作。

扩散模型终于懂物理了!阳明交大×NVIDIA最新去雾:平均涨0.57dB
视觉与图像

扩散模型终于懂物理了!阳明交大×NVIDIA最新去雾:平均涨0.57dB

同样是扩散模型,凭什么HNDif去雾更猛?因为它不玩"纯噪声瞎猜",而是把大气散射模型直接写进扩散过程:雾浓处多注噪声、雾淡处少注噪声,反向再联合去雾去噪。四个主流去雾骨干、六个基准数据集,平均PSNR提升0.57dB。想给自家去雾模型"插管提速"?这篇值得细读。

告别昂贵遥操作?这家机构用"看视频"教手术机器人操作
视觉与图像

告别昂贵遥操作?这家机构用"看视频"教手术机器人操作

手术机器人学动作,最缺的就是带标签数据。这篇来自中佛罗里达大学等机构的工作,首次把世界-动作模型(WAM)用到手术机器人上,在动作标签预算固定的条件下,用免费的无动作视频预训练就把闭环成功率从63.5%拽到77.8%,PegTransfer单任务直接涨了20个百分点。视频不要钱、标签贵上天,这条路子值得所有做医疗机器人的人看一眼。

华中科大+地平线新作:流式视频生成FVD暴降36.6%,训练推理终于“对齐”了
视觉与图像

华中科大+地平线新作:流式视频生成FVD暴降36.6%,训练推理终于“对齐”了

视频生成要当世界模型,最大的坑就是训练时乱炖噪声、推理时要按顺序去噪。华中科大联合地平线这篇Stream Forcing把“训练节奏”做成课程:先广撒网、再精对齐,UCF-101上FVD直接降了36.6%,还能零样本飙到128帧。继2026年6月聊过NVIDIA+清华的Causal-rCM之后,这是又一篇把流式生成训练做扎实的工作。

代尔夫特理工新作:MoMQ让实时视频多路径传输延迟直降70.3%
视觉与图像

代尔夫特理工新作:MoMQ让实时视频多路径传输延迟直降70.3%

多路径传输一直在“盲人摸象”——调度器只看字节,不懂视频帧的关键程度。代尔夫特理工这篇MoMQ,首次把MoQT的元数据变成路径调度规则,在Starlink+WiFi真实测试床上把P99.9延迟从384.7ms砍到114.1ms,实时视频终于能跑进150ms交互预算。想法巧妙,实验扎实,值得一读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球