LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12851 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

视觉与图像

共 717 篇
AI · PAPER
视觉与图像

南科大BlindPSNR:让低光增强自动选最优,Top-1达89.5%

还在手动挑低光增强参数?这篇论文发现7个主流无参考质量评估指标在候选选择任务上全军覆没(Top-1准确率全部为0%),并推出BlindPSNR——不依赖任何参考图就能预测PSNR,在场景未见数据上Top-1准确率飙到89.5%,后悔值仅0.026dB,代码已开源。对任何要落地低光增强的团队都是一份实用参考。

1200个视觉依赖问题拷问四大模型:渲染偏差让3D推理暴跌15%
视觉与图像

1200个视觉依赖问题拷问四大模型:渲染偏差让3D推理暴跌15%

继6月聊过商汤“思考with images”之后,团队进一步追问:模型画出来的中间状态,到底是真用了还是仅仅装样子?为此他们构造了1200个视觉依赖样本的See2ThinkBench,并设计了可干预的VAoT协议。结果扎心:模型选动作挺准,但渲染忠实度平均只有60%,3D场景下错误反馈能让准确率暴跌15个百分点——画图推理,远没想象中靠谱。

AI · PAPER
视觉与图像

几何深度学习新范式:一招让网格模型“听懂”内在几何,手指关节都能变形

继2025年PoissonNet霸榜网格学习之后,蒙特利尔大学团队终于把注意力机制按网格几何的“本性”改造了一番——内在且三角化无关。结果直接拉满:高频信号预测PSNR暴增6dB,手指变形细节从未如此清晰,而且代码和实验都开源可复现,看完就想动手试试。

AI · PAPER
视觉与图像

哈工大等提出PRISM:让AI画画学会“看图自改”,TIFA飙至91.4%新SOTA

文生图提示优化一直是热门,但之前的方法要么只看文本要么只给分数,缺少结构化图像诊断。PRISM另辟蹊径,用一个VLM同时当裁判和教练,先看图挑毛病再针对性改提示,最后用强化学习让模型越改越好。在TIFA上从76.1飙升到91.4,关键是可解释性极强——每个修改都有理有据。

AI · PAPER
视觉与图像

机器人规划新范式:自动学习有向时间成本,14点提升不是梦

还在发愁机器人规划里怎么设计奖励函数?来自香港浸会大学的这篇论文直接告诉你:不用愁!它从无奖励的演示日志里“挖”出时间距离,让世界模型规划得又快又准,导航成功率直接拉满,操作任务也大幅提升。这正是龙哥一直在说的:比起花里胡哨的模型结构,搞清楚“规划目标从哪来”往往更重要。

AI · PAPER
视觉与图像

安徽大学SCDT:统一去噪框架,专治RGB-T跟踪模态缺失

医生看病是逐步问诊、看检查单、更新诊断假设的过程,但现有的AI评估全是单轮问答,完全不接地气。这篇论文搞了一个1089例真实病例的多轮诊断基准,把15个模型按真实临床流程从头考到尾。结果发现推理模式反而帮倒忙,医疗微调在小模型上有用、大模型反而没优势。想了解AI在临床诊断中到底几斤几两?这篇必须读。

西北大学最新:用医生看片时的“眼球轨迹”做弱监督分割,Dice达81.85%!
视觉与图像

西北大学最新:用医生看片时的“眼球轨迹”做弱监督分割,Dice达81.85%!

还在为医疗分割数据的像素级标注头疼?西北大学这篇工作告诉你,医生看片子时的眼动轨迹就能当弱监督信号,而且效果居然超越了最专业的涂鸦、边界框等“传统”弱监督!更关键的是,它首次用Mamba这种高效架构建模了轨迹的时序信息,而不是把它当作一堆散点的静态图。看完你会感叹:原来最宝贵的监督信号,就藏在医生最自然的阅片习惯里。

AI · PAPER
视觉与图像

遥感学会用新模型:边缘清晰度暴涨,分类精度超越SOTA

PolSAR分类一直受困于边缘模糊和各向异性散射建模。现有Mamba方法要么只做空间域,要么固定扫描方向。本文提出DA-Mamba,巧妙结合NSCT多方向分解和方向自适应扫描,在四个数据集上全面超越SOTA。方向感知扫描+双域融合的设计,既保留全局语义又捕捉精细边缘,思路干净实用,值得关注。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球