LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1655 篇文章

PaperDaily 数据库收录 论文拆解 12858 研究思路 385 AI 资讯 210 开源项目 164 科研招聘 128 学习资料 8 热点主题 503 论文成功模式 1625

视觉与图像

共 747 篇
AI · PAPER
视觉与图像

机器人规划新范式:自动学习有向时间成本,14点提升不是梦

还在发愁机器人规划里怎么设计奖励函数?来自香港浸会大学的这篇论文直接告诉你:不用愁!它从无奖励的演示日志里“挖”出时间距离,让世界模型规划得又快又准,导航成功率直接拉满,操作任务也大幅提升。这正是龙哥一直在说的:比起花里胡哨的模型结构,搞清楚“规划目标从哪来”往往更重要。

AI · PAPER
视觉与图像

安徽大学SCDT:统一去噪框架,专治RGB-T跟踪模态缺失

医生看病是逐步问诊、看检查单、更新诊断假设的过程,但现有的AI评估全是单轮问答,完全不接地气。这篇论文搞了一个1089例真实病例的多轮诊断基准,把15个模型按真实临床流程从头考到尾。结果发现推理模式反而帮倒忙,医疗微调在小模型上有用、大模型反而没优势。想了解AI在临床诊断中到底几斤几两?这篇必须读。

西北大学最新:用医生看片时的“眼球轨迹”做弱监督分割,Dice达81.85%!
视觉与图像

西北大学最新:用医生看片时的“眼球轨迹”做弱监督分割,Dice达81.85%!

还在为医疗分割数据的像素级标注头疼?西北大学这篇工作告诉你,医生看片子时的眼动轨迹就能当弱监督信号,而且效果居然超越了最专业的涂鸦、边界框等“传统”弱监督!更关键的是,它首次用Mamba这种高效架构建模了轨迹的时序信息,而不是把它当作一堆散点的静态图。看完你会感叹:原来最宝贵的监督信号,就藏在医生最自然的阅片习惯里。

AI · PAPER
视觉与图像

遥感学会用新模型:边缘清晰度暴涨,分类精度超越SOTA

PolSAR分类一直受困于边缘模糊和各向异性散射建模。现有Mamba方法要么只做空间域,要么固定扫描方向。本文提出DA-Mamba,巧妙结合NSCT多方向分解和方向自适应扫描,在四个数据集上全面超越SOTA。方向感知扫描+双域融合的设计,既保留全局语义又捕捉精细边缘,思路干净实用,值得关注。

AI · PAPER
视觉与图像

香港大学新方法Protego:保护后照片互不匹配,效果翻倍

还在担心你的照片被 PimEyes、Clearview AI 这类“人脸搜索引擎”人肉吗?港大团队提出的 Protego 通过一个独特的 3D 隐私纹理,让你的面部在搜索引擎中彻底“隐身”——即使查询图像也是被保护过的,仍然无法匹配。实验显示召回率暴降 3.5 倍,而且能流畅保护视频,效果自然得像是没加过工。

AI · PAPER
视觉与图像

一张图看懂仓库级RAG去噪:北航MRCoder,加速52%准确率提升

仓库级代码生成中,RAG常常引入噪声上下文,导致模型“看花眼”——生成质量下降,推理时间飙升。北航团队提出的MRCoder,像个聪明的图书管理员,用Map-Reduce范式先让轻量草稿模型快速试读,再根据API调用和逻辑相似性精准筛选有效上下文,最后用并行验证把速度提上去。实验结果漂亮:Pass@1最高提升52%,推理时间减少一半。这篇值得所有搞代码生成、R

AI · PAPER
视觉与图像

武汉理工最新研究:乡村自动驾驶合成数据最佳配比1:0.5,YOLO11m精度0.758

中国乡村道路的自动驾驶一直是个“数据荒漠”。这篇论文不光造了个包含14类乡村特有害物的数据集,还系统测了13个检测器,用实验打脸“合成数据越多越好”的朴素直觉——最佳比例是1:0.5!对于想低成本落地乡村自动驾驶的团队,这份报告就是现成的“避坑指南”。

AI · PAPER
视觉与图像

极端场景OCR实战:为什么超分比大模型更重要?

极端场景下车牌只有12像素宽,笔画宽度2-3像素,常规OCR盲猜等于送分给负分。这篇ICIP 2026挑战赛高分方案证明了:把超分做到位(HAT 4倍提升),再搭配两个架构差异够大的识别器做集成,最后根据计分规则(+2/-1/0)设定弃权阈值,即使没有外部数据和私有模型,照样拿到9.73 wECR。核心思路很简单:先让字看得清,再让模型认得出,认不出的时候就

AI · PAPER
视觉与图像

零参数推理!QueenVIS用两个辅助头搞定视频实例分割

视频实例分割通常需要昂贵的视频标注和复杂的时序建模,但QueenVIS仅用单帧图像训练就拿到了接近SOTA的结果。它通过两个轻量辅助头把外观和空间先验注入Transformer查询,推理时零参数开销,在长视频上提升10.3 AP,简直是为标注稀缺场景量身打造。方法干净、实用,值得工程团队关注。

图像训练逆袭!QueenVIS视频分割零参数涨10.3 AP
视觉与图像

图像训练逆袭!QueenVIS视频分割零参数涨10.3 AP

视频实例分割的“天价标注”让人头疼,QueenVIS却告诉你:只用单帧图像训练,效果堪比视频监督!它通过两个超级简单的辅助头(特征预测+中心预测)把外观和空间先验注入查询向量,推理时零开销、零参数增加。在YouTube-VIS长视频上直接飙了10.3 AP,比很多视频监督模型还稳。代码已开源,值得一试!

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球