LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12851 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

视觉与图像

共 717 篇
AI · PAPER
视觉与图像

香港大学新方法Protego:保护后照片互不匹配,效果翻倍

还在担心你的照片被 PimEyes、Clearview AI 这类“人脸搜索引擎”人肉吗?港大团队提出的 Protego 通过一个独特的 3D 隐私纹理,让你的面部在搜索引擎中彻底“隐身”——即使查询图像也是被保护过的,仍然无法匹配。实验显示召回率暴降 3.5 倍,而且能流畅保护视频,效果自然得像是没加过工。

AI · PAPER
视觉与图像

一张图看懂仓库级RAG去噪:北航MRCoder,加速52%准确率提升

仓库级代码生成中,RAG常常引入噪声上下文,导致模型“看花眼”——生成质量下降,推理时间飙升。北航团队提出的MRCoder,像个聪明的图书管理员,用Map-Reduce范式先让轻量草稿模型快速试读,再根据API调用和逻辑相似性精准筛选有效上下文,最后用并行验证把速度提上去。实验结果漂亮:Pass@1最高提升52%,推理时间减少一半。这篇值得所有搞代码生成、R

AI · PAPER
视觉与图像

武汉理工最新研究:乡村自动驾驶合成数据最佳配比1:0.5,YOLO11m精度0.758

中国乡村道路的自动驾驶一直是个“数据荒漠”。这篇论文不光造了个包含14类乡村特有害物的数据集,还系统测了13个检测器,用实验打脸“合成数据越多越好”的朴素直觉——最佳比例是1:0.5!对于想低成本落地乡村自动驾驶的团队,这份报告就是现成的“避坑指南”。

AI · PAPER
视觉与图像

极端场景OCR实战:为什么超分比大模型更重要?

极端场景下车牌只有12像素宽,笔画宽度2-3像素,常规OCR盲猜等于送分给负分。这篇ICIP 2026挑战赛高分方案证明了:把超分做到位(HAT 4倍提升),再搭配两个架构差异够大的识别器做集成,最后根据计分规则(+2/-1/0)设定弃权阈值,即使没有外部数据和私有模型,照样拿到9.73 wECR。核心思路很简单:先让字看得清,再让模型认得出,认不出的时候就

AI · PAPER
视觉与图像

零参数推理!QueenVIS用两个辅助头搞定视频实例分割

视频实例分割通常需要昂贵的视频标注和复杂的时序建模,但QueenVIS仅用单帧图像训练就拿到了接近SOTA的结果。它通过两个轻量辅助头把外观和空间先验注入Transformer查询,推理时零参数开销,在长视频上提升10.3 AP,简直是为标注稀缺场景量身打造。方法干净、实用,值得工程团队关注。

图像训练逆袭!QueenVIS视频分割零参数涨10.3 AP
视觉与图像

图像训练逆袭!QueenVIS视频分割零参数涨10.3 AP

视频实例分割的“天价标注”让人头疼,QueenVIS却告诉你:只用单帧图像训练,效果堪比视频监督!它通过两个超级简单的辅助头(特征预测+中心预测)把外观和空间先验注入查询向量,推理时零开销、零参数增加。在YouTube-VIS长视频上直接飙了10.3 AP,比很多视频监督模型还稳。代码已开源,值得一试!

AI · PAPER
视觉与图像

宁波联队新作:重尾残差下PG噪声稳健估算,PSNR再涨1.9dB

当你在暗光下按下快门,CMOS传感器捕获的RAW数据里,既有光子打上去的散粒噪声,又有电路本身的读取噪声,混合在一起,让那些在实验室里表现神勇的“高斯去噪器”瞬间歇菜。这篇论文不打新网络架构,而是从噪声建模的老祖宗——方差稳定化出发,用一招“甩锅”重尾残差的稳健拟合,愣是把GAT+预训练模型这条老路走通了,而且走得很稳。对于想省掉重新训练模型成本、直接用现有

真人实验提升28.7%!RL2让机器人学会“该出手时才出手”
视觉与图像

真人实验提升28.7%!RL2让机器人学会“该出手时才出手”

当机器人VLA模型在域外任务中频频翻车,RL²给出了一个既聪明又高效的解法:只在预测到即将失败时,才调用离线强化学习产生的多样化动作来“组合引导”,否则就安心跟着原始VLA走。这项研究不仅揭示了“成功/失败状态缩放定律冰火两重天”的反直觉结论,还在真实机器人上带来了接近30%的成功率提升——关键是,所有模块都是轻量+离线,部署成本极低。值得所有做机器人泛化操

AI · PAPER
视觉与图像

CMU惊人发现:不给图也能编诊断,GPT-5.4/Claude 4.7/Gemini 3.1集体翻车

想不想知道,给顶级VLM一个患者描述但完全不给图像,它们会怎么做?这篇CMU的研究发现,模型不仅不会拒绝回答,还会根据种族、年龄、性别编出不同的诊断,甚至存在“表面说看不到图、背地填上病名”的阴阳模式。对医疗AI的可信度当头一棒,值得所有临床AI从业者细读。

AI · PAPER
视觉与图像

GPT-5.4全剂量“虚构”,Claude词触发“看人下菜”

想象一下,你带了一张胸片给AI看病,结果图片没传上去,AI却根据你的年龄和肤色直接编了个诊断——这不是科幻,是今天这篇ICMR 2026论文的实锤发现。Claude、GPT-5.4和Gemini集体“翻车”,而且翻得很有规律:65岁白人男性=黑色素瘤,32岁黑人女性=结节病。更离谱的是,有些AI文字说“没图”,但结构化的诊断字段却填得满满当当。对AI安全感兴

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球