香港大学新方法Protego:保护后照片互不匹配,效果翻倍
还在担心你的照片被 PimEyes、Clearview AI 这类“人脸搜索引擎”人肉吗?港大团队提出的 Protego 通过一个独特的 3D 隐私纹理,让你的面部在搜索引擎中彻底“隐身”——即使查询图像也是被保护过的,仍然无法匹配。实验显示召回率暴降 3.5 倍,而且能流畅保护视频,效果自然得像是没加过工。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
还在担心你的照片被 PimEyes、Clearview AI 这类“人脸搜索引擎”人肉吗?港大团队提出的 Protego 通过一个独特的 3D 隐私纹理,让你的面部在搜索引擎中彻底“隐身”——即使查询图像也是被保护过的,仍然无法匹配。实验显示召回率暴降 3.5 倍,而且能流畅保护视频,效果自然得像是没加过工。
仓库级代码生成中,RAG常常引入噪声上下文,导致模型“看花眼”——生成质量下降,推理时间飙升。北航团队提出的MRCoder,像个聪明的图书管理员,用Map-Reduce范式先让轻量草稿模型快速试读,再根据API调用和逻辑相似性精准筛选有效上下文,最后用并行验证把速度提上去。实验结果漂亮:Pass@1最高提升52%,推理时间减少一半。这篇值得所有搞代码生成、R
中国乡村道路的自动驾驶一直是个“数据荒漠”。这篇论文不光造了个包含14类乡村特有害物的数据集,还系统测了13个检测器,用实验打脸“合成数据越多越好”的朴素直觉——最佳比例是1:0.5!对于想低成本落地乡村自动驾驶的团队,这份报告就是现成的“避坑指南”。
极端场景下车牌只有12像素宽,笔画宽度2-3像素,常规OCR盲猜等于送分给负分。这篇ICIP 2026挑战赛高分方案证明了:把超分做到位(HAT 4倍提升),再搭配两个架构差异够大的识别器做集成,最后根据计分规则(+2/-1/0)设定弃权阈值,即使没有外部数据和私有模型,照样拿到9.73 wECR。核心思路很简单:先让字看得清,再让模型认得出,认不出的时候就
视频实例分割通常需要昂贵的视频标注和复杂的时序建模,但QueenVIS仅用单帧图像训练就拿到了接近SOTA的结果。它通过两个轻量辅助头把外观和空间先验注入Transformer查询,推理时零参数开销,在长视频上提升10.3 AP,简直是为标注稀缺场景量身打造。方法干净、实用,值得工程团队关注。
视频实例分割的“天价标注”让人头疼,QueenVIS却告诉你:只用单帧图像训练,效果堪比视频监督!它通过两个超级简单的辅助头(特征预测+中心预测)把外观和空间先验注入查询向量,推理时零开销、零参数增加。在YouTube-VIS长视频上直接飙了10.3 AP,比很多视频监督模型还稳。代码已开源,值得一试!
当你在暗光下按下快门,CMOS传感器捕获的RAW数据里,既有光子打上去的散粒噪声,又有电路本身的读取噪声,混合在一起,让那些在实验室里表现神勇的“高斯去噪器”瞬间歇菜。这篇论文不打新网络架构,而是从噪声建模的老祖宗——方差稳定化出发,用一招“甩锅”重尾残差的稳健拟合,愣是把GAT+预训练模型这条老路走通了,而且走得很稳。对于想省掉重新训练模型成本、直接用现有
当机器人VLA模型在域外任务中频频翻车,RL²给出了一个既聪明又高效的解法:只在预测到即将失败时,才调用离线强化学习产生的多样化动作来“组合引导”,否则就安心跟着原始VLA走。这项研究不仅揭示了“成功/失败状态缩放定律冰火两重天”的反直觉结论,还在真实机器人上带来了接近30%的成功率提升——关键是,所有模块都是轻量+离线,部署成本极低。值得所有做机器人泛化操
别小看“数据扩展+教师再微调”这个组合拳。这篇工作老老实实地把视频帧抽出来补足稀有物种,再让教师自己先学一轮,就让轻量学生逼近大模型97%性能,在Jetson Orin Nano上跑出3.19ms一图。更关键的是,它用5次种子对比告诉你:蒸馏本身贡献有限,别被花哨术语带偏。
想不想知道,给顶级VLM一个患者描述但完全不给图像,它们会怎么做?这篇CMU的研究发现,模型不仅不会拒绝回答,还会根据种族、年龄、性别编出不同的诊断,甚至存在“表面说看不到图、背地填上病名”的阴阳模式。对医疗AI的可信度当头一棒,值得所有临床AI从业者细读。
想象一下,你带了一张胸片给AI看病,结果图片没传上去,AI却根据你的年龄和肤色直接编了个诊断——这不是科幻,是今天这篇ICMR 2026论文的实锤发现。Claude、GPT-5.4和Gemini集体“翻车”,而且翻得很有规律:65岁白人男性=黑色素瘤,32岁黑人女性=结节病。更离谱的是,有些AI文字说“没图”,但结构化的诊断字段却填得满满当当。对AI安全感兴
ISAC是6G通感一体化热点,但嵌入通信数据会严重污染雷达感知。蒙特利尔理工这篇工作巧妙地用概率去噪网络吸收数据引入的旁瓣干扰,让感知几乎不受影响,还附带完整CRLB和BER理论分析。代码已开源,值得关注!
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球