零样本图像描述卡壳3年?3个检查点把CIDEr拉到117.6,无需任何配对数据
零样本图像描述三年没挪窝,这篇论文用多检查点对齐评分框架,推理阶段把CIDEr从108.0干到117.6。不重训描述器、不吃配对数据,全靠把评分器插在更多位置上——早该这么干了!
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
零样本图像描述三年没挪窝,这篇论文用多检查点对齐评分框架,推理阶段把CIDEr从108.0干到117.6。不重训描述器、不吃配对数据,全靠把评分器插在更多位置上——早该这么干了!
高铁上视频卡成PPT?低轨卫星物联网连不上?这篇南洋理工联合西电、UCD等机构的最新工作,用一套结构化稀疏感知的SS-EP算法,把OTFS免授权随机接入的联合活跃用户检测与信道估计性能,直接推到了逼近理想上限的水平,而且人家还保留了可承受的复杂度。搞6G高移动接入的,这篇值得认真读一下。
自回归模型统治语言建模多年,但Apple这次把连续流模型直接干到了1.7B参数、2.1T tokens的规模,自蒸馏后只需4步推理就能生成高质量文本。这是CFM路线迄今最大规模的实证,值得所有关注非自回归生成的人仔细看看。
手机拍完照,噪点糊一脸?上海交大这个LiteKD-Net给出一个相当务实的答案:把重型去噪网络的参数砍掉90%、推理提速近2倍,再用知识蒸馏把画质“回填”回来,最终效果直逼大模型。做移动端部署的团队,这篇值得一读。
把大语言模型那套自回归玩法搬到无线信道建模里,还顺势治好了“信道张量混合多路径信息”的老毛病。卡内基梅隆大学提出的MultiPathFormer,首次在路径级别做预训练,定位误差从68米干到5.57米,属实有点东西。
继北大CRAFT之后,又是北大团队!这次他们让音频驱动的视频生成告别“傻快”——只用声音的能量分布,就能精准指挥算力花在刀刃上,2.46倍加速还保住了画质。这招“听声辨位”,值得所有搞视频生成加速的玩家看一看。
脉冲神经网络历来以“省电”闻名,可让它直接处理静态RGB图,就像让旱鸭子下水——有点为难它。中南财大等机构这次直接把SNN拉进全能图像修复赛道:性能追平ANN,能耗只有人家的五分之一,16.8mJ就能搞定一整套修复流程。
大家都在卷骨干网络,可热那亚大学这篇论文偏偏告诉你:轻量分割模型的涨点空间其实藏在被忽视的分割头里。本文系统对比三种解码器模块、验证多任务层次分解的有效性,参数量比基线少约40%,加权精度反而从91.2%涨到92.8%。把解码器这口“冷饭”炒出了新味道,值得一读。
在医学影像分割的同类探索里,这篇把手伸向了更硬核的跨手术域迁移:胆囊手术学到的东西,能不能直接帮直肠手术做分割?CEMD架构给出的答案是——不仅能用,胆囊类分割还暴涨27%,收敛还快3倍,值得一读。
继2026年6月聊过物理对称性硬编码的世界模型、7月聊过北大DWM之后,这期看点更有“手感”的:清华TacWAM直接把触觉卷进世界动作模型,四大接触丰富任务平均成功率75%,比最强基线高出37.5个百分点。想看懂机械手怎么“摸”东西,这篇别错过。
高光谱分类就像拿着“放大镜”找茬:CNN只看得到眼前一亩三分地,Transformer倒是看得远,但算力账单吓人。青岛理工团队把多尺度CNN和Mamba塞进一个框架,0.2M参数直接干到94.35%精度,这波混搭真有东西。
世界行动模型(WAM)又重又慢,部署到机器人上量化是必经之路。但现有PTQ方法在WAM上集体翻车。复旦这篇QuantWAMs,从结构、分布、目标三个维度重新审视校准粒度,在4bit精度下模拟分数几乎不掉点,还在真机上验证了一波,属实有点东西。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球