中科大&美团CHAP:生成式检索告别逐层解码,线上成交大涨2.98%
传统生成式检索有个"中看不中用"的槽点:每个语义ID都要逐层解码,重型Transformer要在线跑好几遍,工业场景根本扛不住。中国科大联合美团提出CHAP,把多步解码压成单次Transformer加轻量残差块,线上A/B测试支付订单量直接涨了2.98%,看完只想说一句:这才是能落地的检索新范式。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
传统生成式检索有个"中看不中用"的槽点:每个语义ID都要逐层解码,重型Transformer要在线跑好几遍,工业场景根本扛不住。中国科大联合美团提出CHAP,把多步解码压成单次Transformer加轻量残差块,线上A/B测试支付订单量直接涨了2.98%,看完只想说一句:这才是能落地的检索新范式。
这篇论文精准踩中当前视觉领域两大热点:Mamba架构与遥感显著目标检测。南京大学团队用“平滑-细节分治”的思路,把局部Mamba留给浅层细节、全局Mamba留给深层语义,配上门控跨尺度融合,在三大基准上全面刷新SOTA,窄目标F指标涨幅直接冲到1.46个百分点。代码已开源,适合想做遥感分割、结构保持任务的读者直接复现上手。
先聊一个很多人每天都会碰到、但完全没意识到的问题:你手机相册里那一张张照片,绝大多数都是JPEG格式。JPEG为什么能统治世界这么多年?因为它用一个巧妙的"分块变换+量化"策略,用很小的体积换来了还算能看的画质。
模型压缩领域一直有个终极诱惑:既然大模型这么贵,能不能把权重压到极致?三值化(Ternary Quantization)就是这条路上的狂飙选手——把每个权重压缩到只有三个取值{-1, 0, +1},理论上每个权重只需要约。
语音增强有个老毛病——噪声压下去了,说话声的高频细节也跟着"缩水"了。根特大学这回不堆模型,而是从损失函数下手,让网络学会按频率和语音能量"区别对待",高频重建误差直降15%以上。方法轻巧,思路值得一看。
聊超分绕不开一个千古难题:又想马儿跑得快(细节丰富、观感锐利),又想马儿不吃草(结构保真、贴合原图)。这两件事在底层视觉里长期互相打架,逼着研究者要么偏科要么和稀泥。
先问一个很真实的问题:一个部署在野外监控杆上的图像恢复系统,第一年只需要去噪,第二年碰上了雾霾天开始需要去雾,第三年台风季又来了要处理雨纹。每一次新需求,难道都要把旧数据翻出来重新训练一遍?
恶劣天气下的图像恢复,难点从来不在“去除”而在“组织”——雨雪雾在空间上分布极不均匀,而现有状态空间模型(SSM)却用固定轨迹逐个像素扫描,总把语义冲突区域硬凑成一段。南开大学等机构提出SSR,把扫描粒度从像素提升到超像素,让状态沿着语义边界“顺流而下”,再配合区域级门控做通道校准,参数量仅7.05M,却在六个基准上刷新了SOTA。思路干净,性价比极高,值得
Yann LeCun参与的最新视频预训练工作,把JEPA家族的防坍塌机制全砍了,只用单一编码器加SIGReg正则,预训练算力直接降到原来的二十分之一,甚至95%的token随机丢掉反而精度更高。视频预训练终于不再是算力大户的专属游戏,这篇值得所有做视觉自监督的读者细读。
事件抽取模型一出自家门就迷路?德国DFKI与奥尔登堡大学联合提出统一多域多任务生成框架:给T5加上领域指示和任务提示词,单模型就能横跨网络安全、生物医学、新闻等6大领域做事件抽取,多域联合训练还让多个数据集性能不降反升,这种"一个模型通吃天下"的玩法,值得认真聊聊。
知识图谱里明明写着“A是B的子类”,模型却视而不见?查尔姆斯理工把这种类层级关系变成“语义损失”约束,让链接预测MRR在BioKG上直接涨了15.5%,而且比把层级关系硬塞成图边更省参数。想在KG嵌入里优雅地利用本体的同学,这篇值得细读。
GAN快但不够稳,扩散稳但太磨叽,这俩能不能别打架、搭个伙?本文给出了一个简单又实用的答案:把冻结的WGAN-GP中间特征当“导师”,用交叉注意力喂给扩散U-Net,在CelebA人脸去噪上直接涨了4.40dB。方法不复杂,但对混合范式感兴趣的读者值得一读。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球