浙大最新MoE研究:专家重叠却有效,39组实验打破“几何互补”神话
MoE大模型靠“多个专家干活”撑起千亿参数,但专家之间到底是分工还是打架?这篇来自浙江大学与香港理工大学的最新研究,用39组因子实验拆开了一个反常识真相:专家子空间严重重叠,路由却依然精准;被选中的专家确实更强,但真实上下文反而在“压价”它的优势——作者称之为“连贯重叠”。一句话:光看几何相似度,千万别急着下“冗余”结论。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
MoE大模型靠“多个专家干活”撑起千亿参数,但专家之间到底是分工还是打架?这篇来自浙江大学与香港理工大学的最新研究,用39组因子实验拆开了一个反常识真相:专家子空间严重重叠,路由却依然精准;被选中的专家确实更强,但真实上下文反而在“压价”它的优势——作者称之为“连贯重叠”。一句话:光看几何相似度,千万别急着下“冗余”结论。
大模型推理加速是刚需,但"放水"换速度的代价到底是什么?这篇来自百度等团队的工作把有损验证方法扒了个底朝天,用严谨实验揭示了一个反直觉结论:任务越难,截断式验证的质量掉得越狠。看完这篇,再也不敢随便用"有损加速"了。
推荐系统推理常需对数百候选跑完整模型,存在大量重复计算。Meta的ROCS拆掉这种结构性冗余:延迟交互、请求侧只算一次,配合GPU内核优化,检索QPS最高提升3倍,排序阶段用省下的算力换模型质量。该方案已在Meta广告和自然内容数十个模型上真实部署,绝非纸上谈兵。
一篇能刷新认知的网络科学论文。它用复杂度评分+节点级交叉验证证明:很多被当成“复杂传染”的S形核,可能只是异质性简单传染被平均出来的假象。看完会忍不住重新审视过往的复杂传染研究。
还在为MIDI钢琴演奏评估的音符对齐问题头疼?本文提出Kernel Music Distance等免对齐指标,用自监督上下文嵌入对齐人类感知,排序相关性可达0.51,还顺手开源了工具库Pereval,MIR玩家值得一读。
这篇论文把双时相卫星影像变化检索的“查询成本”算得明明白白——固定CLIP骨干、统一训练策略,系统对比注意力、Mamba、瓶颈压缩三类共八种融合方案,还用10个随机种子做了统计检验。结论很干脆:免训练级联检索能省10-15倍延迟而不损召回,Mamba的理论线性复杂度在L=196时没有带来实际速度优势。做遥感检索或高效多模态融合的朋友,这篇相当解渴。
多视图聚类最怕数据对不齐:设备故障、存储分离,大量样本的视图配对关系直接丢失。大连理工这篇ACM MM 2026工作,用锚点图加匈牙利算法的双重对齐策略,把对齐从“一次完成”升级为“二次校准”,在六个数据集上ACC最高比第二名提升5.97%,还顺手缓解了单次对齐误差大的老毛病。想看看GCN怎么在错位数据里找回结构的,这篇值得读。
推荐系统最怕“懂你”却“不会买”——意图清楚了,行动却掉链子。快手这篇工作把理解与行动分开建模,用反馈闭环让策略真正以效果说话:在线A/B测试收入+4.506%、广告价值+4.621%,在线推理时延却几乎零增加。工业级生成式推荐落地,值得细读。
“单模型修复所有退化”的热潮里,武汉大学这个工作把专家网络玩出了新花样——公共专家打底、低秩残差专家补丁,还能白嫖CLIP语义先验。12种退化一锅端,PSNR涨了1.05dB,速度却快了近12倍,遥感修复玩家值得一读。
不用预设智能、不用基因编码,一台哈希函数就能撬动“开放式进化”?本文把最前沿的SCHC模型推到GPU大规模战场,意外发现空间尺度一到L≈300就会出现成核式失控相变,边界条件比想象中更“卡脖子”。极简模型,信息量极大,值得一读。
冷启动推荐一直是个老大难问题,新物品刚上线,缺反馈、随时间变化,模型到底该信谁?西南大学的这项研究脑洞大开,把Titans的记忆机制和卡尔曼滤波的时序建模结合起来,用后验协方差作为“不确定性信号”来引导静态语义和时序特征的融合。这一招让推荐效果直接起飞,非常值得关注。
弱监督显著检测一直面临标注稀疏的困境,上海大学团队直接请出SAM把涂鸦变成高质量像素级伪标注,再搭配Mamba+扩散模型做精修。7个数据集上碾压所有弱监督方法,甚至干翻了不少全监督方法。这是一套有工程潜力的弱监督方案,值得细读。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球