苹果谷歌联手开源:16B扩散模型6层线性化,推理提速1.73倍
大模型推理贵、响应慢,一直是落地最扎心的痛点。苹果、谷歌DeepMind、哈佛这次联手给16B扩散语言模型LLaDA 2.1动了场小手术:6层注意力换成线性版本,只训练约60小时就换来最高1.7倍解码加速,代码已开源。扩散模型也能线性化,这波操作值得细品。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
大模型推理贵、响应慢,一直是落地最扎心的痛点。苹果、谷歌DeepMind、哈佛这次联手给16B扩散语言模型LLaDA 2.1动了场小手术:6层注意力换成线性版本,只训练约60小时就换来最高1.7倍解码加速,代码已开源。扩散模型也能线性化,这波操作值得细品。
同一个从箭图到晶体:一个正组合规则的诞生 这篇论文讨论的对象叫箭图(quiver),说白了就是一个有向图。给箭图的每个顶点安排一个有限维复向量空间、给每条箭头安排一个线性映射,就得到了一个箭图表示(quiver representation)。
单目标强化学习靠“换网络结构”就能白捡一大截性能,多目标强化学习却还在算法泥潭里打转?马萨里克大学和阿托大学的最新研究直接把SimbaV2架构搬进MORL,HV暴涨132%,证明“算法不够,架构来凑”这条路在多目标领域同样走得通。对正纠结算法创新还是架构升级的读者来说,这篇论文给出了一个极具性价比的新方向。
把特征拼一起,就像把所有水果丢进一台榨汁机——最后没人知道哪一口是苹果、哪一口是橙子,更不知道是哪个"果"在犯错。西湖大学这篇新工作干脆给残差上"户口":先分清谁的错,再动手修。实测同一批特征、同一批树上限,扣费收益从13.52%干到19.10%、夏普1.42→2.09。这份"残差代数",值得所有做表格学习、量化选股的人细品。
托卡马克这个“人造太阳”里,电磁湍流居然是电流的搬运工?瑞士洛桑联邦理工和普林斯顿的最新非线性模拟发现:过去被嫌弃“太轻没存在感”的电子,在电磁湍流中居然靠麦克斯韦应力主导了动量输运,电流剖面都可能被它悄悄改写。文中还首次在GENE与CGYRO两套代码中补全了电磁动量通量诊断,并做了交叉验证。
上网课时,同一个知识点好几位老师都讲了视频,你会固定只点某一位老师的来看吗?本期论文用一整学期的点击流数据告诉你:超过一半的学生打一开始心里就有“偏向”,而且这个偏好还会随着学期推进悄悄改变。教育技术还能这么量化研究,有点意思。
图2:HD-REC整体架构。(a)HDQ通过全局共享粗粒度量化和自适应路由细粒度量化构建语义ID。(b)DAS MoE结合常驻共享专家与动态选择的特化专家。
这是龙哥近期看到的最有“反常识”的AI安全论文:正常防御都是让模型变笨或推理变慢,Apple却反手把训练成本拉满,推理保持原速,还顺手把自适应攻击者挡在门外。方向清奇且实验扎实,值得一读。
这篇论文把推测解码的老问题拆得很清楚:目标模型有相当比例的“重写”其实毫无价值,因为重写前后的推理步骤质量差不多,算力却要照付。ARBITRAGE直接用轻量路由器预估“这一步目标比草稿强多少”,只在真正有可能更优时才升级到目标模型,数学推理任务上端到端延迟最多降约2倍。
在制药和生物工程领域,色谱分离是纯化蛋白质等生物大分子的核心工业环节。为了让色谱过程跑得更高效、收率更高,工程师们越来越依赖机理模型来进行参数估计和过程优化。所谓机理模型,简单说就是把色谱柱内部的对流、扩散、吸附等物理…
镍基超导是当前凝聚态物理最火的方向之一。这篇文章用一套多尺度计算方法,把La₃Ni₂O₇高压下T_c为何先升后降的谜底挖到了"轨道选择性"层面,Kondo屏蔽与超交换的竞争图像非常漂亮,值得一读。
5G还没捂热,6G标准已在路上。AI在这张无线大网里到底该干什么?是换模块、重写目标,还是让网络自己"想"?IEEE大牛Geoffrey Li等人这篇十年综述把三个角色讲明白了,还指了条明路:未来拼的不是模型规模,而是物理约束下的可部署智能。想跟懂行的人聊透无线AI,这篇值得当"地图"读。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球