Bengio团队新作:用强化学习把贝叶斯符号回归做成后验采样器
先把镜头拉远一点。物理学家手里有一堆实验数据,然后想从里面挖出一条公式——比如爱因斯坦那个 E = mc²。放在过去,这得靠灵光一现。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1655 篇文章
先把镜头拉远一点。物理学家手里有一堆实验数据,然后想从里面挖出一条公式——比如爱因斯坦那个 E = mc²。放在过去,这得靠灵光一现。
一说到DXA(双能X射线吸收测定法),大多数人脑海中浮现的画面大概是体检中心排队时,躺在一台白色仪器上,几分钟后拿到一张写着骨密度T值的报告单。这玩意儿在临床上主要就干一件事:判断你有没有骨质疏松。
给AI代理发工具权限就像借车给实习生——怕他乱开。Niyam-AI直接上密码学“行车记录仪+电子围栏”:每次工具调用都得先过轻量Judge模型,再生成零知识证明,F1 88.5%、误报率仅1.1%,关键是任何第三方都能在53毫秒内验证“安全检查真的发生了”。同类工作里把ZK证明用到agent工具调用验证上的,这是头一遭。
大模型推理贵、响应慢,一直是落地最扎心的痛点。苹果、谷歌DeepMind、哈佛这次联手给16B扩散语言模型LLaDA 2.1动了场小手术:6层注意力换成线性版本,只训练约60小时就换来最高1.7倍解码加速,代码已开源。扩散模型也能线性化,这波操作值得细品。
同一个从箭图到晶体:一个正组合规则的诞生 这篇论文讨论的对象叫箭图(quiver),说白了就是一个有向图。给箭图的每个顶点安排一个有限维复向量空间、给每条箭头安排一个线性映射,就得到了一个箭图表示(quiver representation)。
单目标强化学习靠“换网络结构”就能白捡一大截性能,多目标强化学习却还在算法泥潭里打转?马萨里克大学和阿托大学的最新研究直接把SimbaV2架构搬进MORL,HV暴涨132%,证明“算法不够,架构来凑”这条路在多目标领域同样走得通。对正纠结算法创新还是架构升级的读者来说,这篇论文给出了一个极具性价比的新方向。
把特征拼一起,就像把所有水果丢进一台榨汁机——最后没人知道哪一口是苹果、哪一口是橙子,更不知道是哪个"果"在犯错。西湖大学这篇新工作干脆给残差上"户口":先分清谁的错,再动手修。实测同一批特征、同一批树上限,扣费收益从13.52%干到19.10%、夏普1.42→2.09。这份"残差代数",值得所有做表格学习、量化选股的人细品。
托卡马克这个“人造太阳”里,电磁湍流居然是电流的搬运工?瑞士洛桑联邦理工和普林斯顿的最新非线性模拟发现:过去被嫌弃“太轻没存在感”的电子,在电磁湍流中居然靠麦克斯韦应力主导了动量输运,电流剖面都可能被它悄悄改写。文中还首次在GENE与CGYRO两套代码中补全了电磁动量通量诊断,并做了交叉验证。
上网课时,同一个知识点好几位老师都讲了视频,你会固定只点某一位老师的来看吗?本期论文用一整学期的点击流数据告诉你:超过一半的学生打一开始心里就有“偏向”,而且这个偏好还会随着学期推进悄悄改变。教育技术还能这么量化研究,有点意思。
图2:HD-REC整体架构。(a)HDQ通过全局共享粗粒度量化和自适应路由细粒度量化构建语义ID。(b)DAS MoE结合常驻共享专家与动态选择的特化专家。
这是龙哥近期看到的最有“反常识”的AI安全论文:正常防御都是让模型变笨或推理变慢,Apple却反手把训练成本拉满,推理保持原速,还顺手把自适应攻击者挡在门外。方向清奇且实验扎实,值得一读。
这篇论文把推测解码的老问题拆得很清楚:目标模型有相当比例的“重写”其实毫无价值,因为重写前后的推理步骤质量差不多,算力却要照付。ARBITRAGE直接用轻量路由器预估“这一步目标比草稿强多少”,只在真正有可能更优时才升级到目标模型,数学推理任务上端到端延迟最多降约2倍。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球