LLM竟是世界模型特例?Meta论文拆出连续谱系
这篇文章最有意思的地方,不是又在给LLM贴新标签,而是把“token模型”和“世界模型”之间那道墙直接拆成了坡道。它把争论从“是不是”拉回到“走到哪一步、代价是什么”。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1660 篇文章
这篇文章最有意思的地方,不是又在给LLM贴新标签,而是把“token模型”和“世界模型”之间那道墙直接拆成了坡道。它把争论从“是不是”拉回到“走到哪一步、代价是什么”。
这篇不是“又一个伽马射线源”,而是把微类星体 GRS 1915+105 直接送上了银河系极端加速器的牌桌。LHAASO 联合 Fermi-LAT 给出了从 GeV 到 PeV 的完整证据链,关键是还看到了“位置偏移 + 无明显截断”这两个很会讲故事的信号。
端到端加密的痛点,从来不是“能不能加密”,而是“怎么证明你拿到的公钥真是对的”。DKVE把社交图谱搬出来当裁判,再用隐私保护和统计检验收尾,思路挺巧,也挺实用。
这篇 MIT 的论文不跟你争“指数到底是不是 1/3”,它直接把焦点挪到更实用的地方:系数。指数像规矩,系数像手感;前者决定大方向,后者才真管模型怎么长、算力怎么花。
大模型量化里最难啃的骨头之一,就是把权重压到三元还别把精度摔碎。CAT-Q这篇很有意思:不用百亿token重训,靠后训练量化就能把1.7B到235B模型压到1.58比特,且对QAT三元方法也不怵,值得认真看看。
这篇工作挺有意思:同一个交叉扩散系统,居然能从“永远分家”走到“有限时间混合”,而且还不是拍脑袋猜出来,是严丝合缝地构造出来的。更狠的是,作者还给出了混合速度的定量估计,数学味很足,故事性也很强。
这篇不是“发明新招”的论文,而是把21厘米强度映射里最容易翻车的地方一口气捋清:前景、波束、1/f噪声、信号损失,外加GNILC、贝叶斯和深度学习三条路线怎么选。对想把SKA-Mid真正做成“能用的宇宙学工具”的同学,这篇很对胃口。
联邦学习一边怕通信太贵,一边怕梯度把隐私抖出来。FHPLF干脆把实数梯度换成二进制“梯度样信号”,再配上投影汉明距离和SBG-PEU,思路很狠,结果也很实在。
CMS这次不是靠“更大力出奇迹”,而是靠一套很聪明的触发器,把长寿命粒子在缪子系统里留下的“多击中”特征抓得更稳。对想看LHC怎么把前沿物理真正落到在线系统里的读者,这篇很对味。
黑盒模型不是不能用,关键是别把它当“神谕”。这篇论文把“能不能安全借力”讲成了一个清清楚楚的相变问题,还给出一个不容易翻车的残差补救方案。
这篇论文把“代数结构扭一扭还能不能活”这个问题,直接升级成了非交换基上的 coquasi-bialgebroid。别看名字像在念咒,核心其实很清楚:把双代数、3-cocycle 和 cocycle twisting 串成一套统一语言,理论控会很开心。
这篇论文最有意思的地方,是把功放设计从“靠经验+靠仿真”推进到“CNN先猜、遗传算法再搜”的自动化路线。更狠的是,它不是只做了个纸上模型,而是直接做出了可测的GaN原型机。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球