告别偏科!DeepMind视频模型首次兼顾动作与结构双能力
视频模型看懂动作却丢了空间结构,图像模型擅长几何却不懂运动——DeepMind用一套循环掩码自编码器RVM把两边的好处全占了,只靠像素重构损失,小模型还不需要蒸馏,参数效率最高领先30倍。这事儿有点意思,值得花三分钟读一读。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
视频模型看懂动作却丢了空间结构,图像模型擅长几何却不懂运动——DeepMind用一套循环掩码自编码器RVM把两边的好处全占了,只靠像素重构损失,小模型还不需要蒸馏,参数效率最高领先30倍。这事儿有点意思,值得花三分钟读一读。
DNA甲基化被誉为“基因组的第二张名片”,但它如何被DNA序列决定,学界一直没完全搞清。Nature Communications刚发表一篇论文:给模型10kb碱基序列,它就能在39种人类组织里精准预测甲基化状态,还顺手把基因变异对甲基化的影响也预测了。这活儿干得漂亮,值得细读!
这年头能见到一篇"把大模型跑不起来的原因逐条列清楚"的论文,真不容易。研究者把Nanbeige4.2-3B在Apple Silicon上五个独立bug连根拔起,还顺手给出分块预填充方案让上下文扩展2.7倍,干货密度极高。想在Mac上玩agent模型的同学,这份排雷报告必须收藏。
这期聊一篇纯数学论文,主题是特征2下Specht模的平凡直和项分类。别看名字唬人,其实问题很直觉:对称群的"积木"里,什么时候会藏着一块最平凡的"1×1乐高"?Murphy解决了钩子情形,Collins-Dodge把一般情形问了出来,这篇论文用KLR分次一招封死:非钩子全灭。干净、完整、还顺手给了一个优雅的度数矛盾。
世界模型这两年火得发烫。无论是视频生成、机器人控制还是游戏AI,都指望它能学会在脑子里模拟真实世界的变化规律。可大伙儿慢慢发现一个尴尬现状:让世界模型在开放世界里随便"脑补"未来,它玩得挺欢;
自动驾驶这事儿,有个特别拧巴的现象:你看那些端到端大模型,在 benchmark(标准测试基准)上跑分一个比一个高,可一放到真实世界里,偶尔会像个刚拿驾照的新手一样,干出些让人血压飙升的事儿——比如老老实实闯个红灯,或者。
机器人操作正从“看一步动一步”走向“预见式决策”,但生成未来视频开销太大。上海交大等团队提出的ForeWAM,用一次KV预填充让动作模型“脑补”动态未来,不生成视频、不用未来观测,LIBERO成功率96.7%,动作延迟比Fast-WAM降67%。这篇论文值得细读。
纯数据驱动的医学分割模型已经够卷了,但几乎没人把线性代数和矢量微积分“硬塞”进网络。M-Net直接给出答案:把条件数、散度、旋度当先验注入U-Net,肝脏分割Dice比基线猛涨12.37%,还能端到端训练。想了解“数学+深度学习”还能玩出什么花活?这篇值得细品。
大模型推理集群的GPU浪费有多严重?这篇来自微软研究院、莱斯大学的系统论文,把扩缩容的“最小颗粒度”从整个模型打碎到单个算子,用毫秒级弹性换回最高36.3%的GPU节省,在A100和GB200集群上都验证了效果。做LLM infra的读者值得细读。
传感器协同跟踪的老问题:摄像头这类高成本传感器,到底该让哪几个节点开机?UCLA这篇论文把“选传感器”当成“做推荐”,用双塔MLP加声学频带特征,在真实外场干扰环境下把命中率从80.4%拉到98.4%,每次决策的在线计算只要约1毫秒。思路跨界又好落地,值得一读。
想象一下:你正坐在家里吹着空调,屋顶光伏板正在发电。突然一片云飘过来,光伏输出瞬间掉了一半;云飘走,输出又瞬间拉满。这种"过山车式"发电曲线,正是光伏并网最大的痛点。
还在为隐式神经表示(INR)提取拓扑头疼?这篇论文给出一个极简却扎实的思路:只要确保网格边相对底层函数单调,PL网格的临界点就不会“凭空冒出来”。方法不需要复杂的符号计算,纯点采样加细化就能在INR上准确找回临界点,实现又省又稳。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球