港大清华开源XPolicyLab:42个机器人策略一套接口打通,集成效率提升10倍
机器人领域最缺的不是新模型,而是让模型跑起来的"标准化插头"。港大MMLab与清华联合开源的XPolicyLab,把N个策略连M个环境的成本从O(NM)压到O(N+M),实测集成时间从5小时干到30分钟,是真实工程痛点的一记重拳。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
机器人领域最缺的不是新模型,而是让模型跑起来的"标准化插头"。港大MMLab与清华联合开源的XPolicyLab,把N个策略连M个环境的成本从O(NM)压到O(N+M),实测集成时间从5小时干到30分钟,是真实工程痛点的一记重拳。
两步视频生成一直面临“要质量还是要多样性”的取舍难题。北大、阿里与清华联手提出的DUET,干脆让sCM和DMD两位专家按噪声级分工,高噪声步管结构多样性,低噪声步管细节质量,实验显示多样性比DMD翻倍、质量还追平了DMD。思路简单到让人拍大腿,效果却相当能打。
视频大模型对着画面侃侃而谈,却常常“睁眼说瞎话”?中科院团队提出VADER,一个纯推理期干预的训练无关框架,让LLaVA-Video-7B在EventHallusion上飙到72.60%,还顺手超越了依赖额外训练的TPO与RRPO。不微调也能这么能打,值得一读。
Google DeepMind把动态4D重建做成了"点单式"服务:一段视频编码一次,任何时间、任何空间位置的3D坐标随查随到。200+FPS位姿估计、18-300倍跟踪提速,CVPR 2026最佳论文的含金量,龙哥带大家一探究竟。
磁粒子成像(MPI)是很有前景的医学影像模态,但分辨率被系统矩阵的粗糙网格卡死,想提分辨率就得重新做几小时甚至更久的标定扫描。这篇论文把超分辨率直接揉进PnP重建框架,用预训练去噪器零样本干活,不训练不微调,在合成和真实数据上都把分辨率提上去了,思路非常实用。
为什么值得读?CVPR 2026最佳论文荣誉提名作品,把“攻击-防御”对抗博弈引入SAM提示词优化——用攻击者主动制造干扰,逼出能抗干扰的提示词优化器,全程无需下游任务标注,即插即用,医学图像上最多涨超15个百分点。思路清奇,值得一看。
大伙儿平时用手机拍照,有没有遇到过这种场景:明明窗外阳光正好,拍出来的照片却一半清晰一半糊,或者人脸是清楚的,背景却蒙了一层雾。这时候大多数修复算法会怎么做?
水下机器人在港口干活,洋流、缆绳、尾波全是不讲道理的随机扰动。这篇论文把随机物理信息神经网络搬上李群,用欧拉-庞加莱动力学做骨架,让模型既懂物理又懂几何,仿真到实测一步到位,把MPPI导航成功率从65%拉到90%,是随机动力学建模难得的完整落地案例。
运动生成界的“解耦大师”来了!MoCoDiff把文本、风格、历史信息拆成独立控制通道,在冻结扩散骨干上即插即用,长序列不漂移、风格不串味,效率还直接冲到136.89 FPS——动画师看了想点赞,研究者看了想复现。
摇杆遥操作机器人一直是“手残党劝退”重灾区:按钮全靠背,速度控制全凭手感。这篇论文直接把手指滑动变成机械臂运动,20人跨国实测完成时间直降53.5%,认知负荷也压了下来。想少练“手劲”的核工业接班人,值得一看。
Meta在RecSys 2026上放了颗实弹:用LLM Agent把推荐系统从"被动猜你喜欢"变成"用户实时说了算"。三层架构干净利落,离线准确率98.85%,线上A/B负面反馈同时下降,是目前少见的工业级对话推荐实战样本,搞推荐的同学值得一读。
JPEG一压狠了,画面就糊成一团。传统方法要么回归均值磨平纹理,要么生成式模型脑补纹理骗过人眼却坑了下游模型。FDIR用两阶段解耦把这笔“三角债”理清了,只用3.5K张图就拿下7/10下游任务领先,值得做压缩恢复的同学都看一眼。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球