新范式!大模型自主设计质量多样性算法,机器人零干预学技能
想让机器人掌握一项新技能,传统做法是让专家手动设计各种评估函数和多样性指标,费时费力还经常翻车。这篇论文的思路很野:直接把自然语言任务描述丢给大模型,让大模型自己设计整套质量多样性算法的参数。结果如何?4个操作任务上生成的可用技能数量是专家方案的近70倍。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
想让机器人掌握一项新技能,传统做法是让专家手动设计各种评估函数和多样性指标,费时费力还经常翻车。这篇论文的思路很野:直接把自然语言任务描述丢给大模型,让大模型自己设计整套质量多样性算法的参数。结果如何?4个操作任务上生成的可用技能数量是专家方案的近70倍。
语音增强有个老毛病——噪声压下去了,说话声的高频细节也跟着"缩水"了。根特大学这回不堆模型,而是从损失函数下手,让网络学会按频率和语音能量"区别对待",高频重建误差直降15%以上。方法轻巧,思路值得一看。
InSAR相位恢复一直靠固定滤波器硬扛,可每一对影像的几何参数都不一样,这就像用同一副老花镜看所有距离的物体。芬兰团队提出FiLM-GPNet,给网络装上“几何调节旋钮”,时间残差直降68%,而且换个城市不用重新训练,零样本直接上手。
拍文档照片最怕什么?阴影、模糊、歪斜、摩尔纹——哪怕是最强多模态模型也会当场翻车。直接拿恢复工具全图修一遍?可能越修越糟糕。华南理工这篇论文给了个聪明的解法:让模型自己判断“现在能不能答”,不能答再精准修复,修坏了还能自动回滚。全程免训练,效果逼近人类专家。
全心脏分割( Whole-Heart Segmentation,WHS )是医学影像分析中的一项经典任务:给定一张心脏区域的CT或MRI扫描图,模型需要把七个关键结构完整勾画出来——左心室心肌( Myocardium,M。
聊超分绕不开一个千古难题:又想马儿跑得快(细节丰富、观感锐利),又想马儿不吃草(结构保真、贴合原图)。这两件事在底层视觉里长期互相打架,逼着研究者要么偏科要么和稀泥。
大模型靠语言"封神",但如果视觉才是通往AGI的真路呢?OpenAI、DeepMind、斯坦福等21位学者联合发布白皮书,正面挑战"语言中心主义"——看完这篇,你对AGI路径的理解可能要重构。
当开源视频数据集还在几百万视频级别徘徊时,LAION直接把数字拉到了8000万视频、1000万小时,还一口气验证了视频、音频、图像三种模态的预训练效果。这种级别的数据弹药,对做多模态研究的团队来说,值得好好研究。
先问一个很真实的问题:一个部署在野外监控杆上的图像恢复系统,第一年只需要去噪,第二年碰上了雾霾天开始需要去雾,第三年台风季又来了要处理雨纹。每一次新需求,难道都要把旧数据翻出来重新训练一遍?
大型加速器里,束流图像分割以前还得靠人工框选,现在机器学习直接像素级搞定,IoU冲到0.96,还能实时跑在一台Mac mini上。这波操作,值得一看。
联邦学习在车上,梯度在公开网络中传输,易被中间人攻击。论文结合差分隐私和同态加密,用DP参数决定加密哪些梯度,攻击下准确率从10.4%提升至78.2%,开销增加约8-10%。思路清晰,实用性强。
又一篇零样本视频修复的狠活。天津大学团队把文本到图像扩散模型用出了花:不用训练就能修视频,还支持文本、图像两种参考输入,推理速度直接砍到三分之一,时序一致性指标WE降到原来的五分之一。被视频闪烁折磨过的同学,这篇值得重点研究。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球