让代码AI出题考自己!南洋理工TCS两阶段强化学习方案全解析
考过程序设计竞赛的读者应该都有同感:决定命运的不是“你觉得自己写对了”,而是评测数据有没有精准戳中你代码里藏得最深的bug。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
考过程序设计竞赛的读者应该都有同感:决定命运的不是“你觉得自己写对了”,而是评测数据有没有精准戳中你代码里藏得最深的bug。
斯坦福Chelsea Finn团队联合KRAFTON提出WHALE,把智能体优化从"单练模型"升级为"模型+执行框架交替进化",三个任务上最多提升24.38个百分点。对做智能体训练和Agent产品落地的朋友,这篇值得细读。
大模型当裁判太烧钱?NYU和耶鲁的这项研究把奖励模型从8B干到了1.7B,评分更高还快10.7倍。用轻量探针从隐状态里挖信号,思路清奇又实用,做RL的朋友值得一看。
全心脏分割( Whole-Heart Segmentation,WHS )是医学影像分析中的一项经典任务:给定一张心脏区域的CT或MRI扫描图,模型需要把七个关键结构完整勾画出来——左心室心肌( Myocardium,M。
聊超分绕不开一个千古难题:又想马儿跑得快(细节丰富、观感锐利),又想马儿不吃草(结构保真、贴合原图)。这两件事在底层视觉里长期互相打架,逼着研究者要么偏科要么和稀泥。
训练扩散Transformer最烧钱的不是模型,而是优化器?Meta这篇新作把Muon优化器从1.3B一路验证到15B,生成质量稳定赢过AdamW最高19.1%,又用「周期性行式」设计把优化器通信量砍掉66.7%。质量不掉、速度反超,训练成本敏感的同学值得细读。
这篇论文最有冲击力的地方,不是零遗忘的堆栈设计本身,而是那个反常识的发现:医疗提示在97%的情况下会路由到聊天+数学堆栈——它们训练时根本没见过医疗数据。这说明微调注入的是可迁移的认知原语,而不是领域知识。思考方式被当作"能力"打包,这件事值得所有做微调的人停下来想想。
继8月推过单次采样SAPO之后,强化学习训练多轮智能体又有新活。这次厦大和南洋理工的合作工作,只靠“成功轨迹的长度”这一个几乎零成本的信号,就把GRPO平均拔高27.2%,还顺带解决了成功轨迹之间的“优势坍缩”难题,值得一读。
这篇论文把“谁来判断压缩图像好不好”这个老问题翻出了新花样。斯坦福和谷歌团队发现,Gemini 2.5-Flash这类通用视觉语言模型,竟然能零样本复现人眼的相似度判断,干脆把它请来当裁判,用偏好优化把扩散自编码器训得更懂人眼。结果在多个基准和上万次用户评测里直接干到第一梯队。想看看VLM怎么当评委、这条路能省多少人工标注成本?这篇值得一读。
智能体强化学习正处在大模型后训练的核心位置,但PPO太贵、GRPO又存在信用分配短板。本文提出SAPO,用一条自回归流同时搞定策略与价值估计,在ALFWorld和WebShop上比PPO/GRPO平均涨15.1/12.1个百分点,还省掉独立critic、提速33.2%。一句话:值估计的便宜和单采样的高效,这次全都要。
微调大模型,LoRA 省显存但总差口气?中科大新方法 LoRA-GA² 表示:只盯一步梯度确实容易“短视”,多走几步、看看真实的微调轨迹,GLUE 直接反超全量微调,显存还一分不多花。
人类觉得"闭着眼都能做"的插拔动作,对机器人来说,却是灵巧操作领域最硬的骨头之一。尤其是当机器人换上一只仿人五指手,光是"让五根手指协调起来把东西捏稳、转正、再对准插进去"这一套动作,就足够让无数强化学习训练曲线原地去世。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球