上交大TIPCODER:代码生成前先“审题”,一次生成反超8次采样
还在让代码大模型硬啃题目?上海交大等机构提出的TIPCODER做了个示范:先别急着写代码,让模型根据具体问题"出个主意",再动笔。就这么一个前置小动作,一次生成的效果反超了Best-of-8的多次采样,平均通过率最高冲到71.10,有点东西。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
还在让代码大模型硬啃题目?上海交大等机构提出的TIPCODER做了个示范:先别急着写代码,让模型根据具体问题"出个主意",再动笔。就这么一个前置小动作,一次生成的效果反超了Best-of-8的多次采样,平均通过率最高冲到71.10,有点东西。
考过程序设计竞赛的读者应该都有同感:决定命运的不是“你觉得自己写对了”,而是评测数据有没有精准戳中你代码里藏得最深的bug。
视频流一帧一帧地来,模型能不能不串号、不手抖、不跟丢?西安交大联合EngineAI提出TempoGround,让视觉语言模型在流式输入下连续输出稳定的2D/3D框,3D精度平均提升7.5。这套“状态感知课程预测+强化学习”的组合拳,值得做具身智能和多模态感知的同学认真看一眼。
当大模型碰上对话推荐,最怕的不是模型笨,而是它“聊完就忘”。这篇EMNLP 2026主会论文直接抛弃了把上下文堆进Prompt的粗暴玩法,提出双节点蒙特卡洛树搜索框架DREAMS,一边主动问偏好,一边把对话状态变成精准检索查询,成功率平均提升7.43%,Redial上R@1高达0.507,还开源了代码,值得一读!
在机器人学习圈子里,长期存在一个有点“程序员味”的执念:能不能别让模型把每个动作都当成一行新代码来背,而是像人写程序一样,先把“拿起”“放下”“对齐”这类子技能抽成函数库,遇到新任务直接调用?
视频生成卷到今天,画面早就不稀奇了,但大部分模型要么不出声,要么声音是后期硬贴上去的。阿里DreamX团队直接把声音和画面“打包生成”,还只用了7B参数就敢对标22B/33B的大块头,并且开源了2K精炼器,值得想搞多模态生成的朋友细品。
大模型当裁判太烧钱?NYU和耶鲁的这项研究把奖励模型从8B干到了1.7B,评分更高还快10.7倍。用轻量探针从隐状态里挖信号,思路清奇又实用,做RL的朋友值得一看。
想让机器人掌握一项新技能,传统做法是让专家手动设计各种评估函数和多样性指标,费时费力还经常翻车。这篇论文的思路很野:直接把自然语言任务描述丢给大模型,让大模型自己设计整套质量多样性算法的参数。结果如何?4个操作任务上生成的可用技能数量是专家方案的近70倍。
奖励信号怎么给,才能让大模型在开放域问答里真正学会“有理有据、条理清晰”?苹果这篇最新论文把笼统的偏好打分换成了多维评分细则,效果直接涨了6.5%。路子够巧,值得一读。
当Claude Code、Codex在代码世界里大杀四方时,GUI软件依然是智能体的"最后屏障"。上海交大与BIGAI提出ASIL,用结构化JSON观测+语义化代码动作替代截图点击,让GPT-5.4在380个任务上拿下81.6%的成功率,而同样的任务截图控制只有6.6%。一句话操作就能完成截图控制15次点击都完不成的活,这可能是智能体交互的一次范式革命。
太空机器人一旦硬件故障,传统强化学习就抓瞎——因为真空中根本算不出奖励信号。卢森堡大学这篇工作把世界模型玩出了新高度:预训练阶段把奖励函数"记住"在隐空间里,部署后冻结奖励预测器、只更新转移动力学,60分钟无监督数据就能让机器人自我修复。三大任务、代码开源、效果诚实不吹牛,值得一读。
这可能是今年最值得安全协议研究人员读的一篇理论文:把干了四十年的Dolev-Yao攻击者从“能力模型”升级成“激励模型”,让攻击者学会算账,收益小于成本就不攻击。论文证明理性安全可判定,还给出了可计算的阈值,并在支付协议和ThreeBallot投票两个用例中展示了如何“用钱说话”。建议所有做安全协议验证、密码学形式化、投票方案的朋友都读一下。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球