上交大TIPCODER:代码生成前先“审题”,一次生成反超8次采样
还在让代码大模型硬啃题目?上海交大等机构提出的TIPCODER做了个示范:先别急着写代码,让模型根据具体问题"出个主意",再动笔。就这么一个前置小动作,一次生成的效果反超了Best-of-8的多次采样,平均通过率最高冲到71.10,有点东西。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
还在让代码大模型硬啃题目?上海交大等机构提出的TIPCODER做了个示范:先别急着写代码,让模型根据具体问题"出个主意",再动笔。就这么一个前置小动作,一次生成的效果反超了Best-of-8的多次采样,平均通过率最高冲到71.10,有点东西。
考过程序设计竞赛的读者应该都有同感:决定命运的不是“你觉得自己写对了”,而是评测数据有没有精准戳中你代码里藏得最深的bug。
如果把短视频推荐系统想象成一家大型仓库,算法的工作就是“在仓库里找一件用户最可能喜欢的东西”。仓库越大,推荐越准。可问题在于:算法再聪明,也只能在仓库里挑,不能在用户最想要的那一刻,照着用户的心思现场做一件出来。
LLM做5G故障根因分析,最怕的就是一本正经地编证据。三星美研这次把“证据→诊断路径→结论”结构化地塞进微调过程,让1.5B小模型直接干出94.2%准确率。想研究LLM垂直落地与“反幻觉”设计的同学,这篇值得细读。
写代码时如果发现bug,你会不会把错误日志贴到代码最前面,一边看一边改?清华与Z.ai这篇新作就是干这个的:让大模型先自己想一遍,把推理草稿提到长正文前面再来一次,GraphWalks上准确率直接从29.2%飙到81.8%!
大模型生成视频"看起来美,动起来假"的顽疾有解了。这篇来自四川大学的工作,不去堆算力,而是给视频生成装上"物理事件链"大脑,用可量化的物理公式约束每个中间状态,在PhyGenBench上把物理贴合度均值提升到72.5%,值得做视频生成与世界模型的朋友细读。
分东西还要分任务?谁拿了好东西,谁多干了活,算法能分得大家都别红眼吗?一群做理论的人把这事儿掰扯清楚了——给每个参与者不同"权重"时,四校联合研究终于破解了混合了吗哪的难题,首次给出通用的高效分配方法。
把这个问题再往前推一步:潮流不收敛以后,电网调度员通常要反复“试探”——检查网络结构、分析残差、判断是不是无功支撑不够、猜想某个发电机电压定值压得太低,然后带着假设去跑仿真,不行就换个方向再来。
大模型"看图说话"时编造细节,一直缺乏严格的统计约束。弗吉尼亚理工这篇工作用模型自己的"内心独白"替换外部验证器,照样把错误率控制在数学保证范围内,还顺手把弃权率打了下去。值得所有关注多模态可靠部署的读者一读。
当思维链还在“一字一句”硬凹推理时,这篇论文直接让冻结的LLM在“脑内”用向量打草稿。仅训练1130万参数,就在符号推理上把零样本思维链拉高26.7个点,推理延迟还更低。是时候重新审视“推理必须说出口”这个前提了。
图1:披露门——五级有序门禁,释放三个深度层级。系统的状态是一扇“门”,而门所释放的是一个“深度”:只有信息深度不高于当前门所放行的层级时,这条信息才有资格浮出水面
大模型的"三好学生"人设,一换语言就崩?麦考瑞大学等机构给乌尔都语做了套"文化体检",人工逐句改造三大经典对齐基准,结果GPT-4o-mini的诚实度直接掉了20个百分点,安全护栏也形同虚设。🤚
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球