代码生成|中科院大作:安全测试当规范,结构化反馈零回归修复80个
大模型生成的代码能跑就算完?一测就出安全漏洞的场面见过太多。这篇论文把安全测试当“可执行规范”提前塞给模型,2705条轨迹实测:隐藏的联合成功率平均涨19.3个百分点,但也有模型越看测试越翻车。机制级严谨、工程级实用,值得细读。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
大模型生成的代码能跑就算完?一测就出安全漏洞的场面见过太多。这篇论文把安全测试当“可执行规范”提前塞给模型,2705条轨迹实测:隐藏的联合成功率平均涨19.3个百分点,但也有模型越看测试越翻车。机制级严谨、工程级实用,值得细读。
论文标题: An AI Scientist that Doesn’t Drift: Taste, Structure, and Falsifiable Findings in a Quadruped Navigation Research Loop 发表日期: 2026年08月 发表单位: California Institute of Technology
统计检验的天花板:这篇论文证明,即使数据来自平稳遍历过程、样本无限增长,也没有任何检验能靠有限样本把“坐标过程独立”判断得又准又稳——假阳性率下界高达1/2。思路用稀有标记+交替块耦合构造反例,读起来像一场精巧的数学魔术。
一张参考图,一段文字,13秒在线微调,不用预训练不用大算力,就能让扩散模型在生成过程中同时锁定"主体像不像"和"文字听不听话"。这种把炼丹塞进推理管线的思路,工程落地潜力很值得一看。
超导雪崩就像个暴脾气,说翻脸就翻脸。波兰科学院往块体铌钛超导盘的界面层里掺了点银粉,雪崩阈值随温度的变化规律直接“反着走”——非单调、有峰值,而且现有准静态理论居然算不出这个结果。超导稳定性控制,又多了一个新抓手。
先抛一个小问题:如果地上摆满了大小完全一样的西瓜,只能挑、不能挪,挑出来的西瓜还得两两互不挨着——那么最多能挑走总体积的几成?这事儿放到高维空间里,数学家从1928年断断续续想到现在,连个像样的下界都差点意思。最近,一篇论文用统计物理里的“硬核模型”,把这个困扰近百年的几何难题往前大幅推进:下界直接从一个常数因子翻到了维度因子d。这不是挤牙膏式的优化,而是把
图像编辑最怕什么?改完目标,背景也跟着面目全非。这篇ACM MM 2026论文提出ATDEdit,把扩散Transformer的采样过程改造成异步Token解码,用Token级条件惊奇在线发现"该改哪些Token",不需要外部掩码、不需要微调,在PIE-Bench上把背景保持的PSNR推到27.44dB。方法干净、思路漂亮,值得一读。
如果有一个目标在碰运气式的“两房间”里来回躲藏,搜索者每次只能查一个房间,而且即使查对了房间也可能看走眼——这种情况下,搜索策略的最终形态到底是怎样的?这个问题听起来像抓猫,其实是运筹学与随机控制领域里一个流传了四十多年的经典难题: Ross猜想 。本文用一个极其漂亮的“词对分解+射影几何”组合,把最后一块未证的拼图补上了。
数学猜想又倒一个!这篇论文用构造性反例直接推翻超凯勒周期-指标猜想,而且起点竟然是两位作者各自用大语言模型辅助算出来的。K3^[2]型和Kum^2型四维反例、周期2指数被8整除、周期5指数被125整除,证据链硬核,值得仔细品。
预取器是芯片里的“预言家”,过去全靠人类工程师手搓,如今Google联合UC Berkeley让LLM进化智能体自己“进化”出一个三级预取器,直接拿下DPC4冠军,IPC比人类顶级方案还高0.3%,低带宽场景下更是领先2%。这是AI自动硬件设计第一次真正在权威竞赛里赢过人类冠军,值得所有做体系结构和AI的人围观。
AI做科研这件事,已经不再是“帮忙查文献”这种打杂级别了。如今的自主科研智能体能够自己提出假说、写代码、跑实验、解读结果、再修改方案,流程跑得飞起。
机器人领域最缺的不是新模型,而是让模型跑起来的"标准化插头"。港大MMLab与清华联合开源的XPolicyLab,把N个策略连M个环境的成本从O(NM)压到O(N+M),实测集成时间从5小时干到30分钟,是真实工程痛点的一记重拳。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球