代码生成|中科院大作:安全测试当规范,结构化反馈零回归修复80个
大模型生成的代码能跑就算完?一测就出安全漏洞的场面见过太多。这篇论文把安全测试当“可执行规范”提前塞给模型,2705条轨迹实测:隐藏的联合成功率平均涨19.3个百分点,但也有模型越看测试越翻车。机制级严谨、工程级实用,值得细读。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1660 篇文章
大模型生成的代码能跑就算完?一测就出安全漏洞的场面见过太多。这篇论文把安全测试当“可执行规范”提前塞给模型,2705条轨迹实测:隐藏的联合成功率平均涨19.3个百分点,但也有模型越看测试越翻车。机制级严谨、工程级实用,值得细读。
论文标题: An AI Scientist that Doesn’t Drift: Taste, Structure, and Falsifiable Findings in a Quadruped Navigation Research Loop 发表日期: 2026年08月 发表单位: California Institute of Technology
道路缺陷检测最怕输入图像又糊又暗——坑洼裂纹在模糊里“隐身”,再强的检测器也得抓瞎。RMIT团队这篇工作直接把退化证据变成恢复条件,让复原后的图像“喂”给检测器,8种退化场景里7项精度领先。方法简洁、定位精准,适合所有做巡检和车载视觉的团队围观。
统计检验的天花板:这篇论文证明,即使数据来自平稳遍历过程、样本无限增长,也没有任何检验能靠有限样本把“坐标过程独立”判断得又准又稳——假阳性率下界高达1/2。思路用稀有标记+交替块耦合构造反例,读起来像一场精巧的数学魔术。
一张参考图,一段文字,13秒在线微调,不用预训练不用大算力,就能让扩散模型在生成过程中同时锁定"主体像不像"和"文字听不听话"。这种把炼丹塞进推理管线的思路,工程落地潜力很值得一看。
当业界还在用单表抽取评测文档理解时,港科大(广州)团队直接抬高了门槛——Doc2DB-Bench要求从长文档里重建完整的关系数据库,边从表格到数据库:为什么文档理解需要新范式 先看一个真实场景:一份几十页的金融报告,里面写了好几家公司的现金流数据、股权关系、投资链路。传统做法是让大模型把里面的公司名称、金额、年份挨个抠出来,填进一张大表里完事。
一步超分又有新玩法:西工大MeanSR不靠教师模型蒸馏,直接学习低分辨率条件下的平均速度场来显式建模恢复轨迹,CLIPIQA、MUSIQ、MANIQA全面涨,FLOPs只有之前最强单步方法CTMSR的约1/6,推理还快了近一倍。感兴趣怎么实现的,往下看。
超导雪崩就像个暴脾气,说翻脸就翻脸。波兰科学院往块体铌钛超导盘的界面层里掺了点银粉,雪崩阈值随温度的变化规律直接“反着走”——非单调、有峰值,而且现有准静态理论居然算不出这个结果。超导稳定性控制,又多了一个新抓手。
视频超分模型碰到真实世界里的压缩伪影、噪点、模糊就翻车,这是老难题了。这篇论文把「测试时自适应」玩出了花:不重新训练、不要高清参考,AI模型边推理边自我调整,画质和文字清晰度都有实打实的提升。思路接地气,实验做得很扎实,值得一读。
先抛一个小问题:如果地上摆满了大小完全一样的西瓜,只能挑、不能挪,挑出来的西瓜还得两两互不挨着——那么最多能挑走总体积的几成?这事儿放到高维空间里,数学家从1928年断断续续想到现在,连个像样的下界都差点意思。最近,一篇论文用统计物理里的“硬核模型”,把这个困扰近百年的几何难题往前大幅推进:下界直接从一个常数因子翻到了维度因子d。这不是挤牙膏式的优化,而是把
图像编辑最怕什么?改完目标,背景也跟着面目全非。这篇ACM MM 2026论文提出ATDEdit,把扩散Transformer的采样过程改造成异步Token解码,用Token级条件惊奇在线发现"该改哪些Token",不需要外部掩码、不需要微调,在PIE-Bench上把背景保持的PSNR推到27.44dB。方法干净、思路漂亮,值得一读。
如果有一个目标在碰运气式的“两房间”里来回躲藏,搜索者每次只能查一个房间,而且即使查对了房间也可能看走眼——这种情况下,搜索策略的最终形态到底是怎样的?这个问题听起来像抓猫,其实是运筹学与随机控制领域里一个流传了四十多年的经典难题: Ross猜想 。本文用一个极其漂亮的“词对分解+射影几何”组合,把最后一块未证的拼图补上了。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球