快手与北航新范式:从“挑视频”到“造视频”,广告视频可以现场拍
如果把短视频推荐系统想象成一家大型仓库,算法的工作就是“在仓库里找一件用户最可能喜欢的东西”。仓库越大,推荐越准。可问题在于:算法再聪明,也只能在仓库里挑,不能在用户最想要的那一刻,照着用户的心思现场做一件出来。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
如果把短视频推荐系统想象成一家大型仓库,算法的工作就是“在仓库里找一件用户最可能喜欢的东西”。仓库越大,推荐越准。可问题在于:算法再聪明,也只能在仓库里挑,不能在用户最想要的那一刻,照着用户的心思现场做一件出来。
把这个问题再往前推一步:潮流不收敛以后,电网调度员通常要反复“试探”——检查网络结构、分析残差、判断是不是无功支撑不够、猜想某个发电机电压定值压得太低,然后带着假设去跑仿真,不行就换个方向再来。
图1:披露门——五级有序门禁,释放三个深度层级。系统的状态是一扇“门”,而门所释放的是一个“深度”:只有信息深度不高于当前门所放行的层级时,这条信息才有资格浮出水面
当全世界都在卷Agent能力时,这篇由Stony Brook University和Old Dominion University合作的论文,罕见地将目光投向了最容易被忽视的用户群体——盲人。它用一份扎实的、基于真实世界1258条指令的实证数据,狠狠给“无所不能”的计算机使用代理(CUA)泼了盆冷水:最强模型成功率也仅52.5%。
AI编程助手不仅仅是代码工具。最新研究揭示,Claude Code、Codex等产品可能被恶意指令攻破,黑客可远程控制你的电脑。
斯坦福Chelsea Finn团队联合KRAFTON提出WHALE,把智能体优化从"单练模型"升级为"模型+执行框架交替进化",三个任务上最多提升24.38个百分点。对做智能体训练和Agent产品落地的朋友,这篇值得细读。
一堆AI医生会诊,居然还会“抱团跑偏”?把肺癌晚期患者往肿瘤科一推,完全无视血氧已经掉到危险线。华南理工等机构最近祭出新框架MASGR,把松散群聊升级成结构化推理图,再请来“仲裁官”把关,转诊准确率一口气顶到95.3%。
拍完照片,别人看主角还是背景杂物?调亮度、加对比度、局部压暗……折腾半天,效果不佳。
代码修复里最容易被忽略的,其实是“先去哪找”。这篇论文把仓库探索单独拎出来做基准,直接比较探索器的质量和成本,结论很实用:便宜模型未必差很多,但也不是谁都能省得漂亮。
拍文档照片最怕什么?阴影、模糊、歪斜、摩尔纹——哪怕是最强多模态模型也会当场翻车。直接拿恢复工具全图修一遍?可能越修越糟糕。华南理工这篇论文给了个聪明的解法:让模型自己判断“现在能不能答”,不能答再精准修复,修坏了还能自动回滚。全程免训练,效果逼近人类专家。
先来聊一个挺扎心的问题:AI 越来越强,但万一它学坏了怎么办?
当Claude Code、Codex在代码世界里大杀四方时,GUI软件依然是智能体的"最后屏障"。上海交大与BIGAI提出ASIL,用结构化JSON观测+语义化代码动作替代截图点击,让GPT-5.4在380个任务上拿下81.6%的成功率,而同样的任务截图控制只有6.6%。一句话操作就能完成截图控制15次点击都完不成的活,这可能是智能体交互的一次范式革命。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球