图像生成|南科大新作:在线微调13秒搞定个性化文生图,主体一致性稳了
一张参考图,一段文字,13秒在线微调,不用预训练不用大算力,就能让扩散模型在生成过程中同时锁定"主体像不像"和"文字听不听话"。这种把炼丹塞进推理管线的思路,工程落地潜力很值得一看。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
一张参考图,一段文字,13秒在线微调,不用预训练不用大算力,就能让扩散模型在生成过程中同时锁定"主体像不像"和"文字听不听话"。这种把炼丹塞进推理管线的思路,工程落地潜力很值得一看。
机器人部署最怕什么?模型离线训得好,一到现场就“水土不服”。理想汽车联合多所高校提出VANE框架,把测试时训练做成“提案—验证—提交”的可靠流程:用未来视觉表征预测当监督信号,只在关键时刻更新,错了还能回滚。SimplerEnv上WidowX平均成功率提升3.2个百分点,反向传播计算量削减98.7%。把“边干边学”从口号变成了可信工程。
两步视频生成一直面临“要质量还是要多样性”的取舍难题。北大、阿里与清华联手提出的DUET,干脆让sCM和DMD两位专家按噪声级分工,高噪声步管结构多样性,低噪声步管细节质量,实验显示多样性比DMD翻倍、质量还追平了DMD。思路简单到让人拍大腿,效果却相当能打。
告别逐镜头生成的割裂感,快手Kling团队联合清华、南大提出的ContextMaster,把生成、参考和编辑统一进一个模型,在单卡上跑到16 FPS的同时,还能让角色和场景在多镜头之间保持一致。🔍 想看懂这套固定预算稀疏路由怎么在有限算力下留住完整记忆?这篇值得细读。
大模型推理贵、响应慢,一直是落地最扎心的痛点。苹果、谷歌DeepMind、哈佛这次联手给16B扩散语言模型LLaDA 2.1动了场小手术:6层注意力换成线性版本,只训练约60小时就换来最高1.7倍解码加速,代码已开源。扩散模型也能线性化,这波操作值得细品。
这是龙哥近期看到的最有“反常识”的AI安全论文:正常防御都是让模型变笨或推理变慢,Apple却反手把训练成本拉满,推理保持原速,还顺手把自适应攻击者挡在门外。方向清奇且实验扎实,值得一读。
自回归模型统治语言建模多年,但Apple这次把连续流模型直接干到了1.7B参数、2.1T tokens的规模,自蒸馏后只需4步推理就能生成高质量文本。这是CFM路线迄今最大规模的实证,值得所有关注非自回归生成的人仔细看看。
多元时间序列预测最被忽视的角落,其实是未来变量之间"一起涨跌"的结构关系。这篇来自悉尼科技大学、清华和港科大广州的工作提出CvLoss,一个即插即用的损失正则项,不改模型结构就能在114组受控对比中拿下111胜,推理还零开销。
手机拍完照,噪点糊一脸?上海交大这个LiteKD-Net给出一个相当务实的答案:把重型去噪网络的参数砍掉90%、推理提速近2倍,再用知识蒸馏把画质“回填”回来,最终效果直逼大模型。做移动端部署的团队,这篇值得一读。
现在地球上的AI天气预报已经卷到起飞。GraphCast是DeepMind在2023年推出的图神经网络天气模型,在Science上发表,用再分析数据训练后,中短期预报精度一度超越传统数值天气预报系统,而且推理速度快了几…
偏好数据是大模型对齐的燃料,但用户“喜欢什么”本身就是敏感信息。这篇来自新加坡国立大学与阿里集团的工作,精准定位DPO独有的隐私漏洞,提出只往“偏好轴”上加噪声就能锁定隐私的PrivDPO,还首次将严格隐私对齐做到了32B模型,工程上几乎零额外成本。隐私保护与模型效用兼得,值得一读。
如果你在公众号里刷到过AI视频生成的翻车现场,大概率见过这种名场面:你明明输入的是“一只熊推开树桩、找到食物、抓住老鼠、吃掉它”,生成的视频里熊只做到了一半就停下来,甚至干脆把树桩忘了。这不能全怪视频生成模型“笨”。真…
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球