快手Kling团队新作:16 FPS实时生成多镜头连贯视频,一个模型搞定生成、参考与编辑
告别逐镜头生成的割裂感,快手Kling团队联合清华、南大提出的ContextMaster,把生成、参考和编辑统一进一个模型,在单卡上跑到16 FPS的同时,还能让角色和场景在多镜头之间保持一致。🔍 想看懂这套固定预算稀疏路由怎么在有限算力下留住完整记忆?这篇值得细读。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
告别逐镜头生成的割裂感,快手Kling团队联合清华、南大提出的ContextMaster,把生成、参考和编辑统一进一个模型,在单卡上跑到16 FPS的同时,还能让角色和场景在多镜头之间保持一致。🔍 想看懂这套固定预算稀疏路由怎么在有限算力下留住完整记忆?这篇值得细读。
视频生成模型在自动驾驶里一直是“吃钱大户”,训练花钱推理更花钱。华中科大这波操作骚气:让视频大模型只在训练时当“免费家教”,推理时直接扔了它,结果单目摄像头91.5 PDMS登顶NAVSIM,延迟还比别人低一大截😏 这便宜占得,值得好好看看。
戴智能眼镜开电话会,周围人声嘈杂听不清?边缘小模型算力不够,云端大模型又太慢——Meta这次让云边“组队打怪”,边缘只加1.5%参数就能蹭到云端大模型的“听力”,在64毫秒延迟下硬是把语音增强的SI-SDR拉高了3.77dB。真·云边协同新范式,值得一看。
手机里存了三年的糊脸照片,AI一顿猛修,结果亲妈都不认得了?扩散模型人脸修复最怕"五官漂移",南邮等四校带来WaveFreqAnchor:零训练、零微调,只用波结构锚定+频率校正,把身份相似度一路抬到0.988,修完还像本人!
图像恢复圈的老问题——固定patch切割总在退化边界上“切错地方”,导致修复完还留着一道道网格伪影。FIT把tokenization本身变成可变的,让patch边界跟着雨线、模糊核、景深走,五任务平均PSNR一口气拉到30.72dB,比JIT基线提升1.44dB。一句话:patch不“卷”了,改“弯”了。
当大模型都在卷token时,这篇论文反着来:用字符级离散扩散处理古希腊残卷,把修复误差从24.6直接干到15.5。更难得的是,它把训练语料和11个去污染检查点全部开源,还承诺每个残破文本都能找到一个"从未见过它"的模型来做修复。数字人文的"可复现良心",大概就长这样。
评测行业深水炸弹:"零差距"可能根本不是修复成功,而是正负误差抵消的假象!浙大新作直指现有污染缓解指标G-AP的两大致命缺陷,并给出SA-PPG评估指标与RailCap缓解策略。多模型多基准验证下,旧方法的"完美修复"排名被彻底翻盘。做评测、做数据清洗的,这篇不能错过。
散斑噪声是相干成像(SAR、数字全息、光学相干断层扫描)里绕不开的"毛玻璃",动态场景下尤其难缠。本文用孔径感知最大似然+时空隐式神经表示,做到完全无训练去噪:不需要干净参考、不需要配对数据、甚至换孔径都不用重训,模拟和实验室实测都在时间一致性和细节恢复上赢了监督模型。思路相当clean,值得一读。
多模态推荐里个性加权被吹上天,杭州电子科大的审计团队偏偏不信邪:六个加权头、四个数据集、同一骨架公平对决,结果全局权重几乎吃满全部增益,个性化加权沦为“气氛组”。想看清推荐系统里“个性化”这三个字到底掺了多少水?这篇是绕不开的清醒剂。
信息从生成到失效,中间能安全用多久?这个问题在自动驾驶、无人机、网络缓存里被各领域分别回答。奥克兰大学的这篇论文给出统一数学答案。它不仅证明现有安全调度策略都是其特例,还在V2V车队与无人机SLAM中把通信与计算干预量分别砍掉99.3%和86%,值得一读。
有句老话叫“所见即所知”,斯图加特大学这篇新作直接把它变成了“所听即所看”:只拿一个现成的CLIP模型做归因,不微调、不标注、不用任何生成架构,就能复现视觉世界实验里经典的预测性眼动——人类听到“eat”还没听到“cake”就把目光移向蛋糕,模型居然也“看”向了同一个地方。
图像修复这事儿,有点像老小区改造:有的地方墙皮脱落要重刷,有的地方只脏了一小块。可现在的扩散修复模型偏爱"一刀切",全图一样的约束力度、一样的步长节奏,既不省算力还容易把好区域修出问题。江苏大学这篇ACM MM 2026论文,用局部认知不确定性给模型装了一双"会看重点的眼睛",该补的补、该跳的跳,LPIPS平均降12.78%、采样时间省8.42%,还能即插即
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球