LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12851 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

视觉与图像

共 717 篇
快手Kling团队新作:16 FPS实时生成多镜头连贯视频,一个模型搞定生成、参考与编辑
视觉与图像

快手Kling团队新作:16 FPS实时生成多镜头连贯视频,一个模型搞定生成、参考与编辑

告别逐镜头生成的割裂感,快手Kling团队联合清华、南大提出的ContextMaster,把生成、参考和编辑统一进一个模型,在单卡上跑到16 FPS的同时,还能让角色和场景在多镜头之间保持一致。🔍 想看懂这套固定预算稀疏路由怎么在有限算力下留住完整记忆?这篇值得细读。

残碑补字新范式:字符级掩码扩散让Ithaca都成了配角
视觉与图像

残碑补字新范式:字符级掩码扩散让Ithaca都成了配角

当大模型都在卷token时,这篇论文反着来:用字符级离散扩散处理古希腊残卷,把修复误差从24.6直接干到15.5。更难得的是,它把训练语料和11个去污染检查点全部开源,还承诺每个残破文本都能找到一个"从未见过它"的模型来做修复。数字人文的"可复现良心",大概就长这样。

浙大最新:零差距≠真恢复!SA-PPG揭示基准污染修复被严重高估
视觉与图像

浙大最新:零差距≠真恢复!SA-PPG揭示基准污染修复被严重高估

评测行业深水炸弹:"零差距"可能根本不是修复成功,而是正负误差抵消的假象!浙大新作直指现有污染缓解指标G-AP的两大致命缺陷,并给出SA-PPG评估指标与RailCap缓解策略。多模型多基准验证下,旧方法的"完美修复"排名被彻底翻盘。做评测、做数据清洗的,这篇不能错过。

AI · PAPER
视觉与图像

训练零成本,孔径感知INR让动态散斑去噪PSNR猛涨5.8dB

散斑噪声是相干成像(SAR、数字全息、光学相干断层扫描)里绕不开的"毛玻璃",动态场景下尤其难缠。本文用孔径感知最大似然+时空隐式神经表示,做到完全无训练去噪:不需要干净参考、不需要配对数据、甚至换孔径都不用重训,模拟和实验室实测都在时间一致性和细节恢复上赢了监督模型。思路相当clean,值得一读。

凭什么说所有安全调度都是CIPS特例?一文看懂统一调度框架
视觉与图像

凭什么说所有安全调度都是CIPS特例?一文看懂统一调度框架

信息从生成到失效,中间能安全用多久?这个问题在自动驾驶、无人机、网络缓存里被各领域分别回答。奥克兰大学的这篇论文给出统一数学答案。它不仅证明现有安全调度策略都是其特例,还在V2V车队与无人机SLAM中把通信与计算干预量分别砍掉99.3%和86%,值得一读。

斯图加特大学:现成CLIP零微调,天生就会预测人类眼动?
视觉与图像

斯图加特大学:现成CLIP零微调,天生就会预测人类眼动?

有句老话叫“所见即所知”,斯图加特大学这篇新作直接把它变成了“所听即所看”:只拿一个现成的CLIP模型做归因,不微调、不标注、不用任何生成架构,就能复现视觉世界实验里经典的预测性眼动——人类听到“eat”还没听到“cake”就把目光移向蛋糕,模型居然也“看”向了同一个地方。

江苏大学ACM MM新作:图像恢复"按需使劲",LPIPS降12.8%
视觉与图像

江苏大学ACM MM新作:图像恢复"按需使劲",LPIPS降12.8%

图像修复这事儿,有点像老小区改造:有的地方墙皮脱落要重刷,有的地方只脏了一小块。可现在的扩散修复模型偏爱"一刀切",全图一样的约束力度、一样的步长节奏,既不省算力还容易把好区域修出问题。江苏大学这篇ACM MM 2026论文,用局部认知不确定性给模型装了一双"会看重点的眼睛",该补的补、该跳的跳,LPIPS平均降12.78%、采样时间省8.42%,还能即插即

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球