ArtChart来了:艺术图表也要讲数学,双语基准首发
这篇论文最有意思的地方,不是“让图表更好看”,而是把“好看”和“正确”这对天生互相打架的目标,硬生生拉到了一张桌子上。它不只给出方法,还顺手做了一个双语基准和六轴评测,属于能直接拿来做后续研究的那种工作。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇论文最有意思的地方,不是“让图表更好看”,而是把“好看”和“正确”这对天生互相打架的目标,硬生生拉到了一张桌子上。它不只给出方法,还顺手做了一个双语基准和六轴评测,属于能直接拿来做后续研究的那种工作。
多参考图像生成最怕什么?不是模型不够大,而是参考一多,语义就开始打架。StructGen 直接把参考图像做成“字典”,用标识符把人、衣服、场景钉死,思路很工程,也很实用。
扩散模型平时最擅长“画图”,这篇论文偏要让它顺手把分类也干了。D3CL的思路很直接:把不同去噪步当成不同视图,再用LoRA轻量改造Stable Diffusion,结果判别和生成两头都没掉链子。
这篇论文最有意思的地方,不是又造了一个更会“听话”的模型,而是把问题反过来:模型能不能从几张示例图里自己悟出共同概念,再拿去指导生成?Apple Research这次盯上的,就是视觉模型最容易翻车、但也最像人类学习的那一口气。
如果有一项技术能从你的手机视频中提取出世界的3D结构,像人眼一样感知景深,你会用它做什么?上海AI实验室联合浙大、悉尼大学,最近放了一个大招:Depth Any Video。这个模型直接在Stable Video Diffusion上「开刀」,并靠着从游戏世界收集来的600万帧高质量深度数据,实现了视频深度估计的时空一致性全面飞跃。效果拉满,看了演示gif保
视频深度估计一直卡在“没数据”上。这篇来自上海AI Lab、浙大和悉大的论文,直接去游戏里“白嫖”了4万段高精度视频深度数据,再把手里的视频生成扩散模型改成深度估计模型,3步去噪就出结果,跑得比谁都快。效果直接起飞,把之前所有生成式深度模型都甩在身后。
这篇论文最有意思的点,不是又堆了一个多模态采样器,而是把“图文互相打架”这件事变成了可修正的过程。文本和图像不再各写各的,而是在同一次去噪里边想边改,挺像老师边讲边在黑板上补笔。
这篇论文很实在:不跟生成模型纠缠“像不像”,而是直接问“合成数据能不能把分割做对”。FD-loss把分布对齐塞进医学图像生成训练里,结果不是纸面分数好看,而是下游分割真涨点。
这篇工作最有意思的地方,不是“又做了一个归因方法”,而是把问题拆成了两层:先认家族,再认具体变体。家族内模型长得太像,单一信号很容易翻车,DNA 直接把 VAE 和 backbone 各自擅长的证据分开用,思路很工程,也很像真正能落地的取证流程。
3D场景生成一直卡在两个字:太大。SceneTok偏偏反着来,把场景先压成少量无序token,再把“渲染”和“生成”拆开做,结果是压缩率高得离谱,速度还不慢,挺像把大卡车拆成乐高再开回去。
单图生成3D场景,最难的不是“能生成”,而是“生成后还能不能继续细化且不跑偏”。HIVE-3D把粗场景、2D分割、注意力对齐和体素超分辨率串成一条链,思路很工程,也很实用。
这篇论文最有意思的地方,不是又做了一个视频自编码器,而是把“只会理解”的冻结视频基础模型,硬生生改造成了能重建、能生成、还能加速训练的通用视频潜空间。更妙的是,它把连续和离散两条生成路线都打通了,工程味很足。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球