LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12820 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

视觉与图像

共 717 篇
李飞飞参与,斯坦福&Google新作:让VLM当裁判,图像压缩更懂人眼
视觉与图像

李飞飞参与,斯坦福&Google新作:让VLM当裁判,图像压缩更懂人眼

这篇论文把“谁来判断压缩图像好不好”这个老问题翻出了新花样。斯坦福和谷歌团队发现,Gemini 2.5-Flash这类通用视觉语言模型,竟然能零样本复现人眼的相似度判断,干脆把它请来当裁判,用偏好优化把扩散自编码器训得更懂人眼。结果在多个基准和上万次用户评测里直接干到第一梯队。想看看VLM怎么当评委、这条路能省多少人工标注成本?这篇值得一读。

MIT数学家破译高斯消元增长上限,稀疏奇迹破灭
视觉与图像

MIT数学家破译高斯消元增长上限,稀疏奇迹破灭

一篇彻底改写数值分析教科书认知的硬核理论成果。作者证明了完全主元与车房主元下高斯消元增长因子的渐近量级为维度拟多项式,解开了自1940年代延续至今的著名开放问题;同时证明稀疏矩阵下部分主元依然可能指数爆炸,寻找最优行置换还是NP难问题。做科学计算底层和数值算法的读者,这篇值得精读。

以色列理工最新研究:游泳机器人最优步态,被庞特里亚金算明白了
视觉与图像

以色列理工最新研究:游泳机器人最优步态,被庞特里亚金算明白了

想象一下在蜂蜜里游泳:你拼命划水,水却像胶水一样黏着你,一停就立刻静止。这就是低雷诺数世界里的真实日常。以色列理工学院这篇新论文,给经典的Purcell三连杆游泳机器人加了一个“大肚子”模型,再用庞特里亚金最大值原理,把“怎么扭最远、怎么扭最省力”的最优步态一次算明白了。

模拟存内计算秒变“猪队友”?北大港大出手:只调一个引导参数,扩散模型FID狂降75%!
视觉与图像

模拟存内计算秒变“猪队友”?北大港大出手:只调一个引导参数,扩散模型FID狂降75%!

模拟存内计算(CIM)部署扩散模型是低功耗生成的重要路径,但芯片非理想性会让引导信号悄悄“失真”。这篇北大港大合作的工作把失效通道定位到无分类器引导残差上,并给出免重训练、只改一个标量参数的优雅修复方案,在3个扩散模型上大幅恢复生成质量,值得所有关注AI芯片落地和扩散模型的读者一读。

哈佛最新开源:147万份百年报纸,榨出163亿token公共数据集
视觉与图像

哈佛最新开源:147万份百年报纸,榨出163亿token公共数据集

这可能是今年最"考古"的AI基础设施工作:哈佛联手波士顿公共图书馆,把1795到1930年的147万份报纸扫描件,变成163亿token的干净文本。更难得的是,整套流水线设计成工作站级硬件就能跑,租服务器全程只要约2.5万美元——相比云端OCR动辄几十万美元的报价,这性价比简直离谱。对做数据工程、LLM预训练和数字人文的人来说,这篇值得细读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球