LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12787 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:多模态

共 200 篇
拒绝内卷!北大CVPR 2026新作ExtrinSplat:3D语义理解不嵌特征,存储直接砍到MB级
视觉与图像

拒绝内卷!北大CVPR 2026新作ExtrinSplat:3D语义理解不嵌特征,存储直接砍到MB级

3D高斯泼溅遇上开放词汇理解,过去大家往点云里硬塞特征,结果存储爆表、边界糊成一片。北大这篇CVPR 2026新作反其道而行,把几何和语义彻底解耦,用VLM生成文本假设做外置索引,直接让特征存储从GB级砍到MB级。思路清奇,落地极香,值得一读!

Apple最新研究:视频推理不再"画未来",延迟降5倍+
视觉与图像

Apple最新研究:视频推理不再"画未来",延迟降5倍+

这篇来自Apple的新研究直接把“视觉思维”做进了训练:模型在训练时预测未来帧的潜在表示,推理时不再生成中间图像,端到端延迟比显式视觉CoT降低5倍以上,同时在6个评测设置上稳定超越纯文本后训练。对视频理解、实时预测和统一多模态模型感兴趣的同学值得细读。

浙大开源24小时心电基准:GPT-5也翻车,微调后准确率99.7%
视觉与图像

浙大开源24小时心电基准:GPT-5也翻车,微调后准确率99.7%

24小时动态心电(Holter)是诊断心律失常的金标准,但多模态大模型在超长时序信号面前几乎“失灵”。浙大等团队开源Holtercare-Bench基准与Holtercare-23K数据集,用信号-视频-文本三模态对齐,让GPT-5、Qwen3-VL等模型首次系统性接受“心电马拉松”考验——微调后时序定位准确率飙到99.7%,差距比想象中更大。

哈佛最新开源:147万份百年报纸,榨出163亿token公共数据集
视觉与图像

哈佛最新开源:147万份百年报纸,榨出163亿token公共数据集

这可能是今年最"考古"的AI基础设施工作:哈佛联手波士顿公共图书馆,把1795到1930年的147万份报纸扫描件,变成163亿token的干净文本。更难得的是,整套流水线设计成工作站级硬件就能跑,租服务器全程只要约2.5万美元——相比云端OCR动辄几十万美元的报价,这性价比简直离谱。对做数据工程、LLM预训练和数字人文的人来说,这篇值得细读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球