LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12851 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:模型架构

共 307 篇
端到端自动驾驶:22小时适配变0.9小时,且零在线交互
视觉与图像

端到端自动驾驶:22小时适配变0.9小时,且零在线交互

端到端驾驶系统有个“隐形痛点”:车厂不断升级感知模型,可下游的决策策略一旦重训就是天价成本。上海交大这篇论文直接点题:不重训策略,就用一个轻量“拼接层”把特征空间对齐回来!效果扎实,跨域场景下驾驶分数从34.76飙到89.88,而适配时间从22小时缩到1小时以内。这思路特别实用,喜欢搞工程落地的朋友别错过。

快慢双路径Mamba + D-βB门控,文档二值化新范式
视觉与图像

快慢双路径Mamba + D-βB门控,文档二值化新范式

每次遇到新档案馆里那些发黄、透墨、满是污渍的老旧文档,你是不是还得重新标注数据、重新微调模型?本论文的DR-Mamba让你彻底告别这个繁琐环节——它利用巧妙的快慢双路径Mamba和样本条件的自适应减法门,在模型前向推理时就能自动适应每张文档的独特退化类型,效果还特别能打,尤其对最难处理的极端退化样本效果拔群。

南方科技大学最新研究:室内占据预测告别体素分类,32个基元效果优于SOTA,速度3.7倍
视觉与图像

南方科技大学最新研究:室内占据预测告别体素分类,32个基元效果优于SOTA,速度3.7倍

室内占据预测,传统方法要么算得慢,要么基元浪费。南方科技大学这篇FLM-Occ,直接把问题换个角度定义——从分类变成估计分布,用最大似然训练。结果呢?只用32个基元,精度超越SplatSSC的1200个,速度还快了快4倍!这思路,有点东西。

图像压缩新范式:纯INR路线也能做到清晰无伪影,PaaF给出答案
视觉与图像

图像压缩新范式:纯INR路线也能做到清晰无伪影,PaaF给出答案

图像压缩领域又出新招,这次来自意大利卡塔尼亚大学的团队,把纯粹的隐式神经表示(INR)玩出了新高度。他们提出的PaaF,用一套自适应量化和自调制激活函数,让INR图像压缩在感知质量上大杀四方。LPIPS相比最强基线NIF再降39%,低码率下的细节还原更是甩开对手几条街。纯INR路线原来还藏着这么大潜力!

何凯明团队最新BiFlow:告别万步自回归,归一化流一步生成FID 2.39
视觉与图像

何凯明团队最新BiFlow:告别万步自回归,归一化流一步生成FID 2.39

说起生成模型,大家最熟悉的可能是扩散模型(Diffusion Models)和自回归模型(Autoregressive Models),它们一个靠“慢慢去噪”做到高质量,一个靠“逐词预测”称霸语言。但还有一个老牌家族——归一化流(Normalizing Flows,简称NF),虽然理论优雅,却一度因为推理速度慢、架构受限,被很多人遗忘在角落。

即插即用提升1.89dB,Mamba类模型秒变自适应
视觉与图像

即插即用提升1.89dB,Mamba类模型秒变自适应

Mamba火了,但在图像恢复领域,它一直有个“单速”的先天不足——所有退化类型都用同一套状态演化节奏,这就像让法拉利和拖拉机跑同一条赛道,肯定出问题。上海交大团队看准了这个痛点,给Mamba注入了“液态大脑”,让模型可以根据图像内容自主选择多个时间尺度来演化。结果很惊艳:全一体化任务平均PSNR达34.23dB,狂甩各种SOTA方法。最关键的是,它是个即插即

Meta最新研究:用“软聚类”给物品画像,生成式推荐效果大涨!
大模型与智能体

Meta最新研究:用“软聚类”给物品画像,生成式推荐效果大涨!

生成式推荐是当下的研究热点,但如何将用户复杂的协同行为和物品语义同时注入大模型,始终是个难题。Meta这次提出G2Rec,巧妙的用了一个稀疏的物品协同图来捕捉用户行为,再用一个可扩展的“软聚类”方法自动学习出每个物品属于不同兴趣原型的概率,把难以表达的“上下文”变成了模型能轻松理解的结构化token。结果在多个数据集上全面领先,而且在线部署效果也很亮眼。读这

告别复杂两步法!端到端训练线性网络,状态估计误差仅1/√T
大模型与智能体

告别复杂两步法!端到端训练线性网络,状态估计误差仅1/√T

这个问题就像一个“灵魂拷问”:我们费劲训练一个模型预测时间序列的下一个值,它除了学会预测,它的内部“黑盒”里是否也偷偷学会了理解这个世界的底层规律?这篇来自康奈尔大学、华盛顿大学和帝国理工的论文,用严格的数学证明了:一个简简单单的两层线性网络,在训练之后,它的隐藏层居然自己学习了卡尔曼滤波!方法巧妙,理论扎实,而且开源了代码,非常建议关注时序建模和状态估计的

Fraunhofer研究所新作:用「概念流树」替代扁平瓶颈,信息泄露减少40%!
视觉与图像

Fraunhofer研究所新作:用「概念流树」替代扁平瓶颈,信息泄露减少40%!

概念瓶颈模型(CBM)一直在“可解释性”与“信息泄露”间走钢丝——模型学会用“车门”、“挡风玻璃”来识别猫?Fraunhofer研究所这篇论文用“层次化决策树”把概念空间拆成多个局部子空间,让每个预测只走自己的专属路径,从根本上堵死了信息泄露的后门!效果还跟平铺直叙的CBM不相上下。

FlashRT开源:27倍加速,边缘AI推理告别“重计算”,秒变“快照恢复”
视觉与图像

FlashRT开源:27倍加速,边缘AI推理告别“重计算”,秒变“快照恢复”

当机器人每次重启都要重算大模型,或边缘设备LLM冷启动慢到怀疑人生,这篇论文给出了天才解法:把整个推理的“当时状态”像游戏存档一样快照,下次直接读档。FlashRT通过“执行状态胶囊”,让低延迟、小批量的边缘AI服务延迟狂降27倍,并在LLM、TTS、机器人策略上统一了这套机制。简单说,就是让AI推理变得像按快门一样快。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球