LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1672 篇文章

PaperDaily 数据库收录 论文拆解 12899 研究思路 385 AI 资讯 265 开源项目 164 科研招聘 131 学习资料 8 热点主题 509 论文成功模式 1625

最新文章

共 1672 篇
多伦多大学最新研究:黑暗中的3D重建,信噪比低于-4dB也不怕!
视觉与图像

多伦多大学最新研究:黑暗中的3D重建,信噪比低于-4dB也不怕!

黑暗环境下的3D重建一直是计算机视觉的"禁区"——常规的SfM管线在低信噪比下直接崩溃。多伦多大学带来的Dark3R另辟蹊径,通过教师-学生蒸馏把MASt3R这类3D基础模型"教会"在黑暗中看清世界,仅需噪声-干净RAW图像对训练,无需任何3D真值监督。看过的龙迷都直呼"真不错"!

IIT Indore新作:摄像头测呼吸,不再"看肤色下菜碟"!MAE直降42.1%
大模型与智能体

IIT Indore新作:摄像头测呼吸,不再"看肤色下菜碟"!MAE直降42.1%

传统摄像头测呼吸,一到深肤色就"翻车"——信号弱、噪声大,原因在于方法"一刀切",不懂因肤制宜。IIT Indore这篇ELITE-RR,用肤色感知投影+运动信号去噪+双表征对比学习,三招齐下,把呼吸率估计误差直接砍掉42.1%,还开源了首个印度族裔呼吸数据集。方法设计干净利落,实验全面无死角,干货满满,值得一读!

还在用GRPO?当90%动作都是“摸鱼”,信噪比还不如随机乱猜!
大模型与智能体

还在用GRPO?当90%动作都是“摸鱼”,信噪比还不如随机乱猜!

训练多轮智能体时,GRPO等无评判器方法常常在长序列任务中“失灵”,大家都以为是“长程信度分配”的锅。但龙哥今天带来的这篇工作却一针见血地指出:罪魁祸首是“例行公事”太多!论文首次定义了“决策密度”这个量化指标,并完美推导验证了其与训练信噪比之间的幂律关系。啃完这篇,你对强化学习训练效率的理解会上一个台阶。

单巡天多探针首次联合,暗能量FoM飙升4倍
大模型与智能体

单巡天多探针首次联合,暗能量FoM飙升4倍

继2026年6月聊过DES Y3结果后,DES团队再次放出大招——用六年完整数据,将弱引力透镜、超新星、重子声波振荡三个探针首次在单一巡天内联合,给动态暗能量来了个“全身体检”。结果很有看头:与宇宙学常数的偏差高达2.2到3.0σ,在暗能量与物质相互作用等新物理模型上给出了前所未有的限制。这对于关心宇宙加速膨胀本质的你,绝对值得一读。

Meta最新研究:一张照片就能生成4D人-物交互动画,效果效果优于单令牌方法!
视觉与图像

Meta最新研究:一张照片就能生成4D人-物交互动画,效果效果优于单令牌方法!

只需一张图片,就能精准控制4D人-物交互动画中的姿态、接触、布局细节。Meta联合马普所、阿姆斯特丹大学等机构提出的IMAGIN-4D,用“空间-时间”双重解耦的图像条件化策略,把生成图像遵循度指标直接砍半。同类工作做视频生成,它做4D交互,效果惊艳。

北大最新基准HOLMES:LLM高阶逻辑推理平均仅50.64%,最佳模型也才59.54%!
大模型与智能体

北大最新基准HOLMES:LLM高阶逻辑推理平均仅50.64%,最佳模型也才59.54%!

我们评估模型推理能力,还在用“答没答对”来一锤定音?北大等机构的最新研究HOLMES告诉你,答案对了,但推理过程可能全是“捷径”!这个首个面向高阶逻辑推理的真实世界基准,无情地揭露了GPT-5.4、DeepSeek、Qwen等一众顶级大模型,处理起需要“规则打架”、“跨范围组合”的现实问题时,表现有多拉胯。是时候关注推理过程的“忠信度”了。

语音增强新范式:FiLM注入SSL特征,实时也能做到
视觉与图像

语音增强新范式:FiLM注入SSL特征,实时也能做到

还在为扩散模型生成的语音不够自然、遇到噪声就“懵圈”而头疼吗?马里兰大学团队这次直接把自监督学习的“语言学耳朵”——Wav2Vec2,装进了扩散模型的U-Net里。效果拔群,PESQ直接飙升0.4,让AI在降噪时更懂你说的是什么,而不是无脑涂抹。

NYU最新研究:仅用8K短数据训练,让LLM在128K长上下文推理中准确率飙升90%!
大模型与智能体

NYU最新研究:仅用8K短数据训练,让LLM在128K长上下文推理中准确率飙升90%!

大模型在短数据上训练得再溜,一遇到超长上下文立马就“脑子一片空白”。纽约大学团队别出心裁,用“随机位置”这招,让模型在短文本训练时就能“看见”长文本的位置编码,再配合“长度课程”循序渐进的练习,仅用<8K的短数据训练,就在128K长上下文推理中准确率飙升到90%。这招堪称四两拨千斤,性价比极高!

小米最新研究:RS-Gen让AI绘图告别“翻车”,逻辑推理+实时搜索,效果直逼闭源
视觉与图像

小米最新研究:RS-Gen让AI绘图告别“翻车”,逻辑推理+实时搜索,效果直逼闭源

让AI画个"某品牌最新概念车"?传统模型直接摆烂。小米团队提出的RS-Gen,专治AI绘图的"知识盲区"和"逻辑短路"。它像个聪明的项目经理,把复杂任务拆解成"先查资料、再想思路、最后画图",关键是不用重新训练模型,即插即用。在WISE基准上,直接把通义千问的基线模型从0.51拉到0.823,效果直逼商业闭源模型,这波开源社区赢麻了。

端到端自动驾驶:22小时适配变0.9小时,且零在线交互
视觉与图像

端到端自动驾驶:22小时适配变0.9小时,且零在线交互

端到端驾驶系统有个“隐形痛点”:车厂不断升级感知模型,可下游的决策策略一旦重训就是天价成本。上海交大这篇论文直接点题:不重训策略,就用一个轻量“拼接层”把特征空间对齐回来!效果扎实,跨域场景下驾驶分数从34.76飙到89.88,而适配时间从22小时缩到1小时以内。这思路特别实用,喜欢搞工程落地的朋友别错过。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球