LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1660 篇文章

PaperDaily 数据库收录 论文拆解 12889 研究思路 385 AI 资讯 225 开源项目 164 科研招聘 130 学习资料 8 热点主题 507 论文成功模式 1625

大模型与智能体

共 812 篇
告别人工脚手架!Spiral端到端训练模型自己搜索和聚合,递归自聚合效果惊艳
大模型与智能体

告别人工脚手架!Spiral端到端训练模型自己搜索和聚合,递归自聚合效果惊艳

很多模型训练时只学顺序推理,一到测试却靠人工搭脚手架(并行采样+投票)来提分,中间有个巨大的“训练-测试”鸿沟。斯坦福这篇Spiral颠覆性地用集合强化学习,让模型边训练边学会如何搜索和如何聚合,把整个推理过程端到端打通了。效果非常硬核,4B模型推理效率吊打传统方法11倍,不愧是Chelsea Finn和Noah Goodman团队的新作!

定流形中首次构造光滑不可拆链接,n=1即可
大模型与智能体

定流形中首次构造光滑不可拆链接,n=1即可

四维空间到底有多神奇?这篇论文告诉你,有些结构在拓扑学家的“橡皮泥”世界里能被轻松分开,但在微分几何学家的“精确手术刀”下却顽固地粘在一起。作者巧妙地运用马祖尔流形和带形协边,构造出首批在定4-流形中拓扑可拆但光滑不可拆的“奇异链接”,为理解四维空间的独特光滑结构提供了全新视角,低维拓扑爱好者不容错过!

9个图基础模型只有2个能打?ICML论文曝光80%是花架子
大模型与智能体

9个图基础模型只有2个能打?ICML论文曝光80%是花架子

当「图基础模型」遇上「公平评测」, 结果发现9个模型里7个是花架子?这不就是AI界的照妖镜嘛!😏 本文用最硬核的实验设计,把各路GFM拉到聚光灯下,扒掉了华丽外衣,告诉我们:经典GNN调好了,依然是条好汉。这篇ICML 2026论文,龙哥看得直呼过瘾,强烈建议所有的图学习研究者都来「上好这一课」!

顶级B工厂联合出手:X(3872)本质原来是个“分子”?
大模型与智能体

顶级B工厂联合出手:X(3872)本质原来是个“分子”?

那个让物理学家纠结了二十年的“神秘粒子”X(3872),到底是普通的小强还是宇宙中的蛤蟆精?这次,Belle和Belle II联手,用史上最强的1.2ab^-1数据,第一次抓住了它衰变成π⁰χc0的尾巴!这个发现彻底否定了它是普通粲偶素的身份,强有力地指向了分子态或四夸克态的解释。想看懂这篇堪称“粒子物理福尔摩斯”的硬核论文?龙哥带你用最通俗的话,看看这群科

CHI 2026最新观点:别让AI“快”成摆设,AAC评估不能只看速度
大模型与智能体

CHI 2026最新观点:别让AI“快”成摆设,AAC评估不能只看速度

AI 让 AAC 变快了,但“快”到底是不是第一要义?这篇来自 CHI 2026 的 Workshop 论文,犀利地撕开了当前技术评估的面纱。它没有提出什么新算法,却指出了一个最容易被忽略的问题:我们到底在为什么而优化?对于关注 AI 落地、真正的用户中心设计的读者,这篇几乎是必读。

告别天文数字增益!用滑模重构非线性输出,Lur'e系统观测器设计新范式
大模型与智能体

告别天文数字增益!用滑模重构非线性输出,Lur'e系统观测器设计新范式

当非线性耦合强到让经典LMI失效,观测器增益飙到几万,这还怎么用?本文提出一个巧妙的思路:既然测不到非线性耦合信号,那就用滑模观测器从输出里实时“算”出来,再把它当已知量注入观测器,相当于多了一条校正通道。理论证明新LMI总能找到更小的增益,数值实验更是把增益从3万降到了30,RMS误差还降低了13倍。控制领域的小伙伴,这招值得看看。

RIKEN新解:LLM数据溯源“捷径”还是“精确制导”?BM25+影响力函数99%一致?
大模型与智能体

RIKEN新解:LLM数据溯源“捷径”还是“精确制导”?BM25+影响力函数99%一致?

LLM输出的“灵感”到底是从训练数据里“原样照搬”还是“高维加密”后释放?日本理研牵头的新研究首次给数据相似度(BM25)和数据影响力(KFAC)的排名关系画了张精准的“等高线图”。发现一个反直觉事实:影响力函数能更一致地预测相似度的结果,反过来则不行——这意味着“先BM25粗筛,再影响力精排”的混合方案,可能是大模型可解释性工具箱里的黄金搭档。

IIT Indore新作:摄像头测呼吸,不再"看肤色下菜碟"!MAE直降42.1%
大模型与智能体

IIT Indore新作:摄像头测呼吸,不再"看肤色下菜碟"!MAE直降42.1%

传统摄像头测呼吸,一到深肤色就"翻车"——信号弱、噪声大,原因在于方法"一刀切",不懂因肤制宜。IIT Indore这篇ELITE-RR,用肤色感知投影+运动信号去噪+双表征对比学习,三招齐下,把呼吸率估计误差直接砍掉42.1%,还开源了首个印度族裔呼吸数据集。方法设计干净利落,实验全面无死角,干货满满,值得一读!

还在用GRPO?当90%动作都是“摸鱼”,信噪比还不如随机乱猜!
大模型与智能体

还在用GRPO?当90%动作都是“摸鱼”,信噪比还不如随机乱猜!

训练多轮智能体时,GRPO等无评判器方法常常在长序列任务中“失灵”,大家都以为是“长程信度分配”的锅。但龙哥今天带来的这篇工作却一针见血地指出:罪魁祸首是“例行公事”太多!论文首次定义了“决策密度”这个量化指标,并完美推导验证了其与训练信噪比之间的幂律关系。啃完这篇,你对强化学习训练效率的理解会上一个台阶。

单巡天多探针首次联合,暗能量FoM飙升4倍
大模型与智能体

单巡天多探针首次联合,暗能量FoM飙升4倍

继2026年6月聊过DES Y3结果后,DES团队再次放出大招——用六年完整数据,将弱引力透镜、超新星、重子声波振荡三个探针首次在单一巡天内联合,给动态暗能量来了个“全身体检”。结果很有看头:与宇宙学常数的偏差高达2.2到3.0σ,在暗能量与物质相互作用等新物理模型上给出了前所未有的限制。这对于关心宇宙加速膨胀本质的你,绝对值得一读。

北大最新基准HOLMES:LLM高阶逻辑推理平均仅50.64%,最佳模型也才59.54%!
大模型与智能体

北大最新基准HOLMES:LLM高阶逻辑推理平均仅50.64%,最佳模型也才59.54%!

我们评估模型推理能力,还在用“答没答对”来一锤定音?北大等机构的最新研究HOLMES告诉你,答案对了,但推理过程可能全是“捷径”!这个首个面向高阶逻辑推理的真实世界基准,无情地揭露了GPT-5.4、DeepSeek、Qwen等一众顶级大模型,处理起需要“规则打架”、“跨范围组合”的现实问题时,表现有多拉胯。是时候关注推理过程的“忠信度”了。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球