相关系数0.993:这款模拟器让Agent排行榜终于可信了
图1:披露门——五级有序门禁,释放三个深度层级。系统的状态是一扇“门”,而门所释放的是一个“深度”:只有信息深度不高于当前门所放行的层级时,这条信息才有资格浮出水面
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
图1:披露门——五级有序门禁,释放三个深度层级。系统的状态是一扇“门”,而门所释放的是一个“深度”:只有信息深度不高于当前门所放行的层级时,这条信息才有资格浮出水面
吸引性量子流体天生要坍缩,死亡过程几乎不可逆。意大利团队却往凝聚体中心拧进一个多电荷涡旋,相当于给量子湖放了一个“拓扑救生圈”,把坍缩时间硬生生拖慢了十倍以上。光与冷原子实验难得在同一个物理框架里碰撞出这么漂亮的实验结果,值得一读。
模型总爱“看背景下菜碟”?哈工大团队提出SAGE,不靠任何人工标注,用聚类子标签驱动扩散模型定向补数据,直接把最差组精度拉到89.5%,专治各种“背景骗局”。
想象一下这样的场景:医院的影像科里,一张胸部X光片总是和病历表格里那串诊断代码、年龄、性别等信息绑在一起出现。
大模型的"三好学生"人设,一换语言就崩?麦考瑞大学等机构给乌尔都语做了套"文化体检",人工逐句改造三大经典对齐基准,结果GPT-4o-mini的诚实度直接掉了20个百分点,安全护栏也形同虚设。🤚
想搞清空心阴极灯里原子蒸气到底有多密、有多热?杜伦大学这篇把银原子吸收谱从“经验判断”变成了“定量可算”。模型简单、拟合漂亮、代码开源,对做原子物理、量子传感、激光稳频的读者来说是个不错的参考样板。
当全世界都在卷Agent能力时,这篇由Stony Brook University和Old Dominion University合作的论文,罕见地将目光投向了最容易被忽视的用户群体——盲人。它用一份扎实的、基于真实世界1258条指令的实证数据,狠狠给“无所不能”的计算机使用代理(CUA)泼了盆冷水:最强模型成功率也仅52.5%。
用最“硬”的几何分析,把一个跨度几十年的猜想型问题彻底焊死:任意偶数维完备的殆Kähler梯度收缩Ricci孤子,全是Kähler的。证明不挑维度、不分紧致与否,还顺手把四维完整分类拿下——理论几何爱好者的年度必读。
AI编程助手不仅仅是代码工具。最新研究揭示,Claude Code、Codex等产品可能被恶意指令攻破,黑客可远程控制你的电脑。
想搞清空心阴极灯里原子蒸气到底有多密、有多热?杜伦大学这篇把银原子吸收谱从“经验判断”变成了“定量可算”。模型简单、拟合漂亮、代码开源,对做原子物理、量子传感、激光稳频的读者来说是个不错的参考样板。
人人都说“先增强,后感知”,但一篇来自高中生的树莓派论文硬核证明:这个“共识”可能正在浪费你80%的算力!用10毫秒的暗通道判断,直接省掉470毫秒的去雾推理,精度还不降反升。嵌入式视觉的极致性价比,这篇论文讲透了。
斯坦福Chelsea Finn团队联合KRAFTON提出WHALE,把智能体优化从"单练模型"升级为"模型+执行框架交替进化",三个任务上最多提升24.38个百分点。对做智能体训练和Agent产品落地的朋友,这篇值得细读。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球