ETH&哈佛新基准:AI智能体修复电网不收敛,成功率从82.6%冲到100%
把这个问题再往前推一步:潮流不收敛以后,电网调度员通常要反复“试探”——检查网络结构、分析残差、判断是不是无功支撑不够、猜想某个发电机电压定值压得太低,然后带着假设去跑仿真,不行就换个方向再来。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
把这个问题再往前推一步:潮流不收敛以后,电网调度员通常要反复“试探”——检查网络结构、分析残差、判断是不是无功支撑不够、猜想某个发电机电压定值压得太低,然后带着假设去跑仿真,不行就换个方向再来。
大模型"看图说话"时编造细节,一直缺乏严格的统计约束。弗吉尼亚理工这篇工作用模型自己的"内心独白"替换外部验证器,照样把错误率控制在数学保证范围内,还顺手把弃权率打了下去。值得所有关注多模态可靠部署的读者一读。
想要看懂SinkPruner,得先搞清楚一件事:多模态大模型(Multimodal Large Language Models,MLLM)里,最烧钱的其实不是“看”,而是“看完之后怎么记、怎么算”。
模型总爱“看背景下菜碟”?哈工大团队提出SAGE,不靠任何人工标注,用聚类子标签驱动扩散模型定向补数据,直接把最差组精度拉到89.5%,专治各种“背景骗局”。
想象一下这样的场景:医院的影像科里,一张胸部X光片总是和病历表格里那串诊断代码、年龄、性别等信息绑在一起出现。
当全世界都在卷Agent能力时,这篇由Stony Brook University和Old Dominion University合作的论文,罕见地将目光投向了最容易被忽视的用户群体——盲人。它用一份扎实的、基于真实世界1258条指令的实证数据,狠狠给“无所不能”的计算机使用代理(CUA)泼了盆冷水:最强模型成功率也仅52.5%。
想搞清空心阴极灯里原子蒸气到底有多密、有多热?杜伦大学这篇把银原子吸收谱从“经验判断”变成了“定量可算”。模型简单、拟合漂亮、代码开源,对做原子物理、量子传感、激光稳频的读者来说是个不错的参考样板。
人人都说“先增强,后感知”,但一篇来自高中生的树莓派论文硬核证明:这个“共识”可能正在浪费你80%的算力!用10毫秒的暗通道判断,直接省掉470毫秒的去雾推理,精度还不降反升。嵌入式视觉的极致性价比,这篇论文讲透了。
拍完夜景想发朋友圈,结果暗部一团黑、亮部还偏色?这篇新南威尔士大学的工作把分块扩散模型玩出了新花样:分块尺寸随时间步渐进增大,既保住局部细节又协调全局亮度,4K图像推理提速80倍,显存仅需8.8GB,简直是低光增强领域的"效率控"福音。
要说清楚这篇论文在解决什么问题,得先从一张血管造影图说起。
推荐系统平时只知道"你爱看什么",却说不清"视频里哪一秒、哪个画面真正打动你"。这篇论文设计了一套反事实测试:把证据片段替换掉,看模型还坚不坚持原先的判断。结果扎心——不少模型定位很准,但证据判断相当糊弄。值得所有做视频推荐、时间定位和可解释推荐的读者一读。
一堆AI医生会诊,居然还会“抱团跑偏”?把肺癌晚期患者往肿瘤科一推,完全无视血氧已经掉到危险线。华南理工等机构最近祭出新框架MASGR,把松散群聊升级成结构化推理图,再请来“仲裁官”把关,转诊准确率一口气顶到95.3%。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球