Meta FAIR新作:AI科研智能体装上"预算管家",2/3算力追平24小时成绩
AI科研智能体缺的不是想法,而是算力。本文提出研究偏好模型(RPM),相当于给智能体装了个“预算管家”:在花GPU之前,先让LLM当评委挑选最有潜力的候选方案。AIRS-Bench上,用不到三分之二的算力就能追上无引导基线24小时的成绩,思路清晰,落地性强。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
AI科研智能体缺的不是想法,而是算力。本文提出研究偏好模型(RPM),相当于给智能体装了个“预算管家”:在花GPU之前,先让LLM当评委挑选最有潜力的候选方案。AIRS-Bench上,用不到三分之二的算力就能追上无引导基线24小时的成绩,思路清晰,落地性强。
AI编程智能体越跑越远,需求漂移、过程黑盒、发布甩锅怎么办?港科大(广州)提出的AppLooper,用多智能体协作+版本绑定证据链把整个开发流程钉死,让每一次变更都有据可查、有人负责。值得所有关心AI编程落地与可问责性的读者一读。
这是剑桥大学Ross King教授撰写的一篇AI for Science全景综述。Ross King正是历史上第一个全自动机器人科学家Adam的缔造者。这篇论文以亲历者视角,系统梳理了从DENDRAL到AlphaFold、再到AI Scientist的完整进化路径,并首次提出六级科学自主性框架。想看懂AI科学家的过去、现在与未来,这篇是绕不开的入口。
表格处理向来是大模型的"老大难":好好的二维表格,硬被拍扁成Markdown字符串,跨表联动全靠蒙。中科大这篇最新研究提出SheetCompass,用层次关系图还原表格的空间结构,配合多智能体协作推理,三大基准全面超车——这波操作,属实有点东西。
PET(正电子发射断层成像)是肿瘤、神经和心脏疾病诊断中重要的分子影像手段,能无创显示体内代谢活动。但PET天生有痛点:光子符合计数有限,图像信噪比低。
AI生成的代码,你敢直接上生产吗?单元测试过了不代表没bug,仓库级形式化验证才是终极保险丝。UC Berkeley等机构提出Vero,要求智能体在一个多模块Lean 4代码仓库里同时写实现和证明,结果最强配置只通关27/43——答案藏在仓库级一致性和共享引理库的组织能力里。
本文是NeurIPS 2023的经典工作,也是大模型推理研究绕不开的一座里程碑:它把树搜索、自我评估、回溯这些经典AI思想,重新装回了大语言模型身上,让模型面对复杂任务时真正学会“多想几步”。24点游戏4%到74%的跨越,至今仍被反复引用与对比。
一个统一框架同时接管监控、鱼眼和行车记录仪三类交通视频,在AI City 2026出战三个赛道,FETV与第一名只差0.0007。这套「观察-推理-行动-验证」的智能体工作流拆解起来很有嚼头,适合所有对多模态视频理解与跨域泛化感兴趣的读者。
清华团队这次不玩虚的,直接把临床心理学里的5Ps公式化、信任分层、多维抵抗机制搬进大模型,让AI来访者从“有问必答”变成“看人下菜碟”。40个临床情境实验、5项人类评估全面领先,AI心理治疗模拟终于有点真实的烟火气了。
做AI的都知道,图像分类这活儿,看着简单,做起来全是坑。尤其是当你把模型从实验室搬到现实世界,面对的不是单一数据集的“温室环境”,而是医疗影像、卫星图、人脸表情、日常物体照片混在一起的“修罗场”。
你有没有被电商AI导购气得牙痒痒过?明明说了“今天就要”,它偏给你推明天才发货的。京东和人大这篇新研究,就是让购物Agent学会从真实用户的吐槽和购买行为中自己进化,不用人工标注,推荐效果直接起飞。
搜索智能体总是"检索到答案却答不出来"?问题很可能出在上下文干扰。港中大等机构这篇研究系统地定位了干扰源——最新检索回来的文档,并设计了蒸馏式上下文精炼器,让智能体在"生成"之前先"精炼",可靠性和效率双双提升。看完这篇,对多轮搜索智能体的调优思路会有新的启发。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球