LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12823 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:Agent

共 137 篇
密歇根等20+机构新作:告别PDF论文,让AI智能体直接操作科研成果,问答准确率暴涨至93.7%
大模型与智能体

密歇根等20+机构新作:告别PDF论文,让AI智能体直接操作科研成果,问答准确率暴涨至93.7%

当AI智能体成为科研“战友”,却发现读不懂论文,这多尴尬?密歇根大学联手斯坦福、MIT等20多家机构,提出脑洞大开的协议——ARA,直接把论文从“读”的文档,变成AI可“运行”的知识包。结果振奋:PaperBench上问答准确率从72.4%飙升到93.7%,复现成功率提升7%。看来,未来科研论文真是为AI写的了!

AI Agent接管云端?OpenKedge推出“执行经纪人”SEB,零常设凭证杜绝越权突变
大模型与智能体

AI Agent接管云端?OpenKedge推出“执行经纪人”SEB,零常设凭证杜绝越权突变

AI Agent越来越能干,但把“删库”、“开端口”这种高级权限直接交给一个会幻觉、还可能被黑客渗透的非确定性系统,这不是妥妥的定时炸弹吗?OpenKedge团队这篇论文,直接瞄准了这个“检查后执行”之间的真空地带,搞出了一个叫“Sovereign Execution Broker”的硬核边界,让Agent手里的凭证“即用即消”,从根本上堵死越权操作。一针见

北卡罗来纳大学夏洛特分校最新研究,ACE模块让VLM调用减少75%
视觉与图像

北卡罗来纳大学夏洛特分校最新研究,ACE模块让VLM调用减少75%

长视频问答(LVQA)一直是个“烧钱”的活,把一小时的视频全喂给大视觉模型,光是token就能上百万。而TIMEPROVE给出的策略很聪明:先派轻量级的动作检测器去“探路”,生成几个高概率的答案假设,最后才让大模型去“拍板”验证。结果呢?效果涨了7.3%,成本却降了93%。这种“先猜后验”的思路,值得每个做视频理解的人关注。

告别黑箱审计:CODE-AUGUR如何让LLM的安全判断变得可验证、可复用
大模型与智能体

告别黑箱审计:CODE-AUGUR如何让LLM的安全判断变得可验证、可复用

继2026年6月聊过AI智能体安全评估之后,这次新加坡国立大学团队带来更猛的干货:不是让LLM当黑盒猎头,而是让它把“觉得安全”的判断写成可执行的断言,再用模糊测试来挑战这些断言。结果?在DARPA的AIxCC基准上比顶尖智能体多发现34%-63%的漏洞,还挖出了22个真实世界的0-day!这才是AI安全审计该有的样子。

40%任务效率提升!重庆大学提出ExS2D:零双臂数据训练双臂机器人
视觉与图像

40%任务效率提升!重庆大学提出ExS2D:零双臂数据训练双臂机器人

想让家里的扫地机器人帮你搬桌子?想给它找俩搭子?这篇重庆大学的新研究带来一个“骚操作”:让你的单臂机器人不用练习,直接点亮“双打”天赋。不需要昂贵耗时的双臂演示数据,它们通过一个精巧的层次化框架,就让机器人自己学会左右开弓。一句话总结:白嫖单臂数据,通吃双臂任务。🤚

告别Sora幻觉,数据视频进入可编辑时代
视觉与图像

告别Sora幻觉,数据视频进入可编辑时代

做汇报还在手动敲PPT、剪GIF动图?港科广的DataMagic直接端到端解决:上传表格+一句话,自动生成带配音、动画、配乐的数据故事视频。新引入的DVSpec规范确保图表和数据的绑定关系一清二楚,再也不用担心AI“算错”数字。更香的是,这还是个“能编辑的视频”,直接划界面改图表、抠文本,甚至指点AI加新镜头,整个数据呈现流程变得前所未有的丝滑。

阿里最新研究:让LLM学会“连点成线”,长期部署任务成功率飙升76%!
大模型与智能体

阿里最新研究:让LLM学会“连点成线”,长期部署任务成功率飙升76%!

大模型做agent已不新鲜,但让它在真实场景长期部署、边工作边学习、自己积累经验,才是终极形态。阿里CoD论文用强化学习端到端训练LLM学会“连点成线”的元能力,任务序列里第四个任务成功率从28%干到76%,还跨域泛化到没见过的任务上。

上海交大最新研究:多设备智能体执行失败,真的不用全局重规划?
视觉与图像

上海交大最新研究:多设备智能体执行失败,真的不用全局重规划?

多设备协同的AI智能体,一张发票报销就能牵扯出手机、电脑、多个在线系统。一旦CPU烧了、网络崩了,传统方案就是粗暴“全部重来”。上海交大这项研究告诉你,根本不需要!分层恢复,小毛病本地解决,大毛病再上全局判断,这才是智能体该有的“情商”。

DeepMind最新警告:AI越强越不合作?揭秘“唯我论”超级智能的隐患
视觉与图像

DeepMind最新警告:AI越强越不合作?揭秘“唯我论”超级智能的隐患

DeepMind终于出手,这次不谈算力,不聊模型,而是直接戳中了整个AI领域的“灵魂痛点”——我们的AI,从根上就不懂合作。这篇论文像一盆冷水,泼醒了还在疯狂堆数据、跑benchmark的各位同行。它告诉我们,超级智能的关键不在于“多强”,而在于“多合群”。不适合在“唯我独尊”的范式下闭门造车的研究者都该读读。

32.7%提升背后:VLM+规则工具箱混合评估新范式
视觉与图像

32.7%提升背后:VLM+规则工具箱混合评估新范式

自动驾驶评估就像考试打分。传统规则死板,遇到避让、绕行等“合理违章”就给负分;纯VLM评估虽有上下文理解,却难胜任精细安全判断。英伟达团队这次祭出杀手锏—— DriveJudge ,让VLM当“考官”,根据场景决定哪些规则该用、哪些该放一马,既保住了规则的物理严谨,又拿捏了上下文的柔性。看完绝对拍大腿:这才是评估该有的样子!

通用智能体必备?CMU用数学告诉你:没记忆不行
大模型与智能体

通用智能体必备?CMU用数学告诉你:没记忆不行

继2026年6月推过“世界模型新范式”那篇之后,这又来了一个理论硬核到不行的好货。CMU的这篇论文,用数学证明了“好记性”对于通用智能体是刚需,而不是可选项。它就像一个AI界的“记忆法证明”,告诉所有人:别再做无头苍蝇了,想变强,先学学怎么记笔记吧!

SAP最新研究揭秘:企业AI代理的信任密码,原来“看得见”比“能暂停”重要10倍!
大模型与智能体

SAP最新研究揭秘:企业AI代理的信任密码,原来“看得见”比“能暂停”重要10倍!

你的AI代理队友,让你放心还是糟心?继2026年6月聊过“企业AI革命”后,SAP的这篇实战研究来得正是时候。它用数据告诉你:想让员工信任AI,光给个“暂停”按钮远远不够,他们想看到AI的“思考过程”。这份基于企业真实痛点的UX设计指南,AI产品经理和开发者都该看看。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球