阿里最新研究:让LLM学会“连点成线”,长期部署任务成功率飙升76%!
大模型做agent已不新鲜,但让它在真实场景长期部署、边工作边学习、自己积累经验,才是终极形态。阿里CoD论文用强化学习端到端训练LLM学会“连点成线”的元能力,任务序列里第四个任务成功率从28%干到76%,还跨域泛化到没见过的任务上。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1655 篇文章
大模型做agent已不新鲜,但让它在真实场景长期部署、边工作边学习、自己积累经验,才是终极形态。阿里CoD论文用强化学习端到端训练LLM学会“连点成线”的元能力,任务序列里第四个任务成功率从28%干到76%,还跨域泛化到没见过的任务上。
你遇到过吗?让VLM读个图表或者扫描PDF,模型说得头头是道:“我要先看y坐标然后对比...”结果最后答案错得一塌糊涂! 这不是推理能力不行,是 证据没入眼 。今天聊的NUS新研究SPOT-E,用一招「熵塑形」给VLM搭了个探照灯,冻结主干模型不用训,直接让GPT-4o、Gemini看图能力上一个台阶~
社区热议(453赞)!这篇2026年6月的论文一针见血地指出:强化学习缺的不是更好的模型,而是一个可以随意采样的合成先验。作者借鉴TabPFN的成功经验,直接把MDP「表格化」,用图注意力网络一通训练,结果在未见过的环境中,6个episode就收敛到最优策略,效率吊打传统上千步的Q-learning。思路极其清奇,简直是给RL基础模型铺路!
多设备协同的AI智能体,一张发票报销就能牵扯出手机、电脑、多个在线系统。一旦CPU烧了、网络崩了,传统方案就是粗暴“全部重来”。上海交大这项研究告诉你,根本不需要!分层恢复,小毛病本地解决,大毛病再上全局判断,这才是智能体该有的“情商”。
DeepMind终于出手,这次不谈算力,不聊模型,而是直接戳中了整个AI领域的“灵魂痛点”——我们的AI,从根上就不懂合作。这篇论文像一盆冷水,泼醒了还在疯狂堆数据、跑benchmark的各位同行。它告诉我们,超级智能的关键不在于“多强”,而在于“多合群”。不适合在“唯我独尊”的范式下闭门造车的研究者都该读读。
玩过3A大作的朋友都知道,一个“蠢”NPC有多毁沉浸感。EA这次没有跟你聊概念,而是直接把强化学习塞进了EA SPORTS FC 25和Battlefield 6的AI系统里,并总结了一套极具价值的实战方法论,告诉你如何让NPC从“脚本”进化到“有灵魂”。这是游戏AI从学术走向工业的关键一步。
图论里的江湖,也有“参数内卷”的时候。支配数、打包数、隔离数……今天,龙哥就带大家看看,这些看起来眼花缭乱的指标之间,到底谁跟谁“绑定”,谁又可以抛开对方“独立起飞”。
继2026年6月推过“世界模型新范式”那篇之后,这又来了一个理论硬核到不行的好货。CMU的这篇论文,用数学证明了“好记性”对于通用智能体是刚需,而不是可选项。它就像一个AI界的“记忆法证明”,告诉所有人:别再做无头苍蝇了,想变强,先学学怎么记笔记吧!
宇宙中最剧烈的伽马射线暴发,需要地球最强的“眼睛”来捕捉。CTAO就是这双眼睛,而ACADA系统则是操控这双眼睛的“数字大脑”。这篇论文详细展示了如何构建一个能管理上百台望远镜、处理每秒几十Gb数据流、并能在4秒内响应宇宙瞬变事件的超级控制软件。对于研究大型分布式系统、实时数据处理和天文信息学的读者来说,这是一份来自全球最大在建天文台的一手架构设计文档。
继2026年6月推送过《AI数字孪生:5G/6G网络流量预测与资源管理新突破》后,今天这篇把ISAC和数字孪生玩出了新高度!不仅证明了无蜂窝架构能让速度估计从“瞎”变“聪”,还巧妙地把FIM形状优化和速度估计搞成了正交,设计起来省心省力,最终23dB的跟踪增益,香!
想象一下,一颗行星的“岩浆海洋”里,氢和氦像泡腾片一样咕嘟咕嘟地溶解又释放,会怎样改变它的命运?UCSC等机构提出的SEAMIST模型,首次把这些复杂过程统一模拟,结果发现:溶解未必能“保命”,反而可能加速大气逃逸,甚至引发灾难性的“沸腾”!
让AI看星星,居然能比人眼强26倍!普林斯顿团队用生成式模型从噪声中“捞”出系外行星信号,地球2.0的搜寻又近了一大步。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球