商汤新研究:AI先规划再看视频,token省90%,长视频理解还能更强?
看长视频最怕"看多少、看哪里"的选择困难。商汤这篇EVA直接用强化学习把"先规划再看片"的训练出来,多个长视频基准提升6-12%,视觉token还省得惊人。让AI学会"聪明地看",这个方向值得重点关注。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
看长视频最怕"看多少、看哪里"的选择困难。商汤这篇EVA直接用强化学习把"先规划再看片"的训练出来,多个长视频基准提升6-12%,视觉token还省得惊人。让AI学会"聪明地看",这个方向值得重点关注。
Text-to-SQL最磨人的不是不跑,而是“跑得动、结果是错的”。MIRA把历史修正记忆拆成乐高式独立修复项,再用数据库证据精准激活——261次成功修复、仅18次误伤,SQL纠错玩出了手术级精度。
论文标题: An AI Scientist that Doesn’t Drift: Taste, Structure, and Falsifiable Findings in a Quadruped Navigation Research Loop 发表日期: 2026年08月 发表单位: California Institute of Technology
预取器是芯片里的“预言家”,过去全靠人类工程师手搓,如今Google联合UC Berkeley让LLM进化智能体自己“进化”出一个三级预取器,直接拿下DPC4冠军,IPC比人类顶级方案还高0.3%,低带宽场景下更是领先2%。这是AI自动硬件设计第一次真正在权威竞赛里赢过人类冠军,值得所有做体系结构和AI的人围观。
AI做科研这件事,已经不再是“帮忙查文献”这种打杂级别了。如今的自主科研智能体能够自己提出假说、写代码、跑实验、解读结果、再修改方案,流程跑得飞起。
这可能是第一篇系统研究“AI代理自我投毒”的论文:攻击者不注入任何恶意外部输入,只靠模型自己在正常任务里“写”出带毒的技能文件,就能让隐私泄露、提权、越权写入在后续任务中自动触发,在OpenClaw、Codex、Claude Code上平均攻击成功率超93%。对做AI Agent安全和部署的同学来说,这篇值得细读。
Meta在RecSys 2026上放了颗实弹:用LLM Agent把推荐系统从"被动猜你喜欢"变成"用户实时说了算"。三层架构干净利落,离线准确率98.85%,线上A/B负面反馈同时下降,是目前少见的工业级对话推荐实战样本,搞推荐的同学值得一读。
给AI代理发工具权限就像借车给实习生——怕他乱开。Niyam-AI直接上密码学“行车记录仪+电子围栏”:每次工具调用都得先过轻量Judge模型,再生成零知识证明,F1 88.5%、误报率仅1.1%,关键是任何第三方都能在53毫秒内验证“安全检查真的发生了”。同类工作里把ZK证明用到agent工具调用验证上的,这是头一遭。
ToolLIFT把“具体工具”抽象成“功能角色”,让LLM在没有见过的新工具集上也能规划出像样的工作流。OOD基准上最高涨近9个点,泛化能力肉眼可见,工具规划方向的小伙伴值得一读。
每次A/B测试都要烧流量、等数周,现在亚马逊尝试让AI智能体先在"平行宇宙"里把结果跑一遍!这篇论文把"AI模拟实验"正式化为S-RCT框架,用67个真实营销测试检验,还给出了可落地的校准与降方差技巧。对搞实验平台的团队来说,是实打实能抄作业的一篇。
这篇论文切中了AI智能体落地的一个真痛点:小模型工具调用能力弱,但可靠数据既贵又脏。Data Turnstile把整段对话拆成带校验的角色化有向无环图,用开源权重模型就能批量产出高质量函数调用数据。0.6B微调后BFCL直逼7倍大的Qwen3-4B,多轮电信任务1.7B直接超越32B——数据质量对小模型而言,就是胜负手。
现实世界的决策总在多个目标之间为难:既要跑得快,又要省电;既要安全,又要高效。当奖励函数难以定义时,多目标强化学习该何去何从?LEMUR给出了一个优雅的答案,在多个连续控制任务上全面超越既有方法,逼近全知Oracle的性能表现。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球