Meta AI新基准GAMUT:长文评估不只看对错
最扎心的不是模型答错,而是它把该说的全漏了。Meta AI 这篇 GAMUT 直接把“事实完整性”拆成可评估的结构问题:先写清答案该包含什么,再把它变成机器能稳稳打分的二进制清单。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
最扎心的不是模型答错,而是它把该说的全漏了。Meta AI 这篇 GAMUT 直接把“事实完整性”拆成可评估的结构问题:先写清答案该包含什么,再把它变成机器能稳稳打分的二进制清单。
流式语音到语音翻译最烦的不是“会不会翻”,而是“能不能边听边翻还不崩”。这篇论文的狠活在于:只用约2k小时配对数据,就把长篇流式S2ST做到了很能打的水平,而且还把读写策略和语音生成拆开,思路很干净。
这篇论文的意思很直白:超分不一定非得靠人工文本标注硬喂,模型自己也能学出可用语义,再把语义按空间位置“精准打光”。它把提示学习和空间自适应调制接起来,思路不花哨,但很像能落地的工程方案。
同一张图、同一个问题,顺序一换,VLM就可能答歪。本文没有搞花活,而是直接抓住这个“看起来不该存在”的差距,用测试时训练把弱分支往强分支拉,顺手还把强分支也抬了一点,属于很实在的修模型思路。
多模态推荐最烦的不是“缺特征”,而是“特征里混了太多废话”。这篇 DDMSR 直接把噪声拆成两层处理:先在物品语义图上做低通滤波,再把用户序列丢进频域里抓异常信号,思路很工程,也很实用。
多模态推荐最怕的不是没信息,而是信息里混进了太多“假线索”。这篇 DDMSR 直接把噪声拆成特征层和序列层两刀来切,思路很干净,效果也不虚:四个数据集都稳,训练还比扩散式去噪方案快不少。
教学视频越来越像“内容生产流水线”,但评估这件事仍然很费专家。EduPanel把视频、课程要求和学习者画像一起拉进来,做成三智能体评估器,结果居然能逼近人类专家,还能反过来帮专家提分。
量化论文最怕两件事:一是把模型压小了,二是把精度也一起压没了。Quant Experts 这篇的思路很实在,不跟“全局统一补偿”死磕,而是把重要通道分成全局稳定和 token 相关两类,再用共享专家和路由专家分工处理,72B 模型在 W4A6 下还能追回 5.09% 平均精度,确实有点东西。
视频异常检测最怕什么?不是模型不够大,而是它总爱把整段视频一锅端,结果真正的异常被“正常背景”冲掉了。CSI-VAD干脆把视频拆成环境、对象、时间三路分别看,零训练也能把异常线索抓得更稳。
3D场景检索最怕“指令说改一处,系统却把整间屋子都翻了”。这篇工作直接把问题拆成可执行的重排流程,还顺手补了一套新基准,实用性比很多只会讲概念的方案更硬。
这篇论文最有意思的地方,不是“又做了一个多模态模型”,而是 冻结基座不动,也能把音频硬塞进统一空间 。更狠的是,文本、图像、视频的原有结果还能保持 bitwise 一致,工程味很足。
视频摘要最容易犯的错,不是总结得不够短,而是把最关键的证据先删没了。HAS偏偏反着来:不做硬挑帧,而是把“高光分布”变成推理时的注意力引导,思路很干净,实验也够实在。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球