谷歌新方法:推理级Shapley近似,LLM数据审计空间缩减99.1%
继6月聊过Adobe的定量LLM评判器之后,Google这篇直接将数据审计玩出了新高度。不重训练、不跑几千次微调,靠推理前向传播就能近似Shapley值,把审计搜索空间干掉99.1%,在HelpSteer2和HH-RLHF里揪出了一堆人类标注翻车的样本,甚至发现评估基准里藏着“错误答案才是正确”的坑。对搞LLM对齐、数据质量的同学来说,这是真正的降维打击。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
继6月聊过Adobe的定量LLM评判器之后,Google这篇直接将数据审计玩出了新高度。不重训练、不跑几千次微调,靠推理前向传播就能近似Shapley值,把审计搜索空间干掉99.1%,在HelpSteer2和HH-RLHF里揪出了一堆人类标注翻车的样本,甚至发现评估基准里藏着“错误答案才是正确”的坑。对搞LLM对齐、数据质量的同学来说,这是真正的降维打击。
红外多帧超分领域终于等来一个像样的专属标准答案。中科院联合团队放了594个序列、27万帧的大招,关键还精心挖了三个坑——低对比高噪声、测试集故意加噪声、运动幅度整得很大,专门治各种花架子模型。顺便送了个轻量级Mamba模型CGMamba,112G FLOPs就把SISR方法打出33dB,还顺手拆穿了RoPE和跨帧融合的连带关系。
说到给视频配音效,很多人会想:不就是根据画面内容生成声音吗,猫叫就是喵喵,打雷就是轰隆,有什么难的?但如果你脑洞再大一点——比如,你想让视频里原本只是“喵喵”叫的猫,在00:07秒的那一声突然变成“狮子吼”;或者你希望整个视频的音频听起来就像是从一部80年代复古游戏机里传出来的;再或者在火柴划过的一瞬间,不仅要有摩擦声,还要叠加一声魔幻的“呼——嗖”……你会
波斯文OCR最难的不是识别器,而是先把像样的数据喂出来。本文直接用七百万词语料批量合成34万余对图文样本,还把字体、连写、退化、版式一并安排上了,属于“先把地基打平,再谈模型起飞”的典型路线。
野外多动物跟踪最缺的不是模型花活,而是“像样的数据考场”。这篇工作直接把考场搬到了4大洲、741个站点、99个物种上,还顺手把分割级标注做到了能真刀真枪测跟踪。
长期记忆这件事,很多模型平时看着挺聪明,一到多会话、跨时间、隐式时间表达就开始露馅。RUMBA把俄语场景拆成三轴诊断题,直接告诉读者:到底是忘了、算错了,还是时间没看懂。
散焦去模糊最怕的不是模型不够大,而是各说各话、数据各跑各的。RealDefocus Benchmark把统一分割、统一协议、跨数据集验证都摆上台面,终于让“谁更强”不至于靠运气。
临床大模型最麻烦的事,不是选错答案,而是“答案对了,理由却乱了套”。MIRA-Ev 直接把评测拆成三层,专门盯住证据、成分和关系,连巴斯克语也拉进来了,属于那种一看就知道不是来凑数的基准。
德语小模型最烦的不是训练,而是“先把文本弄成能喂给模型的样子”。这篇工作直接把席勒戏剧做成单文件、可分词、可微调、可一键加载的语料,主打一个零摩擦。
3D场景检索最怕“指令说改一处,系统却把整间屋子都翻了”。这篇工作直接把问题拆成可执行的重排流程,还顺手补了一套新基准,实用性比很多只会讲概念的方案更硬。
多目标跟踪最怕的不是“没看到”,而是“看到了却认错了”。这篇 VLA-ReID 直接把重识别从单样本比对改成整帧候选集竞争,再用共同外观抑制把一群长得差不多的目标硬生生拉开差距。
地图到底是给人看的,还是给机器看的?这篇论文直接把这个老问题拉到多模态大模型时代重新拷问了一遍。2400张合成等值区域图、12000道题、22个模型,结论很实在: 地图没有过时,反而在高层次空间推理里更像“外挂” 。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球