美团新框架SAF:1.7B到8B全系提升,几乎所有基准都在涨
图1:固定系数融合与SAF的对比。SAF分别针对OPD优势的幅度失配与时间失配设计独立控制机制,避免熵塌缩、保留探索能力,最终提升任务表现。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
图1:固定系数融合与SAF的对比。SAF分别针对OPD优势的幅度失配与时间失配设计独立控制机制,避免熵塌缩、保留探索能力,最终提升任务表现。
这篇论文切中了AI智能体落地的一个真痛点:小模型工具调用能力弱,但可靠数据既贵又脏。Data Turnstile把整段对话拆成带校验的角色化有向无环图,用开源权重模型就能批量产出高质量函数调用数据。0.6B微调后BFCL直逼7倍大的Qwen3-4B,多轮电信任务1.7B直接超越32B——数据质量对小模型而言,就是胜负手。
大模型对抗训练是真·烧钱大户,光8步PGD就吃掉约80%算力。密歇根州立大学这篇工作把「低秩表示微调」和「电路剪枝代理模型」结合起来,从攻防两端同时压缩计算,平均省下48.1%的FLOPs,可训练参数只有0.0118%。效果不打折太多,性价比直接拉满。
大模型推理烧算力烧得肉疼,这篇中山大学的新工作偏要教模型“见好就收”。SVR让模型每轮输出答案时顺带自证对错+报置信度,自己决定要不要继续想下去,七大数学基准平均2.99轮就超过了固定10轮预算的效果,token直接省一半还多。
推荐系统推理常需对数百候选跑完整模型,存在大量重复计算。Meta的ROCS拆掉这种结构性冗余:延迟交互、请求侧只算一次,配合GPU内核优化,检索QPS最高提升3倍,排序阶段用省下的算力换模型质量。该方案已在Meta广告和自然内容数十个模型上真实部署,绝非纸上谈兵。
世界动作模型(WAM)性能强但部署成本高,传统PTQ方法在闭环场景下频频翻车。复旦大学等机构提出了QuantWAMs,从结构、分布、目标三个上下文校准量化决策,W4A4下几乎无损,真机验证也稳了。这篇把量化粒度讲得明明白白,值得一读。
文生视频最讨厌的就是中间有几帧突然崩坏,而现有DPO类偏好优化连"错题"都找不准。快手Kling团队这篇cIPO,直接从模型自己的去噪重建误差里抠出偏好信号,把优化火力集中到高错误时间窗口,不用人工标注、不用外部奖励模型,MotionBench上Forensic从0.830涨到0.876,思路清奇且工程上很容易复现。
回放缓冲区是强化学习的核心组件,但何时该采用非均匀回放一直是个谜。本文通过三个关键因素给出了答案,并带来一种简单高效的截断几何采样方法,值得每位强化学习研究者关注。
能量模型(EBM)一直是个"难啃的硬骨头":理论优雅,却老困在采样慢、训练不稳的泥潭里。这篇论文提出的并行轨迹回火(PTT)算法,直接沿训练轨迹搭"副本天梯"保持平衡采样,计算成本还能追平PCD——在伊辛模型、基因组、蛋白质等多类科学数据上全面逆袭。对想用可解释生成模型做科学发现的朋友,这波操作值得关注。
跨教师蒸馏这个大坑,英伟达来填了!Lightning OPD 2.0用交叉拟合把“风格噪音”从token级信号里剥离,让换更强的教师也有稳定收益,数学推理AIME 2024直接冲到82.4%。
数学考试里有个经典场面:学霸写完就交卷,学渣越改越错。大模型推理也有这毛病——简单题算力浪费,难题越修越歪。中山大学这篇新论文,教模型“自我检查”:有把握才交卷,没底就再改一轮。结果平均2.99轮推理,精度反而超过固定10轮,还省了一大半token。这招龙哥看了直呼内行!
RoPE、2D-RoPE这些位置编码从哪来?这篇论文用一个“构成操作”统一了它们,还理论证明了路径无关的充要条件。基于此设计的JoFormer在值侧也做旋转,ImageNet提了0.4%,长度外推比降到1.02×——对于想理解位置编码本质的读者,这篇是不可错过的代数教科书。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球