美团新框架SAF:1.7B到8B全系提升,几乎所有基准都在涨
图1:固定系数融合与SAF的对比。SAF分别针对OPD优势的幅度失配与时间失配设计独立控制机制,避免熵塌缩、保留探索能力,最终提升任务表现。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
图1:固定系数融合与SAF的对比。SAF分别针对OPD优势的幅度失配与时间失配设计独立控制机制,避免熵塌缩、保留探索能力,最终提升任务表现。
这篇论文切中了AI智能体落地的一个真痛点:小模型工具调用能力弱,但可靠数据既贵又脏。Data Turnstile把整段对话拆成带校验的角色化有向无环图,用开源权重模型就能批量产出高质量函数调用数据。0.6B微调后BFCL直逼7倍大的Qwen3-4B,多轮电信任务1.7B直接超越32B——数据质量对小模型而言,就是胜负手。
大模型对抗训练是真·烧钱大户,光8步PGD就吃掉约80%算力。密歇根州立大学这篇工作把「低秩表示微调」和「电路剪枝代理模型」结合起来,从攻防两端同时压缩计算,平均省下48.1%的FLOPs,可训练参数只有0.0118%。效果不打折太多,性价比直接拉满。
农田分割遇到难题,让模型再强十倍也可能白搭——关键证据压根不在当前图像里。中南大学这篇FarmSeeker,把分割从“图内思考”拉到“图外思考”,按需查时空影像,把模糊地块查得明明白白。跨11国测试,比一堆老牌方法都稳,值得一看。
MoE大模型靠“多个专家干活”撑起千亿参数,但专家之间到底是分工还是打架?这篇来自浙江大学与香港理工大学的最新研究,用39组因子实验拆开了一个反常识真相:专家子空间严重重叠,路由却依然精准;被选中的专家确实更强,但真实上下文反而在“压价”它的优势——作者称之为“连贯重叠”。一句话:光看几何相似度,千万别急着下“冗余”结论。
大模型推理加速是刚需,但"放水"换速度的代价到底是什么?这篇来自百度等团队的工作把有损验证方法扒了个底朝天,用严谨实验揭示了一个反直觉结论:任务越难,截断式验证的质量掉得越狠。看完这篇,再也不敢随便用"有损加速"了。
大模型推理烧算力烧得肉疼,这篇中山大学的新工作偏要教模型“见好就收”。SVR让模型每轮输出答案时顺带自证对错+报置信度,自己决定要不要继续想下去,七大数学基准平均2.99轮就超过了固定10轮预算的效果,token直接省一半还多。
AI能被骗去当假新闻帮凶吗?pattrn.ai搞了个每周更新的“活体”基准,拿俄罗斯、伊朗、中国的真实宣传材料去钓17个大模型。结果最稳的Claude Sonnet 5有94.5%概率拒稿,最配合的Ministral 14B只有8.8%会摇头——同一道题,差距大得离谱。
当别人还在纠结AI会不会让学生“躺平”时,坦佩雷大学直接把多智能体AI工具扔进需求工程课堂,用100人的实证给出答案:精心设计的教学流程,能让AI从“代写工具”变成“思维陪练”。56%的批准率背后,是学生批判性思维的觉醒。
这篇来自汉阳大学的实证研究,把本地电脑使用代理的推理时扩展拆成上下文、时间、结构、并行四个维度逐项考察。结论有点反直觉:额外算力常常不是提升成功率,而是把失败模式从“死循环”改写成“假成功”。对做本地部署的团队来说,这是一份难得的避坑指南。
推荐系统最怕“懂你”却“不会买”——意图清楚了,行动却掉链子。快手这篇工作把理解与行动分开建模,用反馈闭环让策略真正以效果说话:在线A/B测试收入+4.506%、广告价值+4.621%,在线推理时延却几乎零增加。工业级生成式推荐落地,值得细读。
当所有团队都在砸钱堆向量数据库时,EMBL反手甩出一套“零索引”方案,直接用大模型编排实时检索引擎,就把GPT-5.4的问答准确率拔高近9个点。这波操作,堪称给学术文献检索来了次降维打击。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球