Apple Research最新论文 | ARBITRAGE:推理延迟降2倍,优势感知投机解码新范式
这篇论文把推测解码的老问题拆得很清楚:目标模型有相当比例的“重写”其实毫无价值,因为重写前后的推理步骤质量差不多,算力却要照付。ARBITRAGE直接用轻量路由器预估“这一步目标比草稿强多少”,只在真正有可能更优时才升级到目标模型,数学推理任务上端到端延迟最多降约2倍。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇论文把推测解码的老问题拆得很清楚:目标模型有相当比例的“重写”其实毫无价值,因为重写前后的推理步骤质量差不多,算力却要照付。ARBITRAGE直接用轻量路由器预估“这一步目标比草稿强多少”,只在真正有可能更优时才升级到目标模型,数学推理任务上端到端延迟最多降约2倍。
LLM的“阅读理解”到底是真懂还是背题?佐治亚理工这篇论文把认知科学里研究人类回指消解的经典实验,原封不动搬到5个开源大模型身上,用surprisal和准确率当探针测“人味”。结果显示:Mistral-7B和GPT-2-XL的整体表现最像人类读者。
自回归模型统治语言建模多年,但Apple这次把连续流模型直接干到了1.7B参数、2.1T tokens的规模,自蒸馏后只需4步推理就能生成高质量文本。这是CFM路线迄今最大规模的实证,值得所有关注非自回归生成的人仔细看看。
这篇来自NAVER WEBTOON的工业界论文,把大语言模型从“在线排序器”降级成了“离线先验估计器”,用GPT-4.1从评论文本里提炼贝叶斯先验给Thompson采样暖启动。真实线上A/B/C测试近180万用户,冷启动10-49印象桶CTR涨了9.51%,还顺手揭示了一个反直觉现象:内容先验降CTR却升CVR。想抄作业的做推荐的都该看看。
AI写得越来越像人,怎么零训练识破它?中科院团队从“生成机制”入手,给文本加上一句通用助手前缀,没想到机器文本立刻“自我暴露”——无需任何训练,检测精度直接刷新SOTA,甚至比不少训练过的检测器还猛。值得一看的“机制级”AI文本检测新思路。
ToolLIFT把“具体工具”抽象成“功能角色”,让LLM在没有见过的新工具集上也能规划出像样的工作流。OOD基准上最高涨近9个点,泛化能力肉眼可见,工具规划方向的小伙伴值得一读。
苹果出品,必属精品?这篇论文直接把多模态对齐的“水分”挤干了——不靠GPT-4V、不靠人工标注,用一招“蒙住眼睛”的BDHS方法就能生成高质量偏好数据,效果还能打。对于想低成本做多模态对齐的人来说,这绝对是值得读的“省钱秘籍”。
偏好数据是大模型对齐的燃料,但用户“喜欢什么”本身就是敏感信息。这篇来自新加坡国立大学与阿里集团的工作,精准定位DPO独有的隐私漏洞,提出只往“偏好轴”上加噪声就能锁定隐私的PrivDPO,还首次将严格隐私对齐做到了32B模型,工程上几乎零额外成本。隐私保护与模型效用兼得,值得一读。
如果你在公众号里刷到过AI视频生成的翻车现场,大概率见过这种名场面:你明明输入的是“一只熊推开树桩、找到食物、抓住老鼠、吃掉它”,生成的视频里熊只做到了一半就停下来,甚至干脆把树桩忘了。这不能全怪视频生成模型“笨”。真…
这不是一篇教你“如何做AI”的论文,而是一篇直击灵魂的哲学拷问:AI等先进技术创造的巨大财富,到底该归谁?DeepMind两位研究员从人权、公平、知识共享等五个维度给出了系统论证,逻辑严密、案例扎心,建议所有AI从业者都读一读。
考试抄答案能拿满分,算会还是不会?阿里巴巴团队系统实锤:LLM在科学推理评测中最高44.1%的“正确”答案靠抄近路蒙出来,而且难度越高的题越爱抄。这篇论文给出了可落地的“反作弊”评测框架,值得每一个关心AI真实能力的人读一读。
每次A/B测试都要烧流量、等数周,现在亚马逊尝试让AI智能体先在"平行宇宙"里把结果跑一遍!这篇论文把"AI模拟实验"正式化为S-RCT框架,用67个真实营销测试检验,还给出了可落地的校准与降方差技巧。对搞实验平台的团队来说,是实打实能抄作业的一篇。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球