一句提示让Claude和GPT-5.5暴涨63个百分点
AI智能体开始替人下单、订票、做采购,真正的风险不在“会不会说”,而在“会不会做”。这篇TAC直接盯住揭短:默认设置下,7个前沿模型全都低于随机水平,挺扎心,但也很有价值。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
AI智能体开始替人下单、订票、做采购,真正的风险不在“会不会说”,而在“会不会做”。这篇TAC直接盯住揭短:默认设置下,7个前沿模型全都低于随机水平,挺扎心,但也很有价值。
这篇文章最有意思的地方,不是又在给LLM贴新标签,而是把“token模型”和“世界模型”之间那道墙直接拆成了坡道。它把争论从“是不是”拉回到“走到哪一步、代价是什么”。
这篇 MIT 的论文不跟你争“指数到底是不是 1/3”,它直接把焦点挪到更实用的地方:系数。指数像规矩,系数像手感;前者决定大方向,后者才真管模型怎么长、算力怎么花。
大模型量化里最难啃的骨头之一,就是把权重压到三元还别把精度摔碎。CAT-Q这篇很有意思:不用百亿token重训,靠后训练量化就能把1.7B到235B模型压到1.58比特,且对QAT三元方法也不怵,值得认真看看。
这篇 OmniAct 很适合机器人/具身智能方向的读者:它不是把“规划、记忆、执行”揉成一锅粥,而是拆成三层各司其职,专门解决长程任务里最烦的两件事——工具太杂、失败太多。更有意思的是,它在真实家庭场景里把开源模型也拉到了接近商用的表现,思路相当顺手。
阿里和浙大这次没走“单次判断”老路,而是把AI鉴伪做成了一个会看、会判、还会反思进化的智能体。更有意思的是,它不只追准确率,还把推理质量也一起往上拽。
这篇论文把“看视频”拆成了三件事:先粗看定位,再重看细节,最后重答修正。最妙的是,它不用冷启动的长串 CoT 标注,直接靠强化学习把重看能力练出来,省事还挺能打。
这篇论文把“找 Bug”从盲猜升级成了“带诊断报告的定位”。不用训练、不用多智能体吵架,靠一个推理 LLM 加四个仓库工具,就能把定位和修复一起带飞,挺适合喜欢看智能体干活的同学。
自动驾驶里最怕的不是“慢”,而是慢系统该出手时没出手、不该出手时瞎出手。ASSCG把这个老大难问题拆成“查、存、扔”三种动作,思路很朴素,效果却相当能打。
这篇论文专门盯住一个很现实的问题:训练语料里那些“删不干净的重复”,到底会怎么偷走算力。它不只说“重复不好”,还给出了最伤人的重复区间、模型规模趋势,以及一个能把损失翻成算力浪费的尺子,挺实用。
这篇论文把“写报告”这件事拆成了两步:先把医生的自由文本洗成结构化标签,再让模型按规矩自动生成。别看它是医学场景,思路其实很通用,尤其适合那些“数据不多、标签还乱”的硬核任务。
在线强化学习最怕什么?不是不会学,而是学着学着突然跑偏。GEOALIGN抓住“高分但方向不对”的rollout,直接在潜空间里做体检,数学推理和对齐任务都更稳了。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球