盲人用电脑有多难?Stony Brook最新研究:AI助手成功率仅52.5%,理想与现实差距有多大?
当全世界都在卷Agent能力时,这篇由Stony Brook University和Old Dominion University合作的论文,罕见地将目光投向了最容易被忽视的用户群体——盲人。它用一份扎实的、基于真实世界1258条指令的实证数据,狠狠给“无所不能”的计算机使用代理(CUA)泼了盆冷水:最强模型成功率也仅52.5%。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
当全世界都在卷Agent能力时,这篇由Stony Brook University和Old Dominion University合作的论文,罕见地将目光投向了最容易被忽视的用户群体——盲人。它用一份扎实的、基于真实世界1258条指令的实证数据,狠狠给“无所不能”的计算机使用代理(CUA)泼了盆冷水:最强模型成功率也仅52.5%。
AI编程助手不仅仅是代码工具。最新研究揭示,Claude Code、Codex等产品可能被恶意指令攻破,黑客可远程控制你的电脑。
斯坦福Chelsea Finn团队联合KRAFTON提出WHALE,把智能体优化从"单练模型"升级为"模型+执行框架交替进化",三个任务上最多提升24.38个百分点。对做智能体训练和Agent产品落地的朋友,这篇值得细读。
一堆AI医生会诊,居然还会“抱团跑偏”?把肺癌晚期患者往肿瘤科一推,完全无视血氧已经掉到危险线。华南理工等机构最近祭出新框架MASGR,把松散群聊升级成结构化推理图,再请来“仲裁官”把关,转诊准确率一口气顶到95.3%。
当大模型碰上对话推荐,最怕的不是模型笨,而是它“聊完就忘”。这篇EMNLP 2026主会论文直接抛弃了把上下文堆进Prompt的粗暴玩法,提出双节点蒙特卡洛树搜索框架DREAMS,一边主动问偏好,一边把对话状态变成精准检索查询,成功率平均提升7.43%,Redial上R@1高达0.507,还开源了代码,值得一读!
当AI检测器还在纠结"这段文字是不是AI写的"时,康奈尔大学的学者们已经换了个更狠的问法:"就算全是AI写的,这里面有多少想法是你先想出来的?"这就像是问一个球员,不是他投进了多少球,而是他比随便从替补席拉上来的人多得了多少分。这篇论文提出的VOLM框架,正试图用棒球统计的智慧,重建人机协作时代的贡献评价体系。
大模型当裁判太烧钱?NYU和耶鲁的这项研究把奖励模型从8B干到了1.7B,评分更高还快10.7倍。用轻量探针从隐状态里挖信号,思路清奇又实用,做RL的朋友值得一看。
这篇论文很有反差感:一边证明GPT-4o等LLM做复购排序确实打不过传统监督模型,一边又发现LLM引用的行为特征在跨模型掩码评测里真有信号。对做推荐系统、做LLM可解释性的朋友都值得一读,尤其那句“排序质量≠解释质量”,值得反复琢磨。
代码修复里最容易被忽略的,其实是“先去哪找”。这篇论文把仓库探索单独拎出来做基准,直接比较探索器的质量和成本,结论很实用:便宜模型未必差很多,但也不是谁都能省得漂亮。
模型压缩领域一直有个终极诱惑:既然大模型这么贵,能不能把权重压到极致?三值化(Ternary Quantization)就是这条路上的狂飙选手——把每个权重压缩到只有三个取值{-1, 0, +1},理论上每个权重只需要约。
想让机器人掌握一项新技能,传统做法是让专家手动设计各种评估函数和多样性指标,费时费力还经常翻车。这篇论文的思路很野:直接把自然语言任务描述丢给大模型,让大模型自己设计整套质量多样性算法的参数。结果如何?4个操作任务上生成的可用技能数量是专家方案的近70倍。
先来聊一个挺扎心的问题:AI 越来越强,但万一它学坏了怎么办?
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球