哈佛北大新解在线选址,竞争比压到2.42
在线设施选址最烦的地方,不是“开不开”,而是“什么时候开”。这篇论文直接把到达时间当成信号来用,结果把随机顺序模型的竞争比从3往下压,还保住了对抗顺序下的老本,思路很干净。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1655 篇文章
在线设施选址最烦的地方,不是“开不开”,而是“什么时候开”。这篇论文直接把到达时间当成信号来用,结果把随机顺序模型的竞争比从3往下压,还保住了对抗顺序下的老本,思路很干净。
这篇论文最狠的地方,是把“模型自己都这么说了,应该八九不离十吧”这套直觉狠狠干翻了。265000次采样审计显示,自洽性确实有用,但远没有想象中可靠,尤其在最会“装稳”的前沿模型上。
视频生成最烦的不是“生成不出来”,而是“生成得太慢”。这篇 ACID 直接盯住动态缓存里那个最容易被忽略的点:固定阈值一刀切,天然把速度和画质拴死了。它的思路很朴素,但很有效——该省的时候猛省,该稳的时候别乱抠。
脉冲星计时最怕的不是噪声,而是模板自己先“失真”。这篇工作直接盯住 PSR J1713+0747 的轮廓突变,用高斯分量把变化拆开,尽量把还能用的数据救回来。
这篇不是在“做一个相机”,而是在给大望远镜装一套能数光子、能跑千赫兹、还能顺手做偏振的高速神经末梢。原型机已经上天文台干活了,真正值钱的是它把工程可行性和科学想象力同时拉满。
这篇论文最有意思的地方,不是“又一台望远镜相机”,而是把高速、超低读噪、多波段、偏振和近红外,硬塞进同一台设施级仪器里。更妙的是,原型机已经上机,科学结果也不是画饼。
Apple Music 的搜索问题很典型:热门词好搜,长尾、拼写错误、跨语言查询最难办。ELISE 的厉害之处不在“模型更大”,而在于把语义召回、旧词项检索和分布校准接到一起,最后还真在全球线上实验里把转化率和无结果率一起打下来了。
LLM会调用工具,不代表它就会老老实实认账。EG-VAR最狠的地方,不是“又接了个工具”,而是把证据、形式化、内核检查绑死,能证才给VERIFIED,证不出来就ABSTAIN。TableBench、反事实压力测试、端到端形式化误差,这套结果够硬。
这篇论文盯住了自动形式化里最容易“翻车”的一环:证明分解。不是一味堆算力,而是把测试时预算花在最值钱的地方,结果更准、也更省。
一台首光仪器最怕的不是“做不出来”,而是“能做出来却扛不住十年”。MICADO这篇不讲花活,专讲怎么把可靠性、可维护性和停机成本,从设计阶段就摁住。
Apple Research这篇不是在比谁更会“聊天”,而是在逼智能体面对真实手机交互的硬骨头:用户会不会接受、何时插手、能不能跨应用干活。PARE把这件事做成了可评测、可复现的框架,结果也挺扎心:最强模型成功率也只有四成多。
这篇论文很对工程胃口:它不再把 KV cache 当成“模型内部小零件”,而是直接提升为分布式系统对象。结果也很硬,长上下文、多智能体、分支推理这些最烧钱的场景,TTFT、内存和吞吐都被明显改写。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球