汤森路透新基准:GPT-5.5审合同召回率仅75%?
想象一下这个场景:一笔并购交易历经数月谈判,终于在截止日前夜敲定了最终条款。此时,一位律师揉着布满血丝的眼睛,逐行核对一份几百页的合同——不是在看条款对不对,而是在找"错别字"级别的硬伤:某个大写术语在这里为什么没大写?
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
想象一下这个场景:一笔并购交易历经数月谈判,终于在截止日前夜敲定了最终条款。此时,一位律师揉着布满血丝的眼睛,逐行核对一份几百页的合同——不是在看条款对不对,而是在找"错别字"级别的硬伤:某个大写术语在这里为什么没大写?
多模态RAG最让人头疼的不是"找不到证据",而是"证据太多太吵"。东南大学这篇GraphLoom把Llama-3.1-8B冻住,只训练160万参数,用可靠性校准的证据路由在三大多模态问答基准上全面超强基线,还把幻觉率压到10.5%。
数学的世界里,总有一些数字“不守规矩”。在双曲流形上,拉普拉斯算子的谱由连续谱和离散特征值组成,但在连续谱门槛ρ²之下,偶尔会潜伏着几个特殊的特征值。
重离子对撞后,先问一个问题:人类目前最昂贵的实验装置之一——欧洲核子研究中心的大型强子对撞机(LHC)——把两个重原子核加速到接近光速然后对撞,这个过程产生的“夸克-胶子等离子体”,为什么能在比预期热化时间短得多的时刻,就表现出完美的流体行为? 这个“意外地快速进入流体力学描述”的现象,被物理学家命名为流体动力学化(hydrodynamization)。
还在为AI视频生成几秒就崩、动作循环重复而头疼?UCLA携手字节跳动Seed团队祭出LoL大招,让视频生成一口气跑12小时不带喘的,关键还不用重新训练模型!
这是一篇纯数学论文,没有代码、没有数据集、没有实验曲线,却把“可微逼近保持像”这个硬核几何问题从紧致情形一路推到了局部紧致情形。对于研究几何、拓扑和可微映射的读者来说,这个结果的分量不亚于顶会SOTA。想理解数学中“光滑化”到底有多讲究,这篇值得静下心来读。
低资源语言的NLP工具一直是老大难,这篇来自地拉那大学的论文直接用本地Gemma 4搭了一条媒体偏见分析流水线,在8358篇阿尔巴尼亚语新闻上把人物实体召回率做到70.3%。更妙的是提示词对比实验:严格校验虽然消灭了标签不一致,但覆盖率几乎腰斩。看完只想说,工程里没有万能的prompt,只有合适的取舍。
纯数学也能这么精彩!这篇来自南京大学数学系的工作,用组合与树结构工具一举证实了Ding等人关于图兰密度的猜想,并把结论从3-图推广到任意k-图。不需要多深的超图背景,也能领略抽象数学化繁为简的美感。
材料一接触,界面处原子怎么排,直接决定器件性能,但候选构型多到算不完。伦敦大学学院团队把“最优传输”搬来当筛子:用FGW距离量化界面与体相的相似度,不碰能量计算也能提前锁定低能构型,离子、共价、混合键三类界面通吃,还开源。
量子计算总给人高高在上的感觉,但真跑起算法,噪声分分钟教做人。这篇论文不玩虚的,直接用最现实的“把任务拆开扔给多个QPU”的思路,系统实测了三种分布式VQE策略在异构噪声下的加速和精度。对想在NISQ设备上做点真实验的团队,有很实在的参考价值。
可验证凭证的撤销检查,正在悄悄泄露你的“稳定句柄”?柏林工大ShadowPath把状态查询藏进持有者本地的零知识证明,首次系统对比SMT与Verkle:路径短10倍,证明反而慢5.68倍,移动端Groth16约3秒出结果——这波反转,值得细品。
新能源越装越多,电网调度的老套路——靠预测吃饭——越来越不好使。预测一错,调度全乱。这篇论文干脆把预测模块整个丢掉,让强化学习直接从运行数据里学调度策略,还是闭式解!又稳又能解释。想在电力系统里玩RL的、搞控制优化的,这篇值得一读。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球