残碑补字新范式:字符级掩码扩散让Ithaca都成了配角
当大模型都在卷token时,这篇论文反着来:用字符级离散扩散处理古希腊残卷,把修复误差从24.6直接干到15.5。更难得的是,它把训练语料和11个去污染检查点全部开源,还承诺每个残破文本都能找到一个"从未见过它"的模型来做修复。数字人文的"可复现良心",大概就长这样。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
当大模型都在卷token时,这篇论文反着来:用字符级离散扩散处理古希腊残卷,把修复误差从24.6直接干到15.5。更难得的是,它把训练语料和11个去污染检查点全部开源,还承诺每个残破文本都能找到一个"从未见过它"的模型来做修复。数字人文的"可复现良心",大概就长这样。
评测行业深水炸弹:"零差距"可能根本不是修复成功,而是正负误差抵消的假象!浙大新作直指现有污染缓解指标G-AP的两大致命缺陷,并给出SA-PPG评估指标与RailCap缓解策略。多模型多基准验证下,旧方法的"完美修复"排名被彻底翻盘。做评测、做数据清洗的,这篇不能错过。
信息从生成到失效,中间能安全用多久?这个问题在自动驾驶、无人机、网络缓存里被各领域分别回答。奥克兰大学的这篇论文给出统一数学答案。它不仅证明现有安全调度策略都是其特例,还在V2V车队与无人机SLAM中把通信与计算干预量分别砍掉99.3%和86%,值得一读。
单目标强化学习靠“换网络结构”就能白捡一大截性能,多目标强化学习却还在算法泥潭里打转?马萨里克大学和阿托大学的最新研究直接把SimbaV2架构搬进MORL,HV暴涨132%,证明“算法不够,架构来凑”这条路在多目标领域同样走得通。对正纠结算法创新还是架构升级的读者来说,这篇论文给出了一个极具性价比的新方向。
把特征拼一起,就像把所有水果丢进一台榨汁机——最后没人知道哪一口是苹果、哪一口是橙子,更不知道是哪个"果"在犯错。西湖大学这篇新工作干脆给残差上"户口":先分清谁的错,再动手修。实测同一批特征、同一批树上限,扣费收益从13.52%干到19.10%、夏普1.42→2.09。这份"残差代数",值得所有做表格学习、量化选股的人细品。
图2:HD-REC整体架构。(a)HDQ通过全局共享粗粒度量化和自适应路由细粒度量化构建语义ID。(b)DAS MoE结合常驻共享专家与动态选择的特化专家。
这是龙哥近期看到的最有“反常识”的AI安全论文:正常防御都是让模型变笨或推理变慢,Apple却反手把训练成本拉满,推理保持原速,还顺手把自适应攻击者挡在门外。方向清奇且实验扎实,值得一读。
场景文本超分是OCR落地硬骨头——图要修得漂亮,字还得认得准。西北工业大学等机构提出的DualTSR把图像生成和文字预测塞进同一个Transformer,训练时同步加噪、推理时互相引导,把DifTSR参数量砍掉六倍、速度快一百倍,识别率反而大涨12.78个百分点。一个字:值。
视频扩散模型做驾驶规划,一定要把未来视频全部生成完吗?清华AIR这篇工作给出了否定的答案:中间层特征已经足够解码出好轨迹。它给六个中间层装上"提前出口",配一个轻量质量打分器,分数够了就立刻刹车返回,平均端到端延迟只有170毫秒,比全深度规划省下47%的时间,数值还更高。把视频生成的成本巧妙避开了,这个思路在同类工作里相当眼前一亮。
SAM3把分割从“几何抠图”进化成了“概念理解”,可越聪明的东西往往越怕被人抓住命门。这篇来自中科大、江南大学等团队的工作,首次为SAM3量身定制了跨概念通用对抗攻击UCD,一张扰动让五个数据集平均Mask AP从59.43直接被干到18.73,还顺手迁移到了SAM3.1和视频推理。AI安全方向的硬核活,值得好好拆解。
这篇论文把推测解码的老问题拆得很清楚:目标模型有相当比例的“重写”其实毫无价值,因为重写前后的推理步骤质量差不多,算力却要照付。ARBITRAGE直接用轻量路由器预估“这一步目标比草稿强多少”,只在真正有可能更优时才升级到目标模型,数学推理任务上端到端延迟最多降约2倍。
拍跑步的人、旋转的车轮,结果只有物体糊背景清晰——这就是局部运动模糊。过往数据集要么合成失真、要么采集昂贵且对不齐。浙大这篇CVPR 2026工作用工业相机物理级还原曝光过程,搞出2万+真实配对数据,训练出的模型在ReLoBlur真实场景上照样能打,这活儿干得漂亮。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球