LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12823 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:模型架构

共 307 篇
残碑补字新范式:字符级掩码扩散让Ithaca都成了配角
视觉与图像

残碑补字新范式:字符级掩码扩散让Ithaca都成了配角

当大模型都在卷token时,这篇论文反着来:用字符级离散扩散处理古希腊残卷,把修复误差从24.6直接干到15.5。更难得的是,它把训练语料和11个去污染检查点全部开源,还承诺每个残破文本都能找到一个"从未见过它"的模型来做修复。数字人文的"可复现良心",大概就长这样。

浙大最新:零差距≠真恢复!SA-PPG揭示基准污染修复被严重高估
视觉与图像

浙大最新:零差距≠真恢复!SA-PPG揭示基准污染修复被严重高估

评测行业深水炸弹:"零差距"可能根本不是修复成功,而是正负误差抵消的假象!浙大新作直指现有污染缓解指标G-AP的两大致命缺陷,并给出SA-PPG评估指标与RailCap缓解策略。多模型多基准验证下,旧方法的"完美修复"排名被彻底翻盘。做评测、做数据清洗的,这篇不能错过。

凭什么说所有安全调度都是CIPS特例?一文看懂统一调度框架
视觉与图像

凭什么说所有安全调度都是CIPS特例?一文看懂统一调度框架

信息从生成到失效,中间能安全用多久?这个问题在自动驾驶、无人机、网络缓存里被各领域分别回答。奥克兰大学的这篇论文给出统一数学答案。它不仅证明现有安全调度策略都是其特例,还在V2V车队与无人机SLAM中把通信与计算干预量分别砍掉99.3%和86%,值得一读。

最新SOTA!多目标强化学习不用改算法,只换网络结构就能让HV暴涨132%?
大模型与智能体

最新SOTA!多目标强化学习不用改算法,只换网络结构就能让HV暴涨132%?

单目标强化学习靠“换网络结构”就能白捡一大截性能,多目标强化学习却还在算法泥潭里打转?马萨里克大学和阿托大学的最新研究直接把SimbaV2架构搬进MORL,HV暴涨132%,证明“算法不够,架构来凑”这条路在多目标领域同样走得通。对正纠结算法创新还是架构升级的读者来说,这篇论文给出了一个极具性价比的新方向。

量化新范式:给残差上"户口",净收益13.52%→19.10%
大模型与智能体

量化新范式:给残差上"户口",净收益13.52%→19.10%

把特征拼一起,就像把所有水果丢进一台榨汁机——最后没人知道哪一口是苹果、哪一口是橙子,更不知道是哪个"果"在犯错。西湖大学这篇新工作干脆给残差上"户口":先分清谁的错,再动手修。实测同一批特征、同一批树上限,扣费收益从13.52%干到19.10%、夏普1.42→2.09。这份"残差代数",值得所有做表格学习、量化选股的人细品。

西北工业大学最新研究:图像超分和文字预测一个模型搞定,速度比DiffTSR快101倍
视觉与图像

西北工业大学最新研究:图像超分和文字预测一个模型搞定,速度比DiffTSR快101倍

场景文本超分是OCR落地硬骨头——图要修得漂亮,字还得认得准。西北工业大学等机构提出的DualTSR把图像生成和文字预测塞进同一个Transformer,训练时同步加噪、推理时互相引导,把DifTSR参数量砍掉六倍、速度快一百倍,识别率反而大涨12.78个百分点。一个字:值。

清华AIR最新研究:视频扩散模型做规划不用跑完,170ms就够?
视觉与图像

清华AIR最新研究:视频扩散模型做规划不用跑完,170ms就够?

视频扩散模型做驾驶规划,一定要把未来视频全部生成完吗?清华AIR这篇工作给出了否定的答案:中间层特征已经足够解码出好轨迹。它给六个中间层装上"提前出口",配一个轻量质量打分器,分数够了就立刻刹车返回,平均端到端延迟只有170毫秒,比全深度规划省下47%的时间,数值还更高。把视频生成的成本巧妙避开了,这个思路在同类工作里相当眼前一亮。

最新SOTA攻击:SAM3概念分割被一招打崩,Mask AP暴跌40.7
视觉与图像

最新SOTA攻击:SAM3概念分割被一招打崩,Mask AP暴跌40.7

SAM3把分割从“几何抠图”进化成了“概念理解”,可越聪明的东西往往越怕被人抓住命门。这篇来自中科大、江南大学等团队的工作,首次为SAM3量身定制了跨概念通用对抗攻击UCD,一张扰动让五个数据集平均Mask AP从59.43直接被干到18.73,还顺手迁移到了SAM3.1和视频推理。AI安全方向的硬核活,值得好好拆解。

Apple Research最新论文 | ARBITRAGE:推理延迟降2倍,优势感知投机解码新范式
大模型与智能体

Apple Research最新论文 | ARBITRAGE:推理延迟降2倍,优势感知投机解码新范式

这篇论文把推测解码的老问题拆得很清楚:目标模型有相当比例的“重写”其实毫无价值,因为重写前后的推理步骤质量差不多,算力却要照付。ARBITRAGE直接用轻量路由器预估“这一步目标比草稿强多少”,只在真正有可能更优时才升级到目标模型,数学推理任务上端到端延迟最多降约2倍。

CVPR 2026浙大新作:2万对物理真实模糊数据,局部去模糊SOTA
视觉与图像

CVPR 2026浙大新作:2万对物理真实模糊数据,局部去模糊SOTA

拍跑步的人、旋转的车轮,结果只有物体糊背景清晰——这就是局部运动模糊。过往数据集要么合成失真、要么采集昂贵且对不齐。浙大这篇CVPR 2026工作用工业相机物理级还原曝光过程,搞出2万+真实配对数据,训练出的模型在ReLoBlur真实场景上照样能打,这活儿干得漂亮。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球