俄亥俄州立&普林斯顿:把失败变成错题集,Qwen2.5-72B单次生成59.2%
测试时扩展很香,但反复采样是真烧钱。这篇论文给出一个反直觉的省钱思路:把小模型犯过的错变成提示词,让大模型一次解码就能绕开坑。单次生成、零额外推理开销,还在Qwen、Llama两大系列上全面超越多次采样基线,值得所有做LLM推理的读者花五分钟看看。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
测试时扩展很香,但反复采样是真烧钱。这篇论文给出一个反直觉的省钱思路:把小模型犯过的错变成提示词,让大模型一次解码就能绕开坑。单次生成、零额外推理开销,还在Qwen、Llama两大系列上全面超越多次采样基线,值得所有做LLM推理的读者花五分钟看看。
这是一篇被引1647次的深度学习经典之作。当所有人都在用CNN最后一层特征时,UC Berkeley团队提出“超列”表示,将多层特征融合用于像素级定位,在分割、关键点、部件标注三大任务上全面领先,至今仍是多尺度特征融合的思想源头。
不用训练、不用改模型,单张图优化不到半秒,就能把基础模型低分辨率特征放大成高分辨率特征,还在分割、深度、概率图上一口气刷到SOTA。想给视觉基础模型做“像素级复活”的同学,这篇绝对是宝藏基线。
6G通感一体化(ISAC)系统天生面临一个尴尬:用于感知目标的信号,也可能被目标“偷听”。东南大学团队将智能反射面(IRS)搬上无人机,并赋予其六维自由度(三维平移+三维旋转),通过让反射面在空中“转身挪窝”,在低空视距场景下显著提升保密速率,让窃听者“失聪”。本文拆解该工作的核心思路与算法设计,对无线通信、物理层安全、IRS方向的研究者很有参考价值。
微调大模型,LoRA 省显存但总差口气?中科大新方法 LoRA-GA² 表示:只盯一步梯度确实容易“短视”,多走几步、看看真实的微调轨迹,GLUE 直接反超全量微调,显存还一分不多花。
多模态大模型“一本正经地胡说八道”是落地最大痛点之一。这篇CVPR 2026论文把幻觉拆成“感知偏差”和“推理漂移”两类,用不到1%的额外计算找到该加强的注意力头,平均提分4.2%且完全无需训练,插拔即用,值得所有做多模态推理的团队收藏。
这就是社区问答(Community Question-Answering,简称CQA)平台面临的真实困境。
世界模型和Q学习还能这么玩?斯坦福北大团队提出的QWM,把世界模型当成“预言家”,只做测试时搜索,不让模型误差污染训练,操作成功率全面飙升。继7月末聊过ActSWM这类JEPA世界模型的规划玩法后,本期这篇把Q学习和世界模型的结合推到了一个新高度。
传感器掉线、字幕丢失、画面损坏……LVLM一遇模态缺失就肉眼可见地“降智”。这篇TTSD-FAR偏偏只更新0.629%的参数,就把50%文本缺失下的F1从趴窝的0.4785拉回0.5124,还顺手解决了持续适应的漂移问题。方法不算复杂,思路非常实用,值得所有做多模态落地的朋友读一读。
先问一个问题:当你想知道一个图神经网络(GNN)为什么做出某个预测时,最直接的办法是什么?
纯数据驱动的医学分割模型已经够卷了,但几乎没人把线性代数和矢量微积分“硬塞”进网络。M-Net直接给出答案:把条件数、散度、旋度当先验注入U-Net,肝脏分割Dice比基线猛涨12.37%,还能端到端训练。想了解“数学+深度学习”还能玩出什么花活?这篇值得细品。
透明隐形眼镜正在悄悄拉低虹膜识别的准确率,却因为“看不见”而长期被忽视。本文不仅量化了这个威胁,还用一个两阶段框架加分数校准,把识别错误率最高降了28.3%,思路相当务实。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球