斯坦福2013年神作:递归张量网络把情感分析SOTA推到85.4%
被引9624次的NLP镇馆级论文,情感分析必读经典。斯坦福团队一口气端出两样硬货:215,154个短语级标注的Sentiment Treebank,以及把张量带进递归网络的RNTN,直接终结了“词袋模型统治情感分析”的时代。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
被引9624次的NLP镇馆级论文,情感分析必读经典。斯坦福团队一口气端出两样硬货:215,154个短语级标注的Sentiment Treebank,以及把张量带进递归网络的RNTN,直接终结了“词袋模型统治情感分析”的时代。
一边是700小时的大规模语音增强数据,一边是只有35小时的歌声分离标注集,AI界“贫富差距”在这篇论文里被LoRA一招填平。只需6-12%额外参数,就能让语音增强模型“开口唱歌”,还稳稳保住原有看家本领,这买卖划算。
多帧视觉跟踪里模板帧越堆越多,效果却可能越堆越差?ETCTrack用一个可学习的ATC模块把历史模板Token动态压缩60%,MACs直降21.4%,精度只掉0.4%,还在七个基准上拿下SOTA。代码已开源,看完这篇也许能重新理解“给Transformer减负”这件事。
多路径传输一直在“盲人摸象”——调度器只看字节,不懂视频帧的关键程度。代尔夫特理工这篇MoMQ,首次把MoQT的元数据变成路径调度规则,在Starlink+WiFi真实测试床上把P99.9延迟从384.7ms砍到114.1ms,实时视频终于能跑进150ms交互预算。想法巧妙,实验扎实,值得一读。
游戏行业离不开RGBA动画,但“先生成RGB再抠图”的老路子,一到半透明边缘就翻车。字节联合北大清华带来一个反直觉方案:既然alpha本身就是可见性信号,那干脆用它来跳过计算——用2.4K个游戏资产视频训练RGBA生成器,1.2倍提速,FVD 174.4,质量几乎无损。
算法展开(Algorithm Unrolling)一直是可解释深度学习的招牌做法,把迭代优化变成可学习的网络。这篇论文却给这个招牌泼了一盆冷水:图拉普拉斯去噪器的展开网络,无论怎么学,都只是多项式图滤波器,而且可达集还是测度零的严格子集——值得所有做可解释深度学习的人看一眼。
分类任务的学霸,放到推荐系统里可能就成了学渣,这事儿你敢信?澳洲高校团队把六种主流音频编码器拉到KNN、SASRec和TIGER三种推荐范式下正面对决,还顺带拆解了语义ID的量化玄机。音频推荐选型,看这篇就够了。
AI生成的假图肉眼越来越难辨,可检测器却还停留在“加权平均”的老路子。本文提出的PE-Mamba,把Transformer层间特征当有序序列,用双向Mamba扫描来聚合取证线索,只训练1.3%参数就把主流假图检测基准刷到新SOTA,思路清奇又实用。
水下照片又绿又灰还带雾?武汉大学等机构的最新PROTEUS让你一键还原!它把“退化信息”从累赘变成向导,既用它引导特征调制,又用它控制跳跃连接复用。仅2.61M参数,U90的PSNR刷到25.50dB,LPIPS更是把第二名从0.086打到0.081,轻量又能打,值得一读。
流式算法里“精确计算频率矩”是个老大难:空间要小、结果要准,过去直接不可能。这篇新论文把复杂性理论里的“催化内存”搬进流式场景——内存随便借用、用完必须还原,居然在对数空间内四遍精确算频率矩、两遍算F2,顺带解决三角计数与重击者识别,硬核又上头。
本论文针对视觉Transformer在分布偏移下依赖背景等虚假相关性的顽疾,提出概念引导微调(CFT)。仅用1500张图、无需人工标注,让模型注意力从背景转向鸟喙、鱼鳍这类判别性语义概念,五个OOD基准一致提升。CVPR 2026 Highlight,代码已开源,可复现性强,值得细读。
一步超分又有新玩法:西工大MeanSR不靠教师模型蒸馏,直接学习低分辨率条件下的平均速度场来显式建模恢复轨迹,CLIPIQA、MUSIQ、MANIQA全面涨,FLOPs只有之前最强单步方法CTMSR的约1/6,推理还快了近一倍。感兴趣怎么实现的,往下看。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球