CVPR 2026:一招M2B变换消除框形偏置,弱监督分割Dice飙至85.9%
医学图像分割的像素级标注成本高得离谱,边界框标注是更经济的替代,但框形偏置总会让预测结果“方方正正”。深圳大学在CVPR 2026提出的WeakMed,用一招Mask-to-Box变换和尺度一致性损失,巧妙地把框形偏置化解于无形,在9个数据集上全面超越现有弱监督方法,甚至逼近全监督。这对于想低成本部署医学分割的团队来说,简直是及时雨。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1665 篇文章
医学图像分割的像素级标注成本高得离谱,边界框标注是更经济的替代,但框形偏置总会让预测结果“方方正正”。深圳大学在CVPR 2026提出的WeakMed,用一招Mask-to-Box变换和尺度一致性损失,巧妙地把框形偏置化解于无形,在9个数据集上全面超越现有弱监督方法,甚至逼近全监督。这对于想低成本部署医学分割的团队来说,简直是及时雨。
如何让机器人学会像人一样理解物理世界?港浸大团队提出了VisualPatchWorld,它不依赖人工搭建的物理引擎,而是从几个专家轨迹中自动学习可执行的代码级世界模型。这种方法既保留了神经模型的自动化能力,又让模型变得清晰可见、可编辑。
这篇来自弗吉尼亚大学的Lantern直面物理引导扩散在量热器模拟中的梯度冲突问题,设计GradBlend让物理辅助损失不妨碍生成保真度,并引入新度量CFD诊断层间与体素相关性。实验显示Lantern在FPD上持平纯去噪基线,而普通多任务方法性能崩溃2-100倍。对想给生成模型加物理约束的团队极有启发性。
Netflix 这次玩真的——以前给演员换背景换灯光,人脸基本就崩了。ID-V2V 把身份保持当成了重光照问题,用“重光照面部”+“法线图”把演员的脸死死锁住,单视频就能训,真人脸相似度直接拉到 0.701,比第二名高出 30% 多,还能同时管住多人场景。做视频后期的小伙伴,这篇一定得看。
3D高斯泼溅这个计算机图形学的网红,被Temple大学和阿贡国家实验室的团队跨界用到科学数据压缩上,结果直接碾压传统有损压缩器SZ3好几个身位。不仅压缩比高,还能实时交互渲染,宇宙学家们可以欢呼了。看完直呼:还能这么玩?
水下图像增强一直面临空间不均匀衰减的棘手难题,大多数方法要么效果不错但慢得离谱,要么轻快但恢复质量堪忧。DY-LUT直接把场景深度和YCbCr色彩分离这两个自然线索揉进四维查找表,用极小的参数量(3.56M)实现了质量和效率的双赢。自适应4K推理只需要约7毫秒,比那些笨重的扩散模型快了两个数量级,还能给下游检测和特征匹配带来实打实的提升,很值得关注。
比特币矿工每天面对海量待确认交易,怎样在依赖关系和费用之间找到最优排序?这不仅仅是性能优化,更关系到区块网络的去中心化。西北大学与Chaincode Labs共同提出SFL(生成树线性化)算法,将经典的数学规划思路落地成可直接在交易依赖图上迭代合并分裂的高效操作。在真实mempool数据上,SFL比传统GGT参数化流方法快2-3倍,且具备了“随时可中断”的a
红外与可见光双摄设备如今很常见,可两个摄像头总有‘视角差’,导致图像对不齐。以往要么手动校准,要么用复杂的配准网络。而这篇BeyondFusion另辟蹊径——直接在扩散模型的潜空间里让两个模态‘自对齐’,还能同时输出红外超分辨率图和融合图,手机实拍效果惊艳。一篇方法干净、结果扎实的工作,值得细读。
自监督去噪一直以来都存在一个隐忧:没有干净图像作为目标,构造的代理损失和真正想要的监督损失之间到底差了多少?这篇清华等高校的论文从“迹”差距入手,把各种自监督方法统一到同一个分析框架下,并发现全局迹很小可能掩盖局部大幅正负抵消。为此提出的LoTA-N2N,通过两阶段设计先预训练再局部迹抑制,无需配对数据、无需预知噪声模型,就在21/24个测试设置上拿到零样本
就在大家还在讨论JEPA能不能搞定音频的时候,Yann LeCun团队直接把钢琴演奏变成了隐空间预测游戏——Music-JEPA。它用动作(琴键+踏板)预测未来声音的潜在表示,无需重建原始音频。更有意思的是,6M参数提取的特征在节拍追踪、作曲家识别等任务上居然踢馆95M的MERT,还能通过规划反过来转录钢琴。这是一篇把世界模型从视觉搬到音乐领域的硬核尝试,值
这篇论文解决的可不是小问题——Ding-Li-Xia循环码的最小距离自2018年提出以来就只知其范围,不知道精确值。川大团队用纯几何手法给出了下界的精确达到,证明BCH下界就是答案,简洁得让人拍案。如果你喜欢那种“前面铺垫一大堆、最后突然开天眼”的数学推理,这篇绝对能让你爽到。不需要懂太多编码理论,只需要跟着子空间投影走,就能看到漂亮的结果如何诞生。
视频测试时适应(TTA)一直是块硬骨头,尤其当遇到真实场景的严重分布漂移(比如白天到黑夜、体育到日常),现有方法要么忘得快,要么扛不住。圣保罗大学这篇ACM MM 2026论文提出TADD,巧妙地在冻结CLIP上只加个轻量适配器,靠「零样本蒸馏+目标蒸馏」双重约束,既守住CLIP的通用语义,又保留源域判别知识。效果实在:三个标准benchmark上全面超越之
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球