LVLM遇模态缺失就“趴窝”?TTSD-FAR用0.629%参数把F1从0.48救回0.51
传感器掉线、字幕丢失、画面损坏……LVLM一遇模态缺失就肉眼可见地“降智”。这篇TTSD-FAR偏偏只更新0.629%的参数,就把50%文本缺失下的F1从趴窝的0.4785拉回0.5124,还顺手解决了持续适应的漂移问题。方法不算复杂,思路非常实用,值得所有做多模态落地的朋友读一读。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
传感器掉线、字幕丢失、画面损坏……LVLM一遇模态缺失就肉眼可见地“降智”。这篇TTSD-FAR偏偏只更新0.629%的参数,就把50%文本缺失下的F1从趴窝的0.4785拉回0.5124,还顺手解决了持续适应的漂移问题。方法不算复杂,思路非常实用,值得所有做多模态落地的朋友读一读。
一张照片拍完就定型了?南京大学最新研究告诉你:换视角、拉焦距、调色温、改曝光,一张图就能“重拍”出各种效果,还跟真重新拍过一样。首个统一框架ReX-Shot,直接把单图三要素控制一次搞定。
学习型图像压缩(LIC)性能虽猛,却怕对抗攻击——像素上加点人眼看不见的噪声,码率直接爆炸、画质稀碎。这篇澳门大学与南洋理工的最新研究发现了个反直觉的规律:攻破LIC要几百步,修复却只要1步!基于此提出的FTTR框架,在白盒攻击下把PSNR拉高近15dB,码率暴降6+。值得一读。
如果说机械臂是机器人的“手臂”,那灵巧手就是它的“指尖”——能抓鸡蛋、玩叠叠乐、拧瓶盖的那种指尖。但灵巧操作一直是机器人领域的老大难问题:机械臂在工厂里已经干了几十年活了,灵巧手却还在实验室里“装婴儿”。为啥?
CFG的八种免训练替代方法,真的比原版CFG更香吗?这篇论文在统一协议下,用组合对齐基准在SD3.5 Medium和FLUX.2 klein上实测,结论相当扎心:没有一个方法能全面胜出,CFG依然是性价比之王。想知道哪些方法在哪些指标上偷偷涨了点?这篇评测给你答案。
当大模型学会“思考”后,机器人也该学学“先想后做”了。本论文把大模型里的测试时计算扩展到了机器人子任务规划中,用世界模型预测、价值模型评分、束搜索择优,让机器人在面对长时程任务时不再“走一步算一步”。四项真实世界长时程任务平均成功率45%,值得所有做机器人决策的朋友读一读。
视频模型看懂动作却丢了空间结构,图像模型擅长几何却不懂运动——DeepMind用一套循环掩码自编码器RVM把两边的好处全占了,只靠像素重构损失,小模型还不需要蒸馏,参数效率最高领先30倍。这事儿有点意思,值得花三分钟读一读。
斯坦福Chelsea Finn团队的新作。机器人操作策略学会了但跑得慢,这工作直接给模仿学习加装一个强化学习训练的速度策略,不采新数据、不动原策略,在倒水、投掷等动态任务上提速超2.4倍,思路轻巧、实验扎实,值得一读。
PET(正电子发射断层成像)是肿瘤、神经和心脏疾病诊断中重要的分子影像手段,能无创显示体内代谢活动。但PET天生有痛点:光子符合计数有限,图像信噪比低。
自动驾驶这事儿,有个特别拧巴的现象:你看那些端到端大模型,在 benchmark(标准测试基准)上跑分一个比一个高,可一放到真实世界里,偶尔会像个刚拿驾照的新手一样,干出些让人血压飙升的事儿——比如老老实实闯个红灯,或者。
机器人操作正从“看一步动一步”走向“预见式决策”,但生成未来视频开销太大。上海交大等团队提出的ForeWAM,用一次KV预填充让动作模型“脑补”动态未来,不生成视频、不用未来观测,LIBERO成功率96.7%,动作延迟比Fast-WAM降67%。这篇论文值得细读。
纯数据驱动的医学分割模型已经够卷了,但几乎没人把线性代数和矢量微积分“硬塞”进网络。M-Net直接给出答案:把条件数、散度、旋度当先验注入U-Net,肝脏分割Dice比基线猛涨12.37%,还能端到端训练。想了解“数学+深度学习”还能玩出什么花活?这篇值得细品。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球