图像生成|南科大新作:在线微调13秒搞定个性化文生图,主体一致性稳了
一张参考图,一段文字,13秒在线微调,不用预训练不用大算力,就能让扩散模型在生成过程中同时锁定"主体像不像"和"文字听不听话"。这种把炼丹塞进推理管线的思路,工程落地潜力很值得一看。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
一张参考图,一段文字,13秒在线微调,不用预训练不用大算力,就能让扩散模型在生成过程中同时锁定"主体像不像"和"文字听不听话"。这种把炼丹塞进推理管线的思路,工程落地潜力很值得一看。
视频大模型对着画面侃侃而谈,却常常“睁眼说瞎话”?中科院团队提出VADER,一个纯推理期干预的训练无关框架,让LLaVA-Video-7B在EventHallusion上飙到72.60%,还顺手超越了依赖额外训练的TPO与RRPO。不微调也能这么能打,值得一读。
大伙儿平时用手机拍照,有没有遇到过这种场景:明明窗外阳光正好,拍出来的照片却一半清晰一半糊,或者人脸是清楚的,背景却蒙了一层雾。这时候大多数修复算法会怎么做?
Meta在RecSys 2026上放了颗实弹:用LLM Agent把推荐系统从"被动猜你喜欢"变成"用户实时说了算"。三层架构干净利落,离线准确率98.85%,线上A/B负面反馈同时下降,是目前少见的工业级对话推荐实战样本,搞推荐的同学值得一读。
告别逐镜头生成的割裂感,快手Kling团队联合清华、南大提出的ContextMaster,把生成、参考和编辑统一进一个模型,在单卡上跑到16 FPS的同时,还能让角色和场景在多镜头之间保持一致。🔍 想看懂这套固定预算稀疏路由怎么在有限算力下留住完整记忆?这篇值得细读。
多模态推荐里个性加权被吹上天,杭州电子科大的审计团队偏偏不信邪:六个加权头、四个数据集、同一骨架公平对决,结果全局权重几乎吃满全部增益,个性化加权沦为“气氛组”。想看清推荐系统里“个性化”这三个字到底掺了多少水?这篇是绕不开的清醒剂。
有句老话叫“所见即所知”,斯图加特大学这篇新作直接把它变成了“所听即所看”:只拿一个现成的CLIP模型做归因,不微调、不标注、不用任何生成架构,就能复现视觉世界实验里经典的预测性眼动——人类听到“eat”还没听到“cake”就把目光移向蛋糕,模型居然也“看”向了同一个地方。
让大模型当"色偏裁判"?新国立这篇CVPR 2026论文把跨相机白平衡玩出了新花样:不直接回归光照,而是先白平衡、让视觉语言模型判断残留色偏、再迭代修正。四大基准全面碾压现有方法,最差场景误差几乎减半,思路清奇还实用。
场景文本超分是OCR落地硬骨头——图要修得漂亮,字还得认得准。西北工业大学等机构提出的DualTSR把图像生成和文字预测塞进同一个Transformer,训练时同步加噪、推理时互相引导,把DifTSR参数量砍掉六倍、速度快一百倍,识别率反而大涨12.78个百分点。一个字:值。
化疗靶区勾画要改一处轮廓,AI直接"听懂"人话动手改——这是三维医学影像分割基础模型VoxTell与文本指令结合的一次亮眼尝试。冻结全部预训练权重,只训练一个轻量指令分支,就能让模型按临床语言精确编辑亚区轮廓,正确指令在跨数据集测试中比矛盾指令高出0.047的Dice分离度,方向对了。
零样本图像描述三年没挪窝,这篇论文用多检查点对齐评分框架,推理阶段把CIDEr从108.0干到117.6。不重训描述器、不吃配对数据,全靠把评分器插在更多位置上——早该这么干了!
自动驾驶里让AI听懂“右前方二十米那辆白色轿车”并不简单,因为颜色、距离、运动速度这些线索分散在不同传感器手里。这篇论文一口气集齐相机、激光雷达和4D毫米波雷达,搞出全球首个三传感器3D视觉定位数据集Talk2Sensors,再配一个TSFormer框架,把强基线甩开8.05 mAP,还让“物理线索路由”第一次有了正经benchmark。做多传感器感知的团队
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球