多语言文生图被曝"语言不平等"!LingT2I基准:10种语言33K提示词,通义千问也翻车
这几年文生图模型卷得飞起,从扩散模型到自回归模型,画质越来越惊艳,英语提示词玩得风生水起。无论是谷歌的Nano Banana,还是阿里的Qwen-Image,你用英语输入"一只在沙滩上戴墨镜的柯基",出图效果基本都能当壁。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这几年文生图模型卷得飞起,从扩散模型到自回归模型,画质越来越惊艳,英语提示词玩得风生水起。无论是谷歌的Nano Banana,还是阿里的Qwen-Image,你用英语输入"一只在沙滩上戴墨镜的柯基",出图效果基本都能当壁。
音频生成图像终于有了像样的"教材"!中科大联合电信AI研究院打造的A2I-Set数据集,32.3万组高质量三元组,配合FAT-Fusion的AudioCanvas模型,让"听声作画"不再是鸡同鸭讲。数据开源的诚意之作,值得细品。
游戏行业离不开RGBA动画,但“先生成RGB再抠图”的老路子,一到半透明边缘就翻车。字节联合北大清华带来一个反直觉方案:既然alpha本身就是可见性信号,那干脆用它来跳过计算——用2.4K个游戏资产视频训练RGBA生成器,1.2倍提速,FVD 174.4,质量几乎无损。
医学影像里,插值和分割各干各的,就像分手后非要各自忙活,结果边界糊了、病灶漏了。这篇论文让两个任务在一套网络里双向打配合,四个数据集上插值PSNR最高涨1.67dB、分割Dice最高涨2.9个百分点,推理还省了一半时间,临床落地够实在。
一张参考图,一段文字,13秒在线微调,不用预训练不用大算力,就能让扩散模型在生成过程中同时锁定"主体像不像"和"文字听不听话"。这种把炼丹塞进推理管线的思路,工程落地潜力很值得一看。
一步超分又有新玩法:西工大MeanSR不靠教师模型蒸馏,直接学习低分辨率条件下的平均速度场来显式建模恢复轨迹,CLIPIQA、MUSIQ、MANIQA全面涨,FLOPs只有之前最强单步方法CTMSR的约1/6,推理还快了近一倍。感兴趣怎么实现的,往下看。
图像编辑最怕什么?改完目标,背景也跟着面目全非。这篇ACM MM 2026论文提出ATDEdit,把扩散Transformer的采样过程改造成异步Token解码,用Token级条件惊奇在线发现"该改哪些Token",不需要外部掩码、不需要微调,在PIE-Bench上把背景保持的PSNR推到27.44dB。方法干净、思路漂亮,值得一读。
最近,来自香港城市大学和斯旺西大学的研究团队提出一个名为 MirrorWorld 的框架,专门解决视频生成中的镜子反射一致性问题。
场景文本超分是OCR落地硬骨头——图要修得漂亮,字还得认得准。西北工业大学等机构提出的DualTSR把图像生成和文字预测塞进同一个Transformer,训练时同步加噪、推理时互相引导,把DifTSR参数量砍掉六倍、速度快一百倍,识别率反而大涨12.78个百分点。一个字:值。
先来聊一个问题:怎么判断一张“造假”的病理切片图像到底像不像真的?
准妈妈躺在检查床上,医生拿着超声探头在肚皮上滑来滑去,屏幕上一团模糊的灰度影像。别小看这团灰度,它决定了整个孕期最重要的一次“过关”。产前超声检查是评估胎儿健康的主要手段,而人工智能想在里头帮忙,先得喂饱数据。问题来了…
想象一下,AI 不仅能模仿任何人的笔迹生成手写图片,还能把笔画轨迹直接发给机器人,让它拿着笔在纸上写出来——在线轨迹和离线图像向来是两条平行线,这篇来自 GIST、CMU、延世大学等机构的论文用一个六参数的可微分物理笔刷模型,硬是把它们捏成了同一件事。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球