多语言文生图被曝"语言不平等"!LingT2I基准:10种语言33K提示词,通义千问也翻车
这几年文生图模型卷得飞起,从扩散模型到自回归模型,画质越来越惊艳,英语提示词玩得风生水起。无论是谷歌的Nano Banana,还是阿里的Qwen-Image,你用英语输入"一只在沙滩上戴墨镜的柯基",出图效果基本都能当壁。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这几年文生图模型卷得飞起,从扩散模型到自回归模型,画质越来越惊艳,英语提示词玩得风生水起。无论是谷歌的Nano Banana,还是阿里的Qwen-Image,你用英语输入"一只在沙滩上戴墨镜的柯基",出图效果基本都能当壁。
电池材料研究里,氧K边X射线吸收谱是窥探局域电子结构的利器,但一直缺少针对高镍NMC811真实多组分无序体系的公开计算数据库。这篇论文不仅补上了这个空白,还送上了开源的自动化工作流,值得材料计算与AI交叉领域的研究者一读。
被引9624次的NLP镇馆级论文,情感分析必读经典。斯坦福团队一口气端出两样硬货:215,154个短语级标注的Sentiment Treebank,以及把张量带进递归网络的RNTN,直接终结了“词袋模型统治情感分析”的时代。
音频生成图像终于有了像样的"教材"!中科大联合电信AI研究院打造的A2I-Set数据集,32.3万组高质量三元组,配合FAT-Fusion的AudioCanvas模型,让"听声作画"不再是鸡同鸭讲。数据开源的诚意之作,值得细品。
城市道路的自动驾驶已经卷成红海,矿区这种“路不成路、灰比雾厚”的硬骨头却少有人啃。中科院团队让规划器学会区分“看得见的安全”与“看不见的风险”,碰撞率直降七成多,这波操作值得研究!
游戏行业离不开RGBA动画,但“先生成RGB再抠图”的老路子,一到半透明边缘就翻车。字节联合北大清华带来一个反直觉方案:既然alpha本身就是可见性信号,那干脆用它来跳过计算——用2.4K个游戏资产视频训练RGBA生成器,1.2倍提速,FVD 174.4,质量几乎无损。
当业界还在用单表抽取评测文档理解时,港科大(广州)团队直接抬高了门槛——Doc2DB-Bench要求从长文档里重建完整的关系数据库,边从表格到数据库:为什么文档理解需要新范式 先看一个真实场景:一份几十页的金融报告,里面写了好几家公司的现金流数据、股权关系、投资链路。传统做法是让大模型把里面的公司名称、金额、年份挨个抠出来,填进一张大表里完事。
机器人领域最缺的不是新模型,而是让模型跑起来的"标准化插头"。港大MMLab与清华联合开源的XPolicyLab,把N个策略连M个环境的成本从O(NM)压到O(N+M),实测集成时间从5小时干到30分钟,是真实工程痛点的一记重拳。
最近,来自香港城市大学和斯旺西大学的研究团队提出一个名为 MirrorWorld 的框架,专门解决视频生成中的镜子反射一致性问题。
拍跑步的人、旋转的车轮,结果只有物体糊背景清晰——这就是局部运动模糊。过往数据集要么合成失真、要么采集昂贵且对不齐。浙大这篇CVPR 2026工作用工业相机物理级还原曝光过程,搞出2万+真实配对数据,训练出的模型在ReLoBlur真实场景上照样能打,这活儿干得漂亮。
先来聊一个问题:怎么判断一张“造假”的病理切片图像到底像不像真的?
银河系里“失踪”了半个世纪的中等质量剥离恒星,被SDSS-V巡天逮个正着。这颗名为WR 2-1的天体不但是银河系首个明确样本,还带着Wolf-Rayet风格的风,质量却只有3.2到5.8个太阳——卡在热亚矮星与经典WR星之间的关键空档,是双星演化的珍贵实验室。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球