多语言文生图被曝"语言不平等"!LingT2I基准:10种语言33K提示词,通义千问也翻车
这几年文生图模型卷得飞起,从扩散模型到自回归模型,画质越来越惊艳,英语提示词玩得风生水起。无论是谷歌的Nano Banana,还是阿里的Qwen-Image,你用英语输入"一只在沙滩上戴墨镜的柯基",出图效果基本都能当壁。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这几年文生图模型卷得飞起,从扩散模型到自回归模型,画质越来越惊艳,英语提示词玩得风生水起。无论是谷歌的Nano Banana,还是阿里的Qwen-Image,你用英语输入"一只在沙滩上戴墨镜的柯基",出图效果基本都能当壁。
深度模型在遥感分割里跑得欢,可它凭什么这么分?黑盒不拆,谁敢拿去搞灾情评估和土地利用监测?本文提出熵中心XAI方法,用熵不确定性给分割模型的决策画热力图,还顺手设计了一个H-SIT评估框架揪出“假重要区域”,在WHU数据集上把Grad-CAM、Score-CAM和Seg-Sobol都甩在身后,值得一读。
这篇论文没急着吹AI能写多好的教育故事,反而请了22位高校STEM被试真的玩当AI写故事:教育场景生成的质量瓶颈在哪里? “这故事写得挺顺,但怎么一到测验题就变得这么尴尬?” 这句话可以说是本论文读者最真实的反应。想象一下:一个AI自动生成的互动小说,故事讲得流畅透顶,玩家一路做选择、推进情节,到了关键时刻,突然跳出一个NPC,脸上的表情仿佛在说“来吧,先答
电池材料研究里,氧K边X射线吸收谱是窥探局域电子结构的利器,但一直缺少针对高镍NMC811真实多组分无序体系的公开计算数据库。这篇论文不仅补上了这个空白,还送上了开源的自动化工作流,值得材料计算与AI交叉领域的研究者一读。
自动驾驶定位一定要靠高精地图和昂贵传感器吗?长安大学这篇工作直接用普通摄像头+卫星图,把时序信息做成“记忆库”,平均误差从3.8米砍到1.57米,真实车辆零样本跑出96.86%的5米内召回。低成本方案又要卷出新高度了。
一边是700小时的大规模语音增强数据,一边是只有35小时的歌声分离标注集,AI界“贫富差距”在这篇论文里被LoRA一招填平。只需6-12%额外参数,就能让语音增强模型“开口唱歌”,还稳稳保住原有看家本领,这买卖划算。
音频生成图像终于有了像样的"教材"!中科大联合电信AI研究院打造的A2I-Set数据集,32.3万组高质量三元组,配合FAT-Fusion的AudioCanvas模型,让"听声作画"不再是鸡同鸭讲。数据开源的诚意之作,值得细品。
城市道路的自动驾驶已经卷成红海,矿区这种“路不成路、灰比雾厚”的硬骨头却少有人啃。中科院团队让规划器学会区分“看得见的安全”与“看不见的风险”,碰撞率直降七成多,这波操作值得研究!
分类任务的学霸,放到推荐系统里可能就成了学渣,这事儿你敢信?澳洲高校团队把六种主流音频编码器拉到KNN、SASRec和TIGER三种推荐范式下正面对决,还顺带拆解了语义ID的量化玄机。音频推荐选型,看这篇就够了。
同样的生物制剂,有人药到病除,有人却毫无反应。这项来自意大利都灵大学的研究发现,只需检测一个IL-10基因位点,就能提前预测炎症性肠病患者12个月后的生化缓解概率,为精准用药提供了全新思路。
Text-to-SQL最磨人的不是不跑,而是“跑得动、结果是错的”。MIRA把历史修正记忆拆成乐高式独立修复项,再用数据库证据精准激活——261次成功修复、仅18次误伤,SQL纠错玩出了手术级精度。
天文仪器不只是反射镜和CCD,光纤定位同样硬核。这篇论文将DESI久经考验的旋转机构与压电弯曲驱动结合,以极简结构实现140V下6mm偏转、闭环2μm精度,为下一代高密度光谱巡天提供了一个相当务实的新选项。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球