27B模型硬刚GPT-5.5与Gemini:工业CAD多模态生成险胜0.8%
传统印象里,CAD建模是工程师坐在电脑前,对着软件菜单点点拖拖,从草图拉伸、切除、倒角一路做到出工程图。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
传统印象里,CAD建模是工程师坐在电脑前,对着软件菜单点点拖拖,从草图拉伸、切除、倒角一路做到出工程图。
先来看一种并不罕见的场景:在产品包装设计、店铺招牌生成、设备铭牌渲染这类视觉内容创作任务里,用户往往给模型下达一个明确指令——在某个指定的主体区域(比如一家面包店的招牌、一辆货车的车身、一瓶饮料的标签)写入指定的文字,同。
让AI画“时间就是金钱”,它可能真画一个挂满钞票的时钟;让AI画“知识就是力量”,它又可能把书本和哑铃硬拼在一起。文生图模型能把物体画得很真,却常常画不出“画外之音”。同济大学等机构提出VMetaphor-Bench,把“视觉隐喻生成”这件事第一次系统性地量化评测,结果连GPT Image 1.5也栽在结构组合上。
大型视觉语言模型(LVLMs)的视觉幻觉问题,本质上是个“看图说话翻车现场”——模型明明没看见那个物体,却说得言之凿凿。
让AI准确渲染又长又密的文字,是图像生成的“最后一公里”。复旦携手小红书放出一招“位置锚定”新设计,把文字准确率直接拉高一大截,海报再密也不怕了。
当所有文生图评测还在卷画质和指令跟随,UIUC这次直接把“答案藏在图里”的推理题丢给模型。2000道题、9个主流生成模型,最强Gemini 3 Pro也只拿64.6分。想看生成模型到底有多少“真推理”,这片试金石值得收藏。
跨本体泛化是VLA从“会干活”走向“干得了所有机器人”的必经关卡,但“零样本”这个词在圈里长期被用得很随意。本论文用严格受控的基准把四种本体变化拆开细测,给出可复现的量化结论:换表征涨15个点、扩源多样性涨18个点、仅5%目标本体预训练数据再涨13.4个点。做机器人的朋友读完能少走不少弯路。
视频流一帧一帧地来,模型能不能不串号、不手抖、不跟丢?西安交大联合EngineAI提出TempoGround,让视觉语言模型在流式输入下连续输出稳定的2D/3D框,3D精度平均提升7.5。这套“状态感知课程预测+强化学习”的组合拳,值得做具身智能和多模态感知的同学认真看一眼。
大模型"看图说话"时编造细节,一直缺乏严格的统计约束。弗吉尼亚理工这篇工作用模型自己的"内心独白"替换外部验证器,照样把错误率控制在数学保证范围内,还顺手把弃权率打了下去。值得所有关注多模态可靠部署的读者一读。
想要看懂SinkPruner,得先搞清楚一件事:多模态大模型(Multimodal Large Language Models,MLLM)里,最烧钱的其实不是“看”,而是“看完之后怎么记、怎么算”。
想搞清空心阴极灯里原子蒸气到底有多密、有多热?杜伦大学这篇把银原子吸收谱从“经验判断”变成了“定量可算”。模型简单、拟合漂亮、代码开源,对做原子物理、量子传感、激光稳频的读者来说是个不错的参考样板。
拍完照片,别人看主角还是背景杂物?调亮度、加对比度、局部压暗……折腾半天,效果不佳。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球