27B模型硬刚GPT-5.5与Gemini:工业CAD多模态生成险胜0.8%
传统印象里,CAD建模是工程师坐在电脑前,对着软件菜单点点拖拖,从草图拉伸、切除、倒角一路做到出工程图。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
传统印象里,CAD建模是工程师坐在电脑前,对着软件菜单点点拖拖,从草图拉伸、切除、倒角一路做到出工程图。
还在让代码大模型硬啃题目?上海交大等机构提出的TIPCODER做了个示范:先别急着写代码,让模型根据具体问题"出个主意",再动笔。就这么一个前置小动作,一次生成的效果反超了Best-of-8的多次采样,平均通过率最高冲到71.10,有点东西。
图像恢复越清晰,检测反而越容易翻车?SafeRestore告诉你:别急着让AI"修复"图像,先给修复结果发张"安全认证"再放行。这篇论文最精彩的地方,是诚实地展示了自适应策略如何在五次实验中只通过一次认证——比简单插值还没牌面。
考过程序设计竞赛的读者应该都有同感:决定命运的不是“你觉得自己写对了”,而是评测数据有没有精准戳中你代码里藏得最深的bug。
LLM做5G故障根因分析,最怕的就是一本正经地编证据。三星美研这次把“证据→诊断路径→结论”结构化地塞进微调过程,让1.5B小模型直接干出94.2%准确率。想研究LLM垂直落地与“反幻觉”设计的同学,这篇值得细读。
写代码时如果发现bug,你会不会把错误日志贴到代码最前面,一边看一边改?清华与Z.ai这篇新作就是干这个的:让大模型先自己想一遍,把推理草稿提到长正文前面再来一次,GraphWalks上准确率直接从29.2%飙到81.8%!
把这个问题再往前推一步:潮流不收敛以后,电网调度员通常要反复“试探”——检查网络结构、分析残差、判断是不是无功支撑不够、猜想某个发电机电压定值压得太低,然后带着假设去跑仿真,不行就换个方向再来。
EEG基础模型已经多到“选择困难”,但这篇论文发现:没有哪个基座模型能对所有脑电样本通吃。昆山杜克大学提出的EEG-AS把模型选择做成逐样本的智能决策,推理时只跑一个轻量锚定模型,却能隔空猜测其他所有基座模型的预测行为,平均准确率从53.7%飙到66.9%。做脑电基座模型部署、神经解码评测的朋友值得一读。🎯
图1:披露门——五级有序门禁,释放三个深度层级。系统的状态是一扇“门”,而门所释放的是一个“深度”:只有信息深度不高于当前门所放行的层级时,这条信息才有资格浮出水面
想象一下这样的场景:医院的影像科里,一张胸部X光片总是和病历表格里那串诊断代码、年龄、性别等信息绑在一起出现。
大模型的"三好学生"人设,一换语言就崩?麦考瑞大学等机构给乌尔都语做了套"文化体检",人工逐句改造三大经典对齐基准,结果GPT-4o-mini的诚实度直接掉了20个百分点,安全护栏也形同虚设。🤚
当全世界都在卷Agent能力时,这篇由Stony Brook University和Old Dominion University合作的论文,罕见地将目光投向了最容易被忽视的用户群体——盲人。它用一份扎实的、基于真实世界1258条指令的实证数据,狠狠给“无所不能”的计算机使用代理(CUA)泼了盆冷水:最强模型成功率也仅52.5%。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球