别让AI空谈科研:北大华为六字段契约让"可证伪性"不再只是口号
如何判断大模型提出的科研设想靠不靠谱?北大、华为等机构给出一个硬核标准:让模型先写清楚,什么观察结果能证明它自己错。全新Lit2Test基准用六字段契约把可证伪性变成可检验的文本属性,在1200个标准对、2400次盲评下排出GPT-5.2 > Claude Sonnet 4.6 > GLM-5 > DeepSeek-V3.2的严格名次,人类一致率87.2%。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
如何判断大模型提出的科研设想靠不靠谱?北大、华为等机构给出一个硬核标准:让模型先写清楚,什么观察结果能证明它自己错。全新Lit2Test基准用六字段契约把可证伪性变成可检验的文本属性,在1200个标准对、2400次盲评下排出GPT-5.2 > Claude Sonnet 4.6 > GLM-5 > DeepSeek-V3.2的严格名次,人类一致率87.2%。
事件抽取模型一出自家门就迷路?德国DFKI与奥尔登堡大学联合提出统一多域多任务生成框架:给T5加上领域指示和任务提示词,单模型就能横跨网络安全、生物医学、新闻等6大领域做事件抽取,多域联合训练还让多个数据集性能不降反升,这种"一个模型通吃天下"的玩法,值得认真聊聊。
这篇论文的价值不在结果本身,而在于过程:一位资深学者和ChatGPT来回讨论几个小时,就给一个悬而未决多年的在线算法问题画上了句号。算法本身只有三行伪代码,但背后是顶会级别的证明思路。对于关心“LLM到底能不能做科研”的读者,这是一份难得的真实样本。
黑盒大模型在物种分类这类层级推理任务中,经常“嘴硬”但心里没底。这篇来自Vector Institute与Guelph大学的工作,用开源工具LLM提取代理特征,训练轻量监督估计器,把全局阈值下AUROC从0.57拉到0.80,为“该信谁、该拒谁”提供了可落地的判断框架。
知识图谱里明明写着“A是B的子类”,模型却视而不见?查尔姆斯理工把这种类层级关系变成“语义损失”约束,让链接预测MRR在BioKG上直接涨了15.5%,而且比把层级关系硬塞成图边更省参数。想在KG嵌入里优雅地利用本体的同学,这篇值得细读。
FPGA上跑AI模型,压缩和加速是两件事吗?这篇综述梳理了2015-2026年25个协同设计案例,用五分类法重新组织,结果发现:只有1个案例报告了统一基线的压缩比与精度变化。想快速摸清FINN、HLS4ML、Vitis AI谁更靠谱,这套分类和开放挑战值得一读。
GAN快但不够稳,扩散稳但太磨叽,这俩能不能别打架、搭个伙?本文给出了一个简单又实用的答案:把冻结的WGAN-GP中间特征当“导师”,用交叉注意力喂给扩散U-Net,在CelebA人脸去噪上直接涨了4.40dB。方法不复杂,但对混合范式感兴趣的读者值得一读。
大模型测价值观,用问卷、二选一、自由发挥能得出三个不同结论,那测了个寂寞?STONIC用5,144个共享场景和35个模型配置做了一次教科书级的测量审计——既有行为一致性证据,也有“自答偏好”这个反直觉发现,做LLM对齐评估的朋友值得细读。
S波、P波一次算全,电子、缪子两个通道全给到,还顺手把NLO QCD修正做了——这正是BESIII等实验等了好久的理论预言。不同J值态的奇异峰结构和软光子截断敏感性,给重夸克偶素电磁衰变这个老话题开了一扇新窗。
电子晶体管能独立控制载流子密度与输运速率,离子器件却一直被困在"一维控制"里。曼彻斯特大学团队用双门控技术给锂离子输运装上了"双旋钮"——密度归密度,速率归速率,开关比破百,千次循环不衰减。这项成果为储能与离子计算带来了新的想象空间。
这是一篇纯理论推导,却充满"几何直觉"的稀有文章。它不满足于告诉你算法L怎么用,而是用递归树把"为什么这么写"讲得明明白白。哪怕你对格雷码一无所知,也能顺着树的生长看懂指针的每一次跳动。
现在的数字人头像,脸可以以假乱真,头发却像顶了个头盔——怎么晃都是死的。马普所等机构提出PhysHead,把头发拆成一根根发丝并接入物理引擎,让头像在点头、转头甚至刮风时,头发真的会飘。顺便还借大模型把“秃头版”训练数据造了出来,细节拉满。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球