跨域事件抽取不再迷路:领域条件化让小模型逆袭大LLM
事件抽取模型一出自家门就迷路?德国DFKI与奥尔登堡大学联合提出统一多域多任务生成框架:给T5加上领域指示和任务提示词,单模型就能横跨网络安全、生物医学、新闻等6大领域做事件抽取,多域联合训练还让多个数据集性能不降反升,这种"一个模型通吃天下"的玩法,值得认真聊聊。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
事件抽取模型一出自家门就迷路?德国DFKI与奥尔登堡大学联合提出统一多域多任务生成框架:给T5加上领域指示和任务提示词,单模型就能横跨网络安全、生物医学、新闻等6大领域做事件抽取,多域联合训练还让多个数据集性能不降反升,这种"一个模型通吃天下"的玩法,值得认真聊聊。
数学解题能力强,不代表真的“懂数字”。这篇NAACL论文把数值能力当成自然语言推理任务来测,一口气跑了49个模型,结果发现数学专用大模型只在算术上占优,数字比较和归一化反而拉胯,值得每一位关注LLM推理能力的读者看看。
想象一下这个场景:一笔并购交易历经数月谈判,终于在截止日前夜敲定了最终条款。此时,一位律师揉着布满血丝的眼睛,逐行核对一份几百页的合同——不是在看条款对不对,而是在找"错别字"级别的硬伤:某个大写术语在这里为什么没大写?
低资源语言的NLP工具一直是老大难,这篇来自地拉那大学的论文直接用本地Gemma 4搭了一条媒体偏见分析流水线,在8358篇阿尔巴尼亚语新闻上把人物实体召回率做到70.3%。更妙的是提示词对比实验:严格校验虽然消灭了标签不一致,但覆盖率几乎腰斩。看完只想说,工程里没有万能的prompt,只有合适的取舍。
这就是社区问答(Community Question-Answering,简称CQA)平台面临的真实困境。
这可能是目前“无参考后训练”最扎实的一篇落地研究:小米直接用GRPO把46语言翻译模型的无参考质量分数推过了谷歌翻译和GPT-5,还顺手开源了模型和代码。想搞懂“不依赖参考译文怎么训翻译模型”,这篇值得精读。
被引9624次的NLP镇馆级论文,情感分析必读经典。斯坦福团队一口气端出两样硬货:215,154个短语级标注的Sentiment Treebank,以及把张量带进递归网络的RNTN,直接终结了“词袋模型统治情感分析”的时代。
当大模型都在卷token时,这篇论文反着来:用字符级离散扩散处理古希腊残卷,把修复误差从24.6直接干到15.5。更难得的是,它把训练语料和11个去污染检查点全部开源,还承诺每个残破文本都能找到一个"从未见过它"的模型来做修复。数字人文的"可复现良心",大概就长这样。
有句老话叫“所见即所知”,斯图加特大学这篇新作直接把它变成了“所听即所看”:只拿一个现成的CLIP模型做归因,不微调、不标注、不用任何生成架构,就能复现视觉世界实验里经典的预测性眼动——人类听到“eat”还没听到“cake”就把目光移向蛋糕,模型居然也“看”向了同一个地方。
LLM的“阅读理解”到底是真懂还是背题?佐治亚理工这篇论文把认知科学里研究人类回指消解的经典实验,原封不动搬到5个开源大模型身上,用surprisal和准确率当探针测“人味”。结果显示:Mistral-7B和GPT-2-XL的整体表现最像人类读者。
AI写得越来越像人,怎么零训练识破它?中科院团队从“生成机制”入手,给文本加上一句通用助手前缀,没想到机器文本立刻“自我暴露”——无需任何训练,检测精度直接刷新SOTA,甚至比不少训练过的检测器还猛。值得一看的“机制级”AI文本检测新思路。
大模型对抗训练是真·烧钱大户,光8步PGD就吃掉约80%算力。密歇根州立大学这篇工作把「低秩表示微调」和「电路剪枝代理模型」结合起来,从攻防两端同时压缩计算,平均省下48.1%的FLOPs,可训练参数只有0.0118%。效果不打折太多,性价比直接拉满。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球