LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12820 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:大语言模型

共 319 篇
机器翻译也玩推理?Qwen3-8B拆句查证,BLEU/COMET双涨
大模型与智能体

机器翻译也玩推理?Qwen3-8B拆句查证,BLEU/COMET双涨

继大模型推理能力在数学、代码领域大杀四方之后,法国索邦大学与SYSTRAN团队把「思考」带进了机器翻译:让模型先从检索到的相似示例里精准切出可复用的平行片段,再动笔翻译。实验覆盖6种语言16个领域,BLEU、COMET与MetricX全面超越传统k-shot与草稿式推理,思路清奇且落地性强,值得每一位NLP从业者细读。

少花10倍算力!ASIL让开源小模型操作软件涨14个点
大模型与智能体

少花10倍算力!ASIL让开源小模型操作软件涨14个点

当Claude Code、Codex在代码世界里大杀四方时,GUI软件依然是智能体的"最后屏障"。上海交大与BIGAI提出ASIL,用结构化JSON观测+语义化代码动作替代截图点击,让GPT-5.4在380个任务上拿下81.6%的成功率,而同样的任务截图控制只有6.6%。一句话操作就能完成截图控制15次点击都完不成的活,这可能是智能体交互的一次范式革命。

别让AI空谈科研:北大华为六字段契约让"可证伪性"不再只是口号
大模型与智能体

别让AI空谈科研:北大华为六字段契约让"可证伪性"不再只是口号

如何判断大模型提出的科研设想靠不靠谱?北大、华为等机构给出一个硬核标准:让模型先写清楚,什么观察结果能证明它自己错。全新Lit2Test基准用六字段契约把可证伪性变成可检验的文本属性,在1200个标准对、2400次盲评下排出GPT-5.2 > Claude Sonnet 4.6 > GLM-5 > DeepSeek-V3.2的严格名次,人类一致率87.2%。

跨域事件抽取不再迷路:领域条件化让小模型逆袭大LLM
大模型与智能体

跨域事件抽取不再迷路:领域条件化让小模型逆袭大LLM

事件抽取模型一出自家门就迷路?德国DFKI与奥尔登堡大学联合提出统一多域多任务生成框架:给T5加上领域指示和任务提示词,单模型就能横跨网络安全、生物医学、新闻等6大领域做事件抽取,多域联合训练还让多个数据集性能不降反升,这种"一个模型通吃天下"的玩法,值得认真聊聊。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球