LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12823 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:大语言模型

共 319 篇
AI · PAPER
大模型与智能体

浙大美团联合提出SkillRise:任务越做越聪明,智能体学会举一反三

让AI智能体学会“举一反三”,而不是每次都从零开始。美团、浙大、上交大、新国立联合提出的SkillRise,通过端到端强化学习,让单一策略在执行任务中不断提炼技能文档,并在后续任务中复用。在三大Agent基准上,它用更少的资源,实现了更高的性能和明显的测试时扩展趋势。

告别误触和乱码,首个构建-注入联合优化指纹框架来了!
大模型与智能体

告别误触和乱码,首个构建-注入联合优化指纹框架来了!

LLM一发布就被倒卖、二次分发,权属怎么证明?华东师大这篇2026年的工作想了个妙招:把“指纹”藏进模型参数里,而且不是用容易被识破的乱码,也不是用会误触的普通英文,而是用低资源语言组成的“代码混合”语言。更厉害的是,指纹的“构建”和“注入”不再割裂,构建时选的语言直接指导注入时往哪里写。最终结果很硬核:平均困惑度只有96(远低于乱码的1302),注入成功率

AI · PAPER
视觉与图像

复旦+字节跳动ISSTA'26:一招让LLM学会API测试常识

API测试最头疼的“冷启动”问题——没有OpenAPI规范、没有历史日志,只有一个请求样本,能自动写出靠谱断言吗?Restor告诉你,用强化学习(GRPO)微调一个轻量LLM,这事儿能成,而且字节跳动已经在生产环境跑起来了,采纳率直接干到96%以上。一篇来自复旦和字节跳动的ISSTA'26工作,实打实的工业级神器。

AI · PAPER
视觉与图像

国立成功大学新突破:LLM引导食物分割,即插即用模块mIoU达55.0

食物分割里,豆腐和芝士经常被搞混?国立成功大学这篇工作用一个巧妙的思路——让大语言模型(GPT-o4 mini)根据图像猜出食材名称,再把食材标签嵌入视觉特征或解码器查询中,实现精准分割。两个模块完全即插即用,在FoodSeg103上刷新SOTA达到55.0 mIoU,且仅增加3.8GB显存开销。不用搞什么对齐训练,拿来就能涨点,实用派狂喜!

AI · PAPER
大模型与智能体

告别写代码调参数,量子计算实验自动化时代来了?

量子计算硬件越来越容易获取,但从理论论文到实际硬件运行,中间依然隔着巨大的工程鸿沟。PASQAL团队用AI智能体搭建了一座自动化桥梁,让一篇论文或专利在一夜之间变成QPU实验。更震撼的是,他们用AI扫描了633篇Rydberg阵列论文,发现近一半可以直接在现有量子处理器上执行。虽然是智能体,但专家把关依然不可替代——选错观测量的案例让人警醒。值得所有关注量子

AI · PAPER
大模型与智能体

谷歌新方法:推理级Shapley近似,LLM数据审计空间缩减99.1%

继6月聊过Adobe的定量LLM评判器之后,Google这篇直接将数据审计玩出了新高度。不重训练、不跑几千次微调,靠推理前向传播就能近似Shapley值,把审计搜索空间干掉99.1%,在HelpSteer2和HH-RLHF里揪出了一堆人类标注翻车的样本,甚至发现评估基准里藏着“错误答案才是正确”的坑。对搞LLM对齐、数据质量的同学来说,这是真正的降维打击。

NVIDIA新作Agentic RL框架Molt:代码量锐减至9K,吞吐量持平Megatron
大模型与智能体

NVIDIA新作Agentic RL框架Molt:代码量锐减至9K,吞吐量持平Megatron

NVIDIA开源了Molt,一个专为智能体强化学习(Agentic RL)设计的PyTorch原生训练框架。代码量仅约8600行,却能在吞吐量上与业界顶级的Megatron堆栈掰手腕。对于天天改算法的研究者来说,这简直是福音,终于不用在层层抽象和复杂配置里找东西南北了。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球