LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12820 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:大语言模型

共 319 篇
代码生成|中科院大作:安全测试当规范,结构化反馈零回归修复80个
视觉与图像

代码生成|中科院大作:安全测试当规范,结构化反馈零回归修复80个

大模型生成的代码能跑就算完?一测就出安全漏洞的场面见过太多。这篇论文把安全测试当“可执行规范”提前塞给模型,2705条轨迹实测:隐藏的联合成功率平均涨19.3个百分点,但也有模型越看测试越翻车。机制级严谨、工程级实用,值得细读。

AI · PAPER
大模型与智能体

GPT-5.4也翻车?港科大(广州)新基准:长文档重建关系数据库,F1仅75

当业界还在用单表抽取评测文档理解时,港科大(广州)团队直接抬高了门槛——Doc2DB-Bench要求从长文档里重建完整的关系数据库,边从表格到数据库:为什么文档理解需要新范式 先看一个真实场景:一份几十页的金融报告,里面写了好几家公司的现金流数据、股权关系、投资链路。传统做法是让大模型把里面的公司名称、金额、年份挨个抠出来,填进一张大表里完事。

Google+UC Berkeley新作:ArchAgent v2自动进化三级预取器
大模型与智能体

Google+UC Berkeley新作:ArchAgent v2自动进化三级预取器

预取器是芯片里的“预言家”,过去全靠人类工程师手搓,如今Google联合UC Berkeley让LLM进化智能体自己“进化”出一个三级预取器,直接拿下DPC4冠军,IPC比人类顶级方案还高0.3%,低带宽场景下更是领先2%。这是AI自动硬件设计第一次真正在权威竞赛里赢过人类冠军,值得所有做体系结构和AI的人围观。

南洋理工最新:AI代理“自我投毒”,93%成功率绕过所有防御
大模型与智能体

南洋理工最新:AI代理“自我投毒”,93%成功率绕过所有防御

这可能是第一篇系统研究“AI代理自我投毒”的论文:攻击者不注入任何恶意外部输入,只靠模型自己在正常任务里“写”出带毒的技能文件,就能让隐私泄露、提权、越权写入在后续任务中自动触发,在OpenClaw、Codex、Claude Code上平均攻击成功率超93%。对做AI Agent安全和部署的同学来说,这篇值得细读。

印度团队出手:让AI Agent"不敢乱动",F1 88.5%还能全员验证
大模型与智能体

印度团队出手:让AI Agent"不敢乱动",F1 88.5%还能全员验证

给AI代理发工具权限就像借车给实习生——怕他乱开。Niyam-AI直接上密码学“行车记录仪+电子围栏”:每次工具调用都得先过轻量Judge模型,再生成零知识证明,F1 88.5%、误报率仅1.1%,关键是任何第三方都能在53毫秒内验证“安全检查真的发生了”。同类工作里把ZK证明用到agent工具调用验证上的,这是头一遭。

残碑补字新范式:字符级掩码扩散让Ithaca都成了配角
视觉与图像

残碑补字新范式:字符级掩码扩散让Ithaca都成了配角

当大模型都在卷token时,这篇论文反着来:用字符级离散扩散处理古希腊残卷,把修复误差从24.6直接干到15.5。更难得的是,它把训练语料和11个去污染检查点全部开源,还承诺每个残破文本都能找到一个"从未见过它"的模型来做修复。数字人文的"可复现良心",大概就长这样。

浙大最新:零差距≠真恢复!SA-PPG揭示基准污染修复被严重高估
视觉与图像

浙大最新:零差距≠真恢复!SA-PPG揭示基准污染修复被严重高估

评测行业深水炸弹:"零差距"可能根本不是修复成功,而是正负误差抵消的假象!浙大新作直指现有污染缓解指标G-AP的两大致命缺陷,并给出SA-PPG评估指标与RailCap缓解策略。多模型多基准验证下,旧方法的"完美修复"排名被彻底翻盘。做评测、做数据清洗的,这篇不能错过。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球