LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1655 篇文章

PaperDaily 数据库收录 论文拆解 12859 研究思路 385 AI 资讯 210 开源项目 164 科研招聘 128 学习资料 8 热点主题 503 论文成功模式 1625

标签:AI应用

共 451 篇
CHI 2026最新观点:别让AI“快”成摆设,AAC评估不能只看速度
大模型与智能体

CHI 2026最新观点:别让AI“快”成摆设,AAC评估不能只看速度

AI 让 AAC 变快了,但“快”到底是不是第一要义?这篇来自 CHI 2026 的 Workshop 论文,犀利地撕开了当前技术评估的面纱。它没有提出什么新算法,却指出了一个最容易被忽略的问题:我们到底在为什么而优化?对于关注 AI 落地、真正的用户中心设计的读者,这篇几乎是必读。

中国电信&西安交大最新SOTA!InteractiveAvatar:实时流式生成,视频头像也能听懂你的话
视觉与图像

中国电信&西安交大最新SOTA!InteractiveAvatar:实时流式生成,视频头像也能听懂你的话

能让数字人听懂你说话的“套路”来了!InteractiveAvatar不仅能把语音转成视频,还能理解“看一下手表几点了”这种复杂意图,并做出相应动作。在长达数分钟的无限流式生成中,画面一致性还吊打一众对手,实时推理速度更是达到26.68 FPS。

Meta最新研究:一张照片就能生成4D人-物交互动画,效果效果优于单令牌方法!
视觉与图像

Meta最新研究:一张照片就能生成4D人-物交互动画,效果效果优于单令牌方法!

只需一张图片,就能精准控制4D人-物交互动画中的姿态、接触、布局细节。Meta联合马普所、阿姆斯特丹大学等机构提出的IMAGIN-4D,用“空间-时间”双重解耦的图像条件化策略,把生成图像遵循度指标直接砍半。同类工作做视频生成,它做4D交互,效果惊艳。

北大最新基准HOLMES:LLM高阶逻辑推理平均仅50.64%,最佳模型也才59.54%!
大模型与智能体

北大最新基准HOLMES:LLM高阶逻辑推理平均仅50.64%,最佳模型也才59.54%!

我们评估模型推理能力,还在用“答没答对”来一锤定音?北大等机构的最新研究HOLMES告诉你,答案对了,但推理过程可能全是“捷径”!这个首个面向高阶逻辑推理的真实世界基准,无情地揭露了GPT-5.4、DeepSeek、Qwen等一众顶级大模型,处理起需要“规则打架”、“跨范围组合”的现实问题时,表现有多拉胯。是时候关注推理过程的“忠信度”了。

语音增强新范式:FiLM注入SSL特征,实时也能做到
视觉与图像

语音增强新范式:FiLM注入SSL特征,实时也能做到

还在为扩散模型生成的语音不够自然、遇到噪声就“懵圈”而头疼吗?马里兰大学团队这次直接把自监督学习的“语言学耳朵”——Wav2Vec2,装进了扩散模型的U-Net里。效果拔群,PESQ直接飙升0.4,让AI在降噪时更懂你说的是什么,而不是无脑涂抹。

越南AI挑战赛夺魁!Vortex多模态视频检索系统,单模型搞定4大任务,90.5%准确率!
视觉与图像

越南AI挑战赛夺魁!Vortex多模态视频检索系统,单模型搞定4大任务,90.5%准确率!

想找一个能同时理解文本、图像、语音,还能进行时序推理和交互反馈的视频检索系统?Vortex做到了。它在一个统一的框架内,巧妙融合了最新的视觉语言模型和经典的检索算法,并在激烈的AI大赛中取得了90.5%的惊人成绩。这不仅仅是技术堆叠,更是一场工程与算法的完美交响。

全城2.5万人实测,断网两个月75%页面可获取
大模型与智能体

全城2.5万人实测,断网两个月75%页面可获取

全网断掉,没了搜索引擎和维基百科,我们怎么查资料?滑铁卢大学这篇工作给出的答案硬核且接地气—— 用蓝牙在大家手机里搭一个分布式“离线图书馆” 。CttF系统不搞天花乱坠的协议,而是让用户在断网前就缓存并互相打分,断网后再通过日常擦肩而过的那点时间交换资源。基于2.5万人真实轨迹的模拟证明,这套方案在真实部署场景下非常靠谱,比传统的流行病路由高效多了。

多目标决策新范式:不用预设预算也能找齐所有最优解
大模型与智能体

多目标决策新范式:不用预设预算也能找齐所有最优解

当药物分子库动辄上亿候选物时,那个经典的“找最佳分子”问题瞬间变成了在浩瀚星辰中寻宝。不仅要考虑多个属性,还得在“探索”和“利用”间平衡。这篇论文提出了TTPFTS,第一个真正意义上的“随时”贝叶斯算法,无需预设预算,就能边采样边给出越来越准的帕累托最优解集。更绝的是,在9400万分子的库中,它只用了0.05%的探索量就几乎锁定了全部真实最优解,还自带一个“

AI Agent接管云端?OpenKedge推出“执行经纪人”SEB,零常设凭证杜绝越权突变
大模型与智能体

AI Agent接管云端?OpenKedge推出“执行经纪人”SEB,零常设凭证杜绝越权突变

AI Agent越来越能干,但把“删库”、“开端口”这种高级权限直接交给一个会幻觉、还可能被黑客渗透的非确定性系统,这不是妥妥的定时炸弹吗?OpenKedge团队这篇论文,直接瞄准了这个“检查后执行”之间的真空地带,搞出了一个叫“Sovereign Execution Broker”的硬核边界,让Agent手里的凭证“即用即消”,从根本上堵死越权操作。一针见

Meta最新研究:用“软聚类”给物品画像,生成式推荐效果大涨!
大模型与智能体

Meta最新研究:用“软聚类”给物品画像,生成式推荐效果大涨!

生成式推荐是当下的研究热点,但如何将用户复杂的协同行为和物品语义同时注入大模型,始终是个难题。Meta这次提出G2Rec,巧妙的用了一个稀疏的物品协同图来捕捉用户行为,再用一个可扩展的“软聚类”方法自动学习出每个物品属于不同兴趣原型的概率,把难以表达的“上下文”变成了模型能轻松理解的结构化token。结果在多个数据集上全面领先,而且在线部署效果也很亮眼。读这

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球