公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~

龙哥推荐理由:
当机器人每次重启都要重算大模型,或边缘设备LLM冷启动慢到怀疑人生,这篇论文给出了天才解法:把整个推理的“当时状态”像游戏存档一样快照,下次直接读档。FlashRT通过“执行状态胶囊”,让低延迟、小批量的边缘AI服务延迟狂降27倍,并在LLM、TTS、机器人策略上统一了这套机制。简单说,就是让AI推理变得像按快门一样快。
原论文信息如下:
LLM边缘推理的“天花板”在哪?这项研究给出了新答案!
摆脱KV缓存束缚:从“按词寻址”到“按状态边界”复用
如何让单流推理延迟降低27倍?揭秘“执行状态胶囊”魔法
不止于LLM:一个机制统一大语言模型、TTS和机器人策略
实验结果大放异彩:RTX 5090到Jetson Thor全线最优
总结与展望:低延迟物理AI服务的第三类管理对象
龙迷三问
什么是“执行状态胶囊”?和KV缓存有什么区别?执行状态胶囊是FlashRT在推理的某个提交边界处,将一个模型完整的图绑定缓冲区集(包括KV缓存、线性注意力循环状态、卷积状态、MTP状态等)冻住并保存下来的快照。传统KV缓存只保存位置化的键值对,且通过可变块表间接访问,导致整个图绑定的缓冲区不是自包含的。胶囊则在一个连续静态缓冲区上运行图,边界处的所有状态是一组封闭的、命名的设备缓冲区,可被整体复制和恢复。KV缓存只管理部分状态(且分散),而胶囊管理完整的执行边界。
FlashRT与vLLM/SGLang相比,主要优势在哪里?FlashRT主要优势在于单流(并发度1)低延迟场景,如边缘设备上的交互式机器人、语音助手、编码代理。在这些场景中,高并发框架的自动缓存可能因工作集切换而丢失,导致频繁冷启动。FlashRT通过显式固定胶囊避免自动驱逐,恢复延迟远低于重算前缀。在RTX 5090上,胶囊TTFT比vLLM-APC低1.4~2.8倍,比vLLM冷启动低2.6~2.8倍。但在高并发吞吐量场景下,vLLM/SGLang仍然更优。论文明确表示自己是补充而非替代。
这个“物理AI服务”具体指哪些应用?物理AI服务是指与物理世界实时交互的推理闭环,包括:机器人视觉-语言-行动策略(VLA,如Pi0、GROOT N1.6)、编码代理(大前缀+多工具调用)、语音/对话助手的流式处理(如TTS语音中断恢复)。这些应用的共同点是低延迟、小批量(单流或极少流)、硬件资源有限(边缘GPU),并且需要频繁处理会话中断、分支和回滚。胶囊的四个动词恰好满足这些需求。
龙哥点评
论文创新性分数:★★★★★
实验合理度:★★★★☆
学术研究价值:★★★★☆
稳定性:★★★★☆
适应性以及泛化能力:★★★☆☆
硬件需求及成本:★★★☆☆
复现难度:★★★★☆
产品化成熟度:★★★☆☆
可能的问题:
论文只针对单流场景,对于高吞吐量多请求场景未做声明。对非混合模型的增益可能较小。胶囊的显式固定机制增加了编程复杂度。最大前缀只测到16k,更长上下文的性能曲线尚不明确。
主要参考文献
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 机器人控制+上海+交大+阿强),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群