← 返回 PaperDaily 视觉与图像

FlashRT开源:27倍加速,边缘AI推理告别“重计算”,秒变“快照恢复”

当机器人每次重启都要重算大模型,或边缘设备LLM冷启动慢到怀疑人生,这篇论文给出了天才解法:把整个推理的“当时状态”像游戏存档一样快照,下次直接读档。FlashRT通过“执行状态胶囊”,让低延迟、小批量的边缘AI服务延迟狂降27倍,并在LLM、TTS、机器人策略上统一了这套机制。简单说,就是让AI推理变得像按快门一样快。

FlashRT开源:27倍加速,边缘AI推理告别“重计算”,秒变“快照恢复”
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
当机器人每次重启都要重算大模型,或边缘设备LLM冷启动慢到怀疑人生,这篇论文给出了天才解法:把整个推理的“当时状态”像游戏存档一样快照,下次直接读档。FlashRT通过“执行状态胶囊”,让低延迟、小批量的边缘AI服务延迟狂降27倍,并在LLM、TTS、机器人策略上统一了这套机制。简单说,就是让AI推理变得像按快门一样快。


原论文信息如下:
论文标题:
Execution-State Capsules: Graph-Bound Execution-State Checkpoint and Restore for Low-Latency, Small-Batch, On-Device Physical-AI Serving
发表日期:
2026年06月
发表单位:
作者个人(Liang Su)
原文链接:
https://arxiv.org/pdf/2606.20537v1.pdf
开源代码链接:
https://github.com/flashrt-project/FlashRT
项目链接:
https://github.com/flashrt-project/FlashRT

LLM边缘推理的“天花板”在哪?这项研究给出了新答案!

想象一下,机器人每秒钟调用大模型理解环境,但每次都要等好几秒才能拿到第一个token——冷启动让“实时”成了笑话。更扎心的是,同一个系统提示每次都要重算。这不是硬件不行,是主流推理框架(如vLLM、SGLang)的基因里带着“高并发、大吞吐”的烙印,没为单流、低延迟、边缘交互场景做过优化。
今天龙哥介绍的论文Execution-State Capsules,来自独立研究者Liang Su,给出了一个让人拍大腿的答案:别老盯着KV缓存,把整个推理的执行状态像游戏存档一样整个快照,下次直接读档!这套方法叫FlashRT,核心是执行状态胶囊。在RTX 5090上,胶囊恢复的冷启动时间比vLLM的自动前缀缓存(APC)低1.4~2.8倍,对比从头计算快了27倍!在Jetson AGX Thor边缘设备上,加速比达到夸张的76倍
下面这张图展示了FlashRT与vLLM在相同模型和GPU上,单流延迟的对比:FlashRT的冷启动已经比vLLM低了一大截,加上胶囊之后,延迟更是一条平坦的绿线,优势直接起飞。
图4:运行地板和状态复用地板,相同模型/GPU,单流。FlashRT冷启动是延迟优先运行时基板(地板);FlashRT胶囊在此基础上增加了状态机制以保持该地板。vLLM APC是其最好情况下的自动KV缓存命中;vLLM冷启动是其未命中路径(新进程、被驱逐、未见前缀——这在具身体场景中很常见)。胶囊位于APC热命中的下方,并在任何显式固定的、GPU驻留的边界上都保持大约53毫秒(不依赖于自动缓存驻留),扩展到16k时,其相对于冷启动的加速比达到27倍。vLLM对比只报告到8k(在测试的max_model_len=12288下);16k点是FlashRT冷启动与胶囊的缩放对比。
是不是开始好奇这个“胶囊”到底是个什么黑科技?别急,龙哥一步步拆解。

摆脱KV缓存束缚:从“按词寻址”到“按状态边界”复用

要理解胶囊的威力,得先看清当前主流框架的“软肋”。vLLM的PagedAttention和SGLang的RadixAttention都围绕KV缓存做文章,把KV缓存当成按位置寻址的内存块。这个设计在高并发下高效,但有两个致命弱点,尤其对于物理AI服务:
第一:捕获的CUDA图不是自包含的执行状态。注意力操作通过可变索引从分离的缓存池中读取KV,捕获的图绑定的缓冲区只是一些索引,无法把整个推理状态“冻住”再恢复。
第二:混合模型中的循环状态不是按前缀寻址的。线性注意力折叠状态和卷积状态是对整个前缀的积分函数,无法被切分成子前缀复用。即使KV缓存命中,循环状态也得从头计算。
FlashRT的视角来了一个180度翻转:它让CUDA图运行在连续静态缓冲区上,注意力不再通过可变块表间接寻址——整个前向传播被捕获为一个自包含的图计划。任何提交边界处的完整执行状态就是一组固定的、命名的设备缓冲区。把这组缓冲区整体冻结,就是执行状态胶囊。复用单位从token地址化的KV碎片变为图绑定的执行状态边界
图1:各系统的管理对象对比。(a) 分页/基数树引擎按token寻址:通过可变索引将token位置映射到外部池中的KV页(如B3B0B2B1乱序),且混合循环/卷积状态位于单独的缓存中,无地址块——因此捕获的图是可重放的,但其活跃状态分布在索引池和侧缓存中,不是自包含的。(b) FlashRT将前向传播捕获为连续静态缓冲区上的图计划,因此提交边界的活跃状态是一个命名的、有序的缓冲区集{KV, recurrent, conv, MTP, meta}绑定到图上;整体冻结这个集合就是胶囊。复用单位从token寻址的KV碎片变为图绑定的执行状态边界。
下面这个表格总结了三种管理对象的区别:
表1:三种服务的托管对象。关键区别不在于系统是否使用CUDA图(都使用),而在于捕获的图加上其绑定缓冲区是否构成可冻结的、自包含的执行状态。
龙哥觉得,这个“状态即第一类对象”的想法,把服务问题从“内存管理”提升到了“执行状态快照”的层面。连续静态缓冲区同时带来了低延迟和可冻结状态,是一个设计选择的两个后果。

如何让单流推理延迟降低27倍?揭秘“执行状态胶囊”魔法

胶囊到底是什么?简单说,执行状态胶囊是一个在提交边界处冻结设备缓冲区的快照。对于论文中使用的混合LLM,胶囊包含:
小固定部分:线性注意力循环状态、卷积状态、多token预测(MTP)尾部及其紧凑缓存与有效范围、最后一个隐藏态作为MTP种子,以及边界元数据。 KV区域:完整注意力KV的有效部分,加上长上下文FP8反量化阶段的有效终点。KV区域随前缀长度P增长,小固定部分体积不变。
胶囊不是捕获的图本身——图只是计算方案,胶囊是计算方案+精确的状态字节。FlashRT有四个核心动词:
Snapshot:冻结边界(支持GPU、主机内存或磁盘三级存储)。Restore:将胶囊字节复制回活跃缓冲区,重新绑定元数据,然后用相同的捕获图继续。Fork:将同一个胶囊恢复为N个独立会话(如树状思维、Best-of-N)。Rollback:恢复同一会话的早先提交边界。
图2:作为缓冲区集操作的动词(参见算法1)。1. snapshot将整个活跃集冻结为分层胶囊C0。2. restore将C0复制回活跃缓冲区,仅追加新后缀s,然后重放已捕获的图——无需重新捕获或前缀重算。3. fork将同一个C0恢复为N个独立活跃会话(token精确,§7.5)。4. rollback恢复同一会话的更早提交边界。硬中断是宿主在两次重放之间覆盖一个绑定的子缓冲区。KV/基数树对象不能作为第一类操作暴露上述任何一个动词。
关键的成本模型:设共享前缀长度为L。冷回合的代价是 Tprefill(L + s)(计算密集),而胶囊回合的代价是 Trestore(L) + Tappend(s)。两者都随L增长,但方式天差地别:冷启动是计算密集型,而恢复是带宽密集型。GPU计算带宽比内存拷贝带宽慢得多,所以加速比随L增大而增大。
表3:成本结构。胶囊将共享前缀复用从计算密集型重算变为带宽密集型状态拷贝。两者都随L缩放,优势在于斜率,而非常数时间恢复。
龙哥想强调:胶囊不是KV缓存的替代,而是补充。Paged/Radix缓存拥有高并发吞吐量,胶囊拥有极致的单流低延迟。论文所有比较都限定在单流(concurrency 1)延迟,绝不声称吞吐量的优势。

不止于LLM:一个机制统一大语言模型、TTS和机器人策略

胶囊的美妙之处在于:它只是一组“缓冲区”,不关心模型内部是注意力还是MLP。FlashRT底层定义了一个极简的C ABI执行契约,只有三个句柄类型、一个不透明shape key,加上严格机制-政策分离。这个契约可以驱动LLM、视觉-语言-动作模型(VLA,如Pi0、GROOT N1.6)以及语音模型(TTS)。
论文给出了三个非常有说服力的场景:
(a)编码代理:系统提示、工具模式、仓库索引等组成庞大的共享前缀(往往10~50k tokens)。胶囊将共享前缀固定为C0,每个回合只恢复C0并追加新约。(b)分支推理:同一个C0可以分叉出N个独立分支,每个分支从相同状态开始继续生成。(c)机器人强化学习:在每个回合计步开始处做快照;每次动作只要恢复该胶囊,重放图,追加新动作。(d)规划器-执行器切换:规划器写入一个绑定的子目标缓冲区,执行器每Tick读取;中断时覆盖缓冲区即可。
图3:物理AI服务场景与胶囊(cf. 图2的动词)。(a) 编码代理将共享大前缀固定为C0;每回合恢复C0并追加新回合,无需重新填充10~50k token前缀。(b) fork将同一个C0恢复为N个独立分支(树状思维、Best-of-N、并行工具调用),每个分支token精确地继续。(c) 机器人RL推演在回合计步初始边界做快照;宿主每个Tick重放一个动作块,回合重置就是恢复(C0)——无需模型或图预热。(d) 规划器固定其上下文,写入一个绑定的子目标缓冲区,执行器每个Tick读取;中途中断覆盖该缓冲区,下一次执行器Tick消费新子目标,无需图重新捕获。四个场景是同一个契约:沿时间轴的快照/恢复/分支(a-c)和沿空间轴的零拷贝绑定缓冲区切换(d)。
在TTS场景中,FlashRT对Higgs Audio TTS模型进行推理,其首音符延迟(TTFA)比SGLang-Omni低了2.6倍(相同bf16精度),FP8下还能进一步加速。
图7:Higgs TTS,RTX 5090,单流。左:实时因子(越低越好)。右:首音符延迟(TTFA)。在相同精度(bf16)下,FlashRT的TTFA比SGLang-Omni低2.6倍,逐帧RTF相当;fp8进一步加速。优势来自低开销执行,而非更快的kernel。

实验结果大放异彩:RTX 5090到Jetson Thor全线最优

所有实验都在单流(并发度1)下进行,对比对象是vLLM 1.x(包含APC)和SGLang。模型是基于Qwen架构的混合线性注意力+全注意力LLM(27B参数)。测试设备包括RTX 5090、Jetson AGX Thor和DGX Spark。
核心结果:在RTX 5090上,FlashRT冷启动相比vLLM冷启动,首单词延迟(TTFT)低2.6~2.8倍。加上胶囊后,比vLLM的APC还低1.4~2.8倍。胶囊恢复的TTFT几乎不随前缀长度增加而增长(平坦的~53ms)。
表9:相同模型/GPU上的绝对TTFT(毫秒),论文TTFT约定(MTP尾部排除;vLLM无MTP)。无复用:FlashRT冷启动比vLLM低2.6~2.8倍。有复用:胶囊比vLLM-APC低1.4~2.8倍。
在长前缀场景下,对于16k前缀,胶囊相比冷TTFT加速27倍,对于2k前缀也有3.9倍。
表7:胶囊成本分解 vs 前缀长度(论文TTFT:第一个基础logit token,MTP draft-cache尾部排除;§7.1)。快照、恢复和后缀追加都很小且平坦;冷启动随长度增长,因此加速比单调递增3.9倍→27倍。
关键的消融实验:当只恢复位置化的KV缓存,而丢弃循环/卷积状态时,模型几乎立刻偏离正确结果。这证明了胶囊的“全状态恢复”至关重要。
表8:仅KV vs 全状态胶囊(4096 token边界,贪心K=0,对比全恢复参考)。保留位置化KV但丢弃/陈旧循环+卷积折叠后几乎立即发散——胶囊的全状态恢是必要功能,而非KV内存拷贝。
跨设备实验:在Jetson AGX Thor上,冷TTFT需数秒,胶囊恢复后仅约0.17秒,加速比达到9~76倍。在DGX Spark上也有5~33倍。
图8:跨设备,单流,论文TTFT约定(第一个基础logit token,排除MTP尾部)。左:冷TTFT vs 胶囊TTFT vs 前缀长度,全部三个设备(对数坐标)——冷TTFT随前缀增长,按设备计算能力排序(Thor > Spark > 5090),而胶囊平坦且聚集在低值(约50~240 ms)。右:冷→胶囊加速比随前缀扩大并与各设备的重算成本相关(5090上27倍,Spark上33倍,Thor上16k时76倍)。胶囊TTFT本身稳定在约0.05~0.24秒,与前缀和架构无关;只有已被消除的冷成本不同。
在具身交互工作集测试中,单流循环访问2048个不同的2k token上下文,胶囊在三种设备上保持平直的延迟(约50/173/186 ms),而vLLM的APC在RTX 5090上随着工作集超出KV容量后迅速退化至冷启动。在Thor和Spark上由于统一内存大,APC保持平直,但仍比胶囊高3~4倍。
图9:三种设备上的具身工作集,单流:循环访问N个不同的2048 token上下文(工作集4.1~41k token)时的再访TTFT。胶囊(实线)在每个设备上平坦(5090/Thor/Spark上约50/173/186毫秒)。vLLM-APC(虚线)仅在5090上因离散显存溢出KV容量(34.6k token)而退化至冷未命中;在Thor和Spark上大统一内存保持APC平坦(但仍比胶囊高3~4倍)。在固定工作集下,胶囊的再访延迟由显式驻留决定,而非自动缓存驱逐,而APC的保留性依赖于设备。
龙哥想说,这个实验设计直接打到了自动缓存策略的痛点:在物理AI场景中,工作集经常变化,自动缓存可能因LRU驱逐而丢失,但显式固定的胶囊永远不会被自动驱逐,保证了确定性低延迟。

总结与展望:低延迟物理AI服务的第三类管理对象

这篇论文的核心贡献是提出了“执行状态”作为推理服务的第三类管理对象(前两类是KV内存页和KV前缀子树)。与vLLM/SGLang互补,FlashRT专门针对单流、低延迟、边缘交互场景。它的设计选择——连续静态缓冲区 + 图计划——同时带来了低延迟基板和可冻结的执行状态。胶囊将前缀复用从计算密集型变为带宽密集型,加速比随前缀增长而扩大。胶囊的四个动词为物理AI服务提供了原语支持。
未来工作包括:生产级的多轮代理服务、实际的机器人部署评测、将胶囊机制拓展到多节点场景。FlashRT已在GitHub上开源(Apache 2.0),支持Pi0、GROOT N1.6、Qwen3.6-27B等多种模型,只需3行代码就能开始推理。
龙哥认为,这项工作提醒我们,在AI推理系统的设计中,把状态本身当作一等公民,能带来意想不到的效果。未来当机器人和边缘AI越来越普及时,这种思想可能会成为标配。

龙迷三问

什么是“执行状态胶囊”?和KV缓存有什么区别?执行状态胶囊是FlashRT在推理的某个提交边界处,将一个模型完整的图绑定缓冲区集(包括KV缓存、线性注意力循环状态、卷积状态、MTP状态等)冻住并保存下来的快照。传统KV缓存只保存位置化的键值对,且通过可变块表间接访问,导致整个图绑定的缓冲区不是自包含的。胶囊则在一个连续静态缓冲区上运行图,边界处的所有状态是一组封闭的、命名的设备缓冲区,可被整体复制和恢复。KV缓存只管理部分状态(且分散),而胶囊管理完整的执行边界。

FlashRT与vLLM/SGLang相比,主要优势在哪里?FlashRT主要优势在于单流(并发度1)低延迟场景,如边缘设备上的交互式机器人、语音助手、编码代理。在这些场景中,高并发框架的自动缓存可能因工作集切换而丢失,导致频繁冷启动。FlashRT通过显式固定胶囊避免自动驱逐,恢复延迟远低于重算前缀。在RTX 5090上,胶囊TTFT比vLLM-APC低1.4~2.8倍,比vLLM冷启动低2.6~2.8倍。但在高并发吞吐量场景下,vLLM/SGLang仍然更优。论文明确表示自己是补充而非替代。

这个“物理AI服务”具体指哪些应用?物理AI服务是指与物理世界实时交互的推理闭环,包括:机器人视觉-语言-行动策略(VLA,如Pi0、GROOT N1.6)、编码代理(大前缀+多工具调用)、语音/对话助手的流式处理(如TTS语音中断恢复)。这些应用的共同点是低延迟、小批量(单流或极少流)、硬件资源有限(边缘GPU),并且需要频繁处理会话中断、分支和回滚。胶囊的四个动词恰好满足这些需求。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★★

提出“执行状态胶囊”作为第三类管理对象,思路新颖,与现有体系形成互补。将连续静态缓冲区、图捕获与状态快照统一为一个设计选择,非常优雅。

实验合理度:★★★★☆

在相同模型、相同GPU上进行了公平对比。实验覆盖了冷启动、缓存命中、长前缀、跨设备、具身工作集等维度,还做了关键的消融实验。唯一不足是只测了单流(论文明确如此界定)。

学术研究价值:★★★★☆

对于边缘计算、物理AI服务、混合模型缓存等方向有很强的启发性。但论文只展示了一个实现,尚未形成理论框架或基准。

稳定性:★★★★☆

在测试中胶囊恢复达到字节精确、贪心解码token精确、VLA动作再现余弦相似度1.0。但论文只在有限路径上验证了正确性。

适应性以及泛化能力:★★★☆☆

目前只适配了NVIDIA CUDA后端和特定模型。理论上可推广,但实际实现需要大量手工工程。对纯注意力模型的增益会小很多。

硬件需求及成本:★★★☆☆

需要SM80+的NVIDIA GPU,且依赖CUDA Graph捕获。胶囊快照需要存储大量缓冲区,对显存有一定要求。但恢复非常快,整体成本在边缘场景下可以接受。

复现难度:★★★★☆

代码已开源(Apache 2.0),提供了详细的安装指南。论文描述了核心算法,但底层CUDA细节需要阅读源码。对于有CUDA经验的开发者,复现主要实验应该是可行的。

产品化成熟度:★★★☆☆

已在真实GPU上验证了多项功能,但产品化还需要多用户会话管理、与云服务集成、容错机制、非NVIDIA硬件支持等。

可能的问题:

论文只针对单流场景,对于高吞吐量多请求场景未做声明。对非混合模型的增益可能较小。胶囊的显式固定机制增加了编程复杂度。最大前缀只测到16k,更长上下文的性能曲线尚不明确。


主要参考文献

[1] Liang Su. Execution-State Capsules: Graph-Bound Execution-State Checkpoint and Restore for Low-Latency, Small-Batch, On-Device Physical-AI Serving. arXiv:2606.20537, 2026.
[2] Kwon et al. Efficient Memory Management for Large Language Model Serving with PagedAttention. SOSP 2023. (vLLM)
[3] Zheng et al. SGLang: Efficient Execution of Structured Language Model Programs. MLSys 2024.
[4] FlashRT GitHub 仓库: https://github.com/flashrt-project/FlashRT (Apache 2.0)

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
🏃‍♂️ 看完FlashRT的「状态胶囊」方案,是不是觉得边缘AI推理的瓶颈瞬间打通了?想跟更多一线实战开发者一起探讨低延迟推理、机器人策略部署、LLM加速的最新技术?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 机器人控制+上海+交大+阿强),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。