华为上交大新作:vDiT不删算子也能提速
视频生成模型最烦的不是“不会画”,而是“画得太慢”。Kaleido不走粗暴删算子那条路,而是盯住潜空间里的通道相关性做复用,结果是加速和画质居然能同时保住。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
视频生成模型最烦的不是“不会画”,而是“画得太慢”。Kaleido不走粗暴删算子那条路,而是盯住潜空间里的通道相关性做复用,结果是加速和画质居然能同时保住。
DeepSeek 这回不只是把模型跑快,而是把“怎么在边缘设备上少算、少搬、少耗电”拆成了三把硬核手术刀。MIPS、MBLM、DAPPM 三招一套打下来,才有了 28nm 上 109.4 TFLOPS/W 这个挺扎眼的数字。
边缘AI最怕两件事:算得慢,坏了还得整机翻修。EIR偏偏不走老路,用PS里的空闲算力养两层数字孪生,盯得住、修得回,还尽量不占FPGA宝贵面积。
把模型“减肥”这件事,龙哥之前也聊过不少,比如大模型量化、混搭量化之类的。但今天这篇CVPR 2026的文章视角很刁钻——它发现视觉模型权重那些看起来不对称的“坏脾气”,其实只是被少数几个“刺头”(离群点)给带歪了。把刺头一拔,底下全是规规矩矩的对称分布。于是作者干脆利落地抛弃了硬件不友好的“非对称量化零点”,搞了个密集+稀疏的二重奏。这波操作不仅精度反超了
LLM生成的Verilog代码质量再高,最后还得靠验证来把关。往小了说是洗数据,往大了说是测试时搜索的命门。今天这篇台大和哈佛的STG,直接把测试平台生成从“玄学”变成了确定性程序,不仅快得离谱,还顺手揪出了经典benchmark里藏了多年的bug。
FPGA上跑AI模型,是不是总感觉DSP资源不够用?别急,AMD(原Xilinx)联合高校带来新解法:一种能在DSP里动态打包任意精度整数运算的“智能打包”黑科技。LUT减少21%,效率提升36%,还完全开源!
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球