← 返回 PaperDaily 大模型与智能体

全城2.5万人实测,断网两个月75%页面可获取

全网断掉,没了搜索引擎和维基百科,我们怎么查资料?滑铁卢大学这篇工作给出的答案硬核且接地气—— 用蓝牙在大家手机里搭一个分布式“离线图书馆” 。CttF系统不搞天花乱坠的协议,而是让用户在断网前就缓存并互相打分,断网后再通过日常擦肩而过的那点时间交换资源。基于2.5万人真实轨迹的模拟证明,这套方案在真实部署场景下非常靠谱,比传统的流行病路由高效多了。

全城2.5万人实测,断网两个月75%页面可获取
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
全网断掉,没了搜索引擎和维基百科,我们怎么查资料?滑铁卢大学这篇工作给出的答案硬核且接地气——用蓝牙在大家手机里搭一个分布式“离线图书馆”。CttF系统不搞天花乱坠的协议,而是让用户在断网前就缓存并互相打分,断网后再通过日常擦肩而过的那点时间交换资源。基于2.5万人真实轨迹的模拟证明,这套方案在真实部署场景下非常靠谱,比传统的流行病路由高效多了。


原论文信息如下:
论文标题:
Cache to the Future: A Distributed Webpage Archive for Internet Blackouts
发表日期:
2026年06月
发表单位:
University of Waterloo (滑铁卢大学)

断网了,想查资料怎么办?这个系统能缓存网页维持应急

想象一下:某一天,你所在的城市突然断网了——不是路由器坏了,而是整个城市的互联网被切断。你没法搜索“如何获取清洁饮用水”,没法查阅“常见疾病症状和用药”,甚至没法看一下维基百科上关于当地历史的那篇文章。是不是瞬间觉得回到了“石器时代”?
这种场景并不遥远。根据Access Now的统计,2024年全球54个国家发生了296次互联网关闭,创下自2016年以来的最高纪录。无论是自然灾害还是人为管控,断网就意味着信息孤岛。传统的断网抵抗技术(比如基于蓝牙的mesh网络)主要解决的是“我能和邻居发消息吗”的问题,但从来没有人解决过“我能查到网页吗”的问题。
现在,来自加拿大滑铁卢大学的Ross Evans和Diogo Barradas想到了一招——既然断网了没法上网,那咱们能不能在断网之前就把网页“存”在手机上,断网后再用蓝牙互相传?这个系统就叫 Cache to the Future(CttF),一个分布式网页缓存系统。它不依赖任何中心服务器,全靠普通人的手机组成一个“离线互联网档案馆”。
插图
图1:CttF的工作流程。用户在断网前缓存、评分并交换页面评分,断网期间请求被缓存的页面。
你是不是想问:这和P2P下载有什么区别?别急,往下看你就会发现,在断网这种特殊场景下做文件共享,挑战远比你想象的大得多。
先看一组对比。下面的表格列出了现有断网抵抗应用和MANET文件共享系统,对比它们的路由方式、对抗攻击的能力和测试场景。
插图
表1:现有工作对比。CttF是唯一一个既不是流行病路由、又同时考虑DoS、Jamming和应用特定操作的网页访问系统。
你会发现,之前所有的断网抵抗技术都集中在“消息传递”上,而且大部分采用流行病路由——就是两个手机一碰面,就把自己所有未发送的消息都复制给对方。这种方法在小范围内还能用,但城市级规模就彻底歇菜了:蓝牙信道会塞满重复消息,物理层直接拥堵。更惨的是,如果攻击者拼命发垃圾消息,好人的消息就被淹没了。CttF的设计目标就是避开这些坑。
第一个设计目标:通信模式必须能在城市规模下有效运行,并且能够抵抗攻击者。CttF放弃了流行扩散,改用插图。它只请求你真正需要的页面,而不是一股脑复制所有。
第二个设计目标:必须能够缓解非全局攻击者发起的攻击。CttF用工作量证明(Proof-of-Work, PoW)和数字签名来防止评分被恶意操纵,用本地评分计算而不是全局信用来避免单点故障。
第三个设计目标:仿真必须使用开放的真实世界数据,准确模拟人类在城市规模下的移动。CttF选用了YJMob100K数据集,包含25,000人在日本某城市75天内的GPS轨迹,每30分钟采样一次,覆盖200×200的网格(网格边长500米)。这比之前的工作(比如用出租车轨迹或随机路点模型)靠谱多了。
三个目标都瞄准了同一个痛点:在断网时,一个普通人如何快速、可靠地获取带有图文和样式的网页内容。CttF给出的答案是:让社区帮大家决定哪些网页最值得缓存。

基于社区评级,分发被缓存的网页

CttF的核心理念非常简单:靠群众的智慧来决定哪些网页值得存。整个过程分为四个阶段:页面获取、信息交换、后台缓存和页面检索。
页面获取(Page Fetching):用户想缓存一个网页时,不是直接去抓取,而是通过一个位于断网区域外部的可信代理来获取。代理下载页面及所有静态资源(CSS、JS、图片),然后用数字签名给整个页面打上“防伪标签”。这样即使在断网后拿到别人传来的页面,也能验证它是不是被篡改过。如果连代理都连不上(比如所有外部通道都被切断了),CttF也支持无代理回退:直接缓存未签名的页面,但断网后无法通过签名验证,只能靠多数投票或感知哈希等方式判断。
信息交换(Info Exchange):这是CttF最巧妙的部分。当两个用户靠近时,他们的手机通过蓝牙低功耗(BLE)广播发现彼此,然后交换一个“评分向量”。每个用户维护着一个本地平均评分 a_i 和总评分次数 c_i。当收到一个新评分 r_i 时,用跑步平均公式更新:
ai := (ai·ci + ri) / (ci + 1) , ci := ci + 1
为了防止攻击者伪造身份刷评分,每次交换评分前,发起方要先完成一个工作量证明(PoW):根据对方给的随机数 s,计算出一个 s' 使得 SHA256(s, MACA, rB, s') 的前α位为0。这个计算需要几秒(在手机上大约1秒就能完成,α设为适中值),大大提高了伪造代价。同时,每个用户每个会话最多只能传出1000条评分,进一步限制了攻击者。
后台缓存(Background Caching):光靠手动缓存肯定不够,CttF会根据社区评分自动在后台缓存高分的页面。但这里有个问题:如果只缓存评分最高的top-k,那么冷门但有用(比如某篇小众但救命的医疗文章)的内容就永远没人存。作者假设页面评分遵循Zipf-like分布(类似于网页访问热度的分布),并通过反向变换把评分映射成概率,再按概率随机采样,既保证了热门内容的高缓存率,又给冷门内容留下了生存空间。
插图
表2:CttF仿真参数配置
页面检索(Page Retrieval):断网后用户只能查看手机已有的缓存。如果需要某个页面,就在设备上标记为“待请求”。当两个用户相遇时,他们会交换各自未完成的请求。如果对方恰好有你要的页面,就直接传给你,附带签名(如果有)。页面验证支持多种回退:收集多个版本做多数投票、计算感知哈希比较、或者只接受来自信任联系人的副本。请求会一直保留直到被满足。
整个过程不需要任何中心服务器,所有评分计算都在手机本地完成。攻击者想舞弊?先做PoW,然后你的评分最多只能影响本地几个设备——因为评分没法流行病式传播,只在面对面交换时更新本地均值。这简直就是为“断网+对抗”量身定制的设计。
但光设计得漂亮还不够,真的在几万人的城市里跑起来会怎么样?验证环节来了。

数万人实测,首次实现城市级规模

实验部分才是最让人兴奋的。CttF的仿真使用了真实的大规模移动轨迹数据,而不是小打小闹的随机步行模型。整个城市有200×200个500米×500米的网格,包含25,000个真实个体的75天移动数据。初始设定2%的攻击者(Sybil节点),其余用户中25%是主动缓存的种子用户(seeder),75%是只安装app但不主动操作的“吸血者(leecher)”。页面总数设定为100万——这已经覆盖了互联网上超过95%的浏览流量。
先看良性场景(没有攻击者):
插图
图3:CttF在良性场景下的性能。在2个月的断网期间,用户能获取到75%的请求页面(top 10,000热门页面中位延迟低于24小时)。
图3告诉我们几个关键趋势:最热门的页面几乎0延迟就能获取(因为很多人都存了),随着页面排名下降(越冷门),满足率会逐渐降低,但中等热度的页面(排名1000左右)仍有超过80%的满足率。这是因为后台缓存策略给冷门页面也留了空间。总请求满足率达到75%,对于断网系统来说已经非常优秀了。
再来看看如果人们相遇频率降低会怎样(比如在城市郊区):
插图
图4:相遇概率的影响。即使只有10%的相遇概率(即稀疏场景),热门页面仍能维持70%以上的满足率,只是延迟增加了。
现在加入攻击者——Sybil节点。最坏情况下,攻击者占网络25%会怎样?
插图
图5:Sybil节点的影响。即使攻击者占25%,一周内的请求满足率只比良性场景下降5%,中位延迟仅从良性场景的不到24小时增加到约30小时。
更恐怖的是信号干扰(jamming)——攻击者可以在某些区域直接用设备阻塞蓝牙信号。CttF怎么扛?
插图
图7:同时有信号干扰和Sybil攻击时的性能。攻击者必须干扰超过2500平方公里的面积才能造成显著影响(城市大约40000平方公里,所以只干扰热点区域效果有限)。
CttF还专门测试了评分操纵攻击的效果(图8):
插图
图8:缓存分布受Sybil攻击影响。即使是“跟踪式Sybil”(能持续与同一用户交互),对头部页面的缓存影响也很小,尾部页面(冷门)受影响相对较大但仍在可接受范围。
为什么CttF能这么扛揍?核心在于PoW和本地评分的组合:攻击者每想刷一次评分就要做一次hash计算,即使有强力硬件,做一个PoW也需要几微秒(在手机上约1秒),想大规模影响成千上万设备的评分几乎不可能。而且评分只在面对面时更新本地平均,不传播,所以攻击者无法通过控制少数Sybil来污染全局。
最后,作者还在Android原型上做了微基准测试:传输吞吐量约能在一分钟内传输4个页面(每个2.5MB),PoW计算时间在α=20时约0.5秒,耗电方面,每小时后台扫描蓝牙约消耗2-3%电量,完全可接受。
总的来说,CttF第一次通过真实世界大规模轨迹数据证明:在人口稠密的城市里,利用蓝牙和社区评分就能实现一个可用的网页缓存系统。虽然它不能取代真正的互联网,但在断网时至少能让你查到“怎么处理伤口”或者“抗议者权利指南”这类关键信息。
——分隔线——

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

Q1:CttF和BitTorrent这类P2P下载有什么区别?为什么不用现成的BT协议?A1:BT假设网络总是通的,用户之间可以直连下载。而断网场景下,手机之间的蓝牙连接非常短暂且不稳定(你们在地铁擦肩而过只有几秒钟),BT的DHT和Tracker根本用不了。CttF专门优化了“短暂相遇”的通信:只交换评分和未完成请求,不维护长连接。BT也没有考虑攻击者伪造消息,CttF的PoW签名和本地评分正是为此设计。

Q2:CttF对用户的隐私有保护吗?会不会暴露我浏览了哪些网页?A2:CttF没有匿名性设计,这与之前的大部分断网抵抗系统一致。它使用蓝牙经典模式,会暴露设备MAC地址(就像你日常用蓝牙耳机一样)。系统不维护用户身份,但如果你和某人交换了URL请求,对方就知道你想要哪个页面。作者明确把隐私保护列为非目标,在审查环境下可能是个短板。但如果连网都没有了,隐私担忧可能得放在生存需求之后。

Q3:PoW的难度α是怎么确定的?为什么能防止攻击者刷评分?A3:作者在微基准中测试了不同α值,最终选择了α=20,使得在手机上完成一次PoW约需1秒。如果一个攻击者想通过伪造MAC地址反复与同一设备交换评分,每次都要重新计算PoW,在一个短暂的相遇窗口(约1分钟)内最多只能做几十次,远远不够影响本地平均值(因为每个会话最多允许1000次评分交换,但1000次PoW需要1000秒,根本来不及)。再加上评分只在本地更新,攻击者无法累积影响力。这个设计非常巧妙。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰(4星)

思路非常新颖——把网页缓存和断网抵抗结合起来,用社区评分+PoW来解决对抗问题。虽然不是完全革命性(有些想法来自P2P和MANET文件共享),但整体方案设计和对抗考虑十分完整。

实验合理度:★★★★★(5星)

使用了真实大规模移动轨迹数据,参数基于真实互联网使用数据校准。对比了多种攻击场景,并进行了敏感性分析。唯一的小缺憾是没有在实际部署中进行用户试点实验——但这要求真的断网,太难复现了,仿真已经尽力了。

学术研究价值:★★★★✰(4星)

为断网抵抗技术开辟了一个新方向——从消息传递扩展到网页内容获取。对分布式系统、对抗路由、移动Ad-Hoc网络等领域都有启发意义。但系统整体偏工程,理论深度一般。

稳定性:★★★★✰(4星)

在仿真中表现稳定,攻击者比例高达25%依然性能良好。但蓝牙通信的真实环境比仿真更复杂(干扰、遮挡、并发),实际稳定性有待验证。系统设计考虑了多种降级回退,有一定韧性。

适应性以及泛化能力:★★★✰✰(3星)

主要依赖人口密集的城市环境,如果是在非常稀疏的农村(相遇频率极低),性能会急剧下降。适用于断网常见的人口聚集区域(城市抗议、自然灾害后的安置点)。对不同国家网络基础设施的差异适应能力没有探讨。

硬件需求及成本:★★★★✰(4星)

只要有蓝牙的智能手机即可,无额外硬件成本。存储需求约3GB(缓存1200个页面),对现代手机很轻松。后台扫描耗电约每小时2-3%,可以接受。PoW计算对手机CPU负担很小。

复现难度:★★★✰✰(3星)

论文描述了详细的算法和参数,但代码并未开源(至少文中未提及)。要复现需要自己实现仿真和Android原型,工作量不小。数据集YJMob100K是公开的,这点不错。

产品化成熟度:★★✰✰✰(2星)

还处于学术原型阶段。离真正的产品还有距离:需要解决蓝牙的兼容性问题、用户安装率和主动缓存的激励问题、以及避开应用商店审查的风险。不过作为应急工具,如果能在特定群体(如记者、抗议组织)中小范围部署,已经具备雏形。

可能的问题:没有考虑用户真实使用情况中的激励问题:为什么要花时间手动缓存和评分?模拟中假定用户都勤快,现实可能只有极少数人愿意做。另外,没有考虑隐私保护,在审查环境下用户可能因为担心被抓而不敢安装。最后,缺少与现有断网抵抗系统(如Briar)的对比实验,说服力稍有不足。

参考文献

[1] Evans, R., Barradas, D.: Cache to the Future: A Distributed Webpage Archive for Internet Blackouts. University of Waterloo, 2026.
[2] YJMob100K dataset: A large-scale urban mobility dataset. https://doi.org/10.xxxxx (2025)
[3] Access Now: The state of internet shutdowns in 2024. https://www.accessnow.org (2025)



*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
看完了这个让知识在断网时“漂流”的方案,是不是觉得技术还能这么酷?想和更多小伙伴一起讨论这种反审查、抗断网的黑科技吗?
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 分布式系统+上海+滑铁卢大学+龙哥),根据格式备注,可更快被通过且邀请进群。

『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。