← 返回 PaperDaily
大模型与智能体
ALIFE 2026:一招哈希撬动开放式进化,空间变大竟触发失控相变?
不用预设智能、不用基因编码,一台哈希函数就能撬动“开放式进化”?本文把最前沿的SCHC模型推到GPU大规模战场,意外发现空间尺度一到L≈300就会出现成核式失控相变,边界条件比想象中更“卡脖子”。极简模型,信息量极大,值得一读。
龙哥读论文
发布于 2026-08-14 09:12:01
阅读 4
查看原文
原论文信息如下:
引言
说到“进化”,很多人第一反应是达尔文、DNA、自然选择。但有一个更根本的问题一直困扰着人工智能和人工生命领域的研究者:为什么进化能不断产生新的、更复杂的结构,而不是停在某个局部最优里原地踏步? 这就是所谓的“开放式进化(Open-Ended Evolution)”难题。
过去十年,人工生命社区围绕这个问题吵得不可开交。有人堆大模型,有人搞复杂细胞自动机,但大部分系统要么计算贵到飞起,要么被人为预设了太多规则,进化的“开放性”名存实亡。就在这个背景下,东京大学与宾汉姆顿大学的研究者沿着一条完全不同的思路,把一套名为 Hash Chemistry(哈希化学)的极简模型家族做了系统梳理,并在最先进的 SCHC(结构细胞哈希化学)模型上做了两项关键扩展:引入空间局部性和成对交互(dyadic interaction),以及用 GPU 把模拟网格推到 400×400 甚至更大。
结果相当出人意料:只是把网格的边长从300调到302,系统就会从“保守的紧凑小复制子”突然跳变到“占据整个空间的失控巨无霸”。 更妙的是,研究者把这一相变机制拆成了两个部分——非空间的尺寸偏差采样反馈,和有限空间边界效应——并且用周期边界对照实验干净利落地证明了边界条件才是“扼住进化喉咙”的那只手。
这篇文章将带读者完整拆解这套模型:先从哈希化学家族四代模型讲起,再深入SCHC的细节,接着展示空间局部性/成对交互参数扫描的丰富结果,最后进入大尺度模拟中那个令人拍案叫绝的相变。文章还会给出龙哥的犀利点评和龙迷三问,帮读者判断这套极简模型到底是真的“四两拨千斤”,还是实验室里的精致玩具。
方法概述
在具体展开之前,需要先建立整体画面。Hash Chemistry 不是一个孤立的模型,而是一个不断演化的模型家族。所有家族成员共享一个核心思想:用一个确定性的哈希函数给任意大小的实体打分,分数高的实体在竞争取代动态中占优。 因为哈希函数可以接受任意长度的输入,实体一旦组合成更大的集合/多集/连通模式,可能性空间就会以组合爆炸的方式增长——论文中称之为“基数跃迁”(Cardinality Leap)。
设想一下,你手里有一个万花筒,每次转动都会产生全新的图案。如果这个万花筒永远转下去,且每次的图案都出人意料,那你看到的就是“开放式进化”。但现实中,大多数人工进化系统玩着玩着就固定了:要么收敛到一个最优解,要么陷入几个套路的循环。真正能持续产生新奇的系统,反而是像生命这样“不讲道理”的存在。
龙哥今天要聊的这篇论文,就是人工生命领域一个试图撬动“开放式进化”的极简模型家族——Hash Chemistry(哈希化学) 。这名字听起来像某种炼金术,实际上它核心逻辑简单到让人想拍大腿:用一个确定性的哈希函数(把任意数据映射成一个固定长度数值的函数)给任意大小的实体打分,实体越大、越复杂,哈希函数也能照样给它算出一个分来。然后,让这些实体按照分数高低去竞争、复制、淘汰,进化就自发地跑起来了。
为什么这不就是一个普通的适应度景观?关键在于哈希函数处理任意大小实体的能力。实体只要组合成更大的集合、多重集或连通模式,可能性空间就会以组合爆炸的方式膨胀。论文管这叫基数跃迁(Cardinality Leap) ——不需要人工设计“复杂”的定义,组合本身就能提供无限的新奇可能性。
更有趣的是,哈希分数并不等同于真正的生态适应度。分数只是给实体一个“潜力值”,而它能不能活下来、能不能繁殖,取决于空间中的互动规则。这种“分数与实现分离”的设计,让系统既有了探索方向的灯塔,又保留了竞争的野生感。
从粒子到结构:四代哈希化学模型的进化之路
Hash Chemistry 这个家族不是一蹴而就的,它经历了四代模型的层层递进,每一步都在补齐上一代的短板。下面这张表(原论文表1)清晰地概括了整个家族的家谱和各自的状态。
*表格超出部分左右可以滑动
模型
表示方式
状态
原始哈希化学 (Original Hash Chemistry)
空间中的粒子群
确立基数跃迁概念;计算昂贵;复杂增长有界
非空间哈希化学 (Non-spatial Hash Chemistry)
混合均匀的多重集
快速;持续适应和无限增长;但没有空间交互;多样性低
细胞哈希化学原型 (Cellular Hash Chemistry prototype)
二维网格,无显式身份
有空间交互且计算成本低;但没有有意义的适应或增长
结构细胞哈希化学 (Structural Cellular Hash Chemistry, SCHC)
二维网格上的连通分量
同时实现所有期望性质;是本研究的基础
空间-成对 SCHC (Spatial-dyadic SCHC)
SCHC + 局部成对交互
局部性促进增长;成对性促进多样性
第一代原始哈希化学在连续的二维空间里撒下带类型的粒子,然后不断抽取空间上邻近的一组粒子,用哈希函数打分,再根据分数决定这组粒子是复制、删除还是保持不变。这模型在 30 步到 1000 步的演化中,确实能看到粒子们逐渐组织成越来越大的团簇,但由于局部粒子密度迅速膨胀,邻居检测的计算复杂度高得吓人,而且复制子的复杂度增长最终会卡住。
于是第四代结构细胞哈希化学(SCHC)登场。它的核心设计是:把每个活性细胞所在的、通过摩尔邻域(周围8个格子)连通的组件当作一个复制子。竞争规则跟非空间版类似,但采样是按细胞坐标来的——随机挑两个活性细胞,找出它们所属的连通组件,用哈希函数分别打分,高分者把低分者的图案捣毁,然后把自己的图案覆盖过去,覆盖过程中还允许小幅变异。这样一来,空间生态、复杂度增长、多样性、计算效率全都到手了。
局部性+成对性:让进化更"活"的两个旋钮
原版SCHC的竞争是“全球范围随机抽签”,两个结构无论隔多远都可能被拉上擂台,而且打分只看单个结构自己的哈希值,完全不管对手是谁。这显然太粗糙了——自然界里,竞争通常发生在地理邻近的个体之间,而且结果往往取决于“我比你强”还是“咱俩在一起很强”。
论文给SCHC加了两个旋钮:空间交互范围 D (决定两个图案之间的最大国际象棋距离,D从1到L)和成对交互概率 P (两个图案竞争时,以概率P改打“二对二”的群架,即用两个图案组成的整体哈希值来决定胜负)。当(D, P)=(L, 0)时,就退化成原版SCHC,所以新模型是原版的一个超集。
空间尺度突变:当网格大到一定程度,进化突然"失控"
原版SCHC的模拟最多跑到L=100的网格,2000步就收工。但开放式进化是个漫长的游戏,小网格可能压根撑不下“大野心”。于是团队换了JAX实现并用GPU加速,把网格边长推到400,步数拉到2万。JAX是谷歌的自动微分+GPU加速框架,在这类并发模拟里简直如鱼得水。
结果,一个戏剧性的相变出现了:当L≈300时,系统会突然从“小打小闹”切换成“全面失控”。在L=300及以下的小网格里,复制子保持紧凑,平均尺寸在2-3个细胞左右晃悠,不兴风作浪;但网格边长只要超过300,图案就会疯狂膨胀,平均尺寸冲到上千,最大尺寸甚至上万,最终整个空间被一两个巨无霸结构垄断。
*表格超出部分左右可以滑动
L
平均尺寸
最大尺寸
晚/早期比率
失控比例
相关性 r
200 2.9 6.8 0.99 0.0 0.20
220 2.9 9.6 0.96 0.0 0.07
240 2.6 6.6 0.99 0.0 0.27
260 3.2 15.6 1.01 0.0 -0.21
280 2.8 12.4 0.92 0.0 -0.43
300 2.6 13.9 1.06 0.0 -0.39
320 1855 34111 12.1 0.5 -0.76
340 3190 53997 6.19 0.6 -0.82
360 1700 38620 5.02 0.4 -0.88
380 2320 44700 6.7 0.7 -0.85
400 2760 51230 7.42 0.7 -0.86
表2的数据清晰地展示了这个跳跃:L=300时平均尺寸还是2.6,L=320直接跳到1855。这种陡峭的转变并不是一个严格的临界点,而更像一种“成核相变”——在L=302到320之间,部分运行会失控,部分不会,失控比例像抽风一样上下波动。这跟过冷水突然结冰的感觉很像:需要一个随机波动的小晶种,才能触发连锁反应。
更细节地看,在相同的L下,是否发生失控是“双峰分布”的:要么一切照旧,要么彻底失控。失控的运行中,体积随时间逐渐增长,且增长速率随L增大而加快。这说明“种子事件”需要偶然凑齐几个条件才能触发,而更大的空间给了它更多机会。
隐藏在边界条件中的秘密:开放边界如何扼住进化的喉咙
为什么L=300会成为一个坎?团队没有停留在现象描述,而是果断设置了一个杀手锏对照实验:把开放边界改成周期边界(即环面拓扑,从右边出去会从左边回来,上边穿出从下边回归)。周期边界消除了“边缘裁剪”的物理效应,但竞争、打分、变异规则完全不变,连连通分量的识别都专门做了周期感知处理。
结果一目了然:在周期边界下,哪怕L=200的小网格也会失控!几乎30次运行里有29次都冲进了失控态,只有L=240时有一次苟住了。而在同样尺寸的开放边界下,失控率是0。这就把“空间尺度调控相变”这个表象给戳穿了——真正卡脖子的不是网格面积,而是开放边界本身。
第二块是有限空间的边界裁剪效应。一个失控的巨无霸在成长早期很容易碰到墙,墙壁会把它的一部分图案剪掉,破坏它的连通性,让它没法顺利滚大雪球。小网格里墙壁更“近”,雪球刚起步就被削平了。周期边界等于把“墙”拆了,所以无论L多大,都不会有边界带来的阈值。一旦进入失控态,主导组件的填充比例会趋向一个常数≈0.65,也就是说它的绝对大小会正比于可用面积,而不是被网格或边界条件定死。边界只决定“它会不会失控”,不决定“失控后能长多大”。
这个发现解释了扩展一里出现的一次“神秘异常”——在(D,P)=(10,0.6)时,L=100的小网格居然也出现过一次爆炸式增长。本质上就是强局部成对交互偶然催生了一个“种子”,触发了失控。它跟真正的相变是同一个机制,不是bug,是feature。
通向真正开放进化:从哈希到LLM的下一个十字路口
看完这套工作,读者可能想问:就这?一个哈希函数加一个网格,能对真正的开放式进化研究有多大贡献?但龙哥认为,它的价值恰恰藏在“极简”二字里。它把“复杂度增长”“生态互动”“多样性”“计算效率”这些指标全部搬进一个可复现、可扫参、成本极低的测试平台。比如要研究一个假设——局部竞争是不是比全局竞争更能维持多样性?在原版模型上调个D就行。这种透明度和操控性,是深度强化学习炼丹或者大语言模型微调给不了的。
更要紧的是,这套机制里有很多概念可以直接平移到大模型时代。比如“基数跃迁”跟大语言模型里token组合带来的涌现能力有异曲同工之妙——你不需要显式定义“创造力”,只需要给一个足够强的打分函数(RLHF奖励模型或者verifier),然后再加一点稀疏的局部交互(比如不同专家模型之间的协同),就可能看到更开放的探索。而那些动不动就“RLHF把模型训成复读机”的吐槽,在哈希化学的语境下,不过就是“P=0且全局竞争”造成的多样性崩溃而已——适度引入成对交互或局部交互,或许能有效缓解。
还有那个“失控相变”。它提醒我们,当系统规模跨过某个阈值时,看起来稳定的宏观行为会突然切换模式。这种“规模即开关”的逻辑,在语言模型领域已经被反复验证——参数规模上涨到某个量级,能力突然涌现。而边界条件的角色,则像是训练数据分布里的隐藏偏差。你以为是模型规模带来的涌现,其实是换了边界条件(比如过滤策略、tokenizer细节)才触发的。
当然,这套模型也不是万能的。二维网格的连通组件其实还非常“原始”,既没有体细胞分化,也没有跨世代的记忆存储。但作为一块干净的试验田,它已经钓出了好几条有价值的大鱼。下一步,如果能把类似的空间局部性和成对交互放进基于真实蛋白质或DNA序列的进化系统,或者反过来把哈希化学的抽象反馈注入LLM的采样机制,那可能会碰撞出真正实用的火花。
开放式进化是一个古老又年轻的梦。Hash Chemistry用最朴素的办法,把这个梦变成了可以随时在GPU上复现的数学实验。这感觉就像龙哥小时候第一次用万花筒——明明只是几片碎纸屑加一面镜子,却能映出无穷无尽的图案。哈希化学也是一样,明明只是几个数字加一张网格,却已经映出了生命演化的某个侧面。
龙迷三问
下面是龙哥针对大家可能比较关心的几个问题给出的解答。
什么是“基数跃迁(Cardinality Leap)”? 这是原文定义的术语。简单说,当你允许实体组合成更大的集合或模式时,可能的实体种类数会随尺寸组合爆炸。哈希函数能为任意尺寸的实体打分,因此系统可以无边界地探索这些新出现的可能性,而不是呆在固定大小的状态空间里。这就叫基数跃迁。
成对交互概率P到底是怎么操作的? 当两个结构A和B被选中PK时,原本是各自打分h(A)和h(B),谁高谁赢。但启用成对交互后,系统会以概率P改用h({A,B})来决定胜负,即把两个结构看作一个整体来打分。这相当于偶尔测试“我们合在一起是不是更牛”,可以打破原有的等级秩序,催生新的合作或竞争关系。
为什么开放边界会压制大结构出现,而周期边界不会? 开放边界有“墙”,一个正在长大的连通组件一旦碰到墙,边缘部分会被硬生生削掉,导致组件破碎、连通性下降,无法形成足够大的规模来垄断复制。周期边界相当于把球面缝起来,图案永远不会被墙切断,所以一旦种子事件触发,组件可以一直长到填满整个空间(约65%的填充率)才稳定下来。所以边界条件决定了“失控是否可能发生”,而不是“失控后能长多大”。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
把经典的SCHC模型系统性扩展到空间局部性和成对交互,并用大规模GPU模拟挖出尺寸驱动的相变,创新点虽然不算惊天动地,但胜在干净、扎实,而且找的bug(边界条件)很妙。
实验合理度: ★★★★★
参数扫描系统全面,从D/P热力图到L扫描,再到周期边界对照,实验设计严丝合缝,每个结论都有数据支撑。JAX复现虽然换了哈希函数,但作者明确说明了替代原因并验证了定性趋势,属于诚实且严谨的做法。
学术研究价值: ★★★★☆
作为人工生命领域的一个极简测试平台,SCHC为研究多尺度开放式进化提供了清晰的机制切面。把“边界条件”单独拎出来作为控制相变的变量,这种思路对复杂系统研究有很强的启发意义。
稳定性: ★★★★☆
算法本身很稳定,JAX实现也验证了复现性。但某些极端参数下(如L=302或304)成核相变的发生具有随机性,如果需要确定性复现某条轨迹,可能需要固定随机种子。不过这是系统特性,不算是缺陷。
适应性以及泛化能力: ★★★☆☆
这套模型目前只基于二维网格和确定性哈希,迁移到真实进化系统(如遗传算法、语言模型)还需要大量适配和验证。但作为抽象理论模型,它的核心机制(哈希打分+空间竞争)在原则上可以替换成任何标量评估函数。
硬件需求及成本: ★★★★★
原始SCHC在L=100时跑一个两千步的模拟非常廉价。GPU加速版本在L=400、2万步的情况下也能在合理时间内跑完上百次重复。相比大语言模型或深度强化学习的训练成本,这几乎可以忽略不计。
复现难度: ★★★★☆
三个开源代码库加上论文里的伪代码,复现难度不大。唯一的小坑是JAX版本用了32位替代哈希函数,如果想要逐位复现原论文结果,需要跑Mathematica的版本。但定性结论完全可以复现。
产品化成熟度: ★★☆☆☆
这不是一个能直接落地的工业级方法,而是理论探索型工具。潜在的“产品化”价值在于作为一种软件测试平台,比如用于评估新颖性搜索算法或验证AI安全策略,但目前的形态距离实际产品还很远。
可能的问题: 论文用了32位哈希替代Mathematica的内置Hash,虽然验证了定性趋势,但严格来说跨平台复现时可能存在细微差异。另外,对于“复杂度增长”的度量目前主要依赖尺寸,是否真正反映了“复杂度”仍值得商榷。
主要参考文献
[15] Horiguchi I, Sayama H. Original Hash Chemistry: A minimal model of open-ended evolution via cardinality leap. Artificial Life Conference, 2024.
[16] Horiguchi I, Sayama H. Non-spatial Hash Chemistry: Accelerating the cardinality leap with well-mixed populations. ALIFE 2024.
[17] Horiguchi I, Sayama H. Cellular Hash Chemistry prototype: A stepping stone toward structural cellular models. Unpublished/workshop, 2025.
[18] Horiguchi I, Sayama H. Structural Cellular Hash Chemistry (SCHC). ALIFE 2025.
[19] Horiguchi I, Sayama H. Spatial-dyadic SCHC: Locality and dyadic interactions for open-ended evolution. 2026.
[20] Horiguchi I, Sayama H. Scale-controlled evolutionary transition in SCHC. 2026.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
进化不怕空间大,就怕边界卡脖子;哈希做裁判,尺度定乾坤。
想围观龙哥拆解更多开放式进化的神奇模型,或聊聊大模型时代的新"进化论"?欢迎扫码加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 人工生命+北京+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群😊