← 返回 PaperDaily 大模型与智能体

GPT-4也翻车的24点游戏,被ToT一招救活:4%到74%

本文是NeurIPS 2023的经典工作,也是大模型推理研究绕不开的一座里程碑:它把树搜索、自我评估、回溯这些经典AI思想,重新装回了大语言模型身上,让模型面对复杂任务时真正学会“多想几步”。24点游戏4%到74%的跨越,至今仍被反复引用与对比。

GPT-4也翻车的24点游戏,被ToT一招救活:4%到74%
原论文信息如下:
论文标题:
Tree of Thoughts: Deliberate Problem Solving with Large Language Models

发表日期: 2023年5月

发表单位: 普林斯顿大学、谷歌DeepMind

原文链接: http://arxiv.org/pdf/2305.10601.pdf

开源代码链接: https://github.com/princeton-nlp/tree-of-thought-llm

思维树是什么:从“快思考”到“慢思考”的跨越

“4、9、10、13,只用加减乘除,怎么凑出24?”
这个很多人小时候在数学课上玩过的24点游戏,看似不起眼,却成了2023年大模型推理研究里最经典的一道考题。人类玩24点时会试错、会调整、会从答案倒推;那GPT-4呢?
论文在100道中等偏难的24点题里测了GPT-4,用当时最流行的思维链(Chain of Thought,简称CoT)提示,成功率只有4%。没看错,就是4%。一个四则运算小游戏,把地表最强模型按在地上摩擦。
问题出在哪?论文给出的诊断很扎心:大模型的核心推理机制,本质上还是“自回归”——从左到右,一个token一个token地往外蹦。这种机制擅长续写,但不擅长规划。一旦前几步写歪了,后面再怎么努力也救不回来。
这让人想起卡尼曼在《思考,快与慢》里提出的双过程理论:人类决策时有两套系统。System 1是快思考,自动、无意识、凭直觉秒回;System 2是慢思考,理性、费力、讲逻辑。大模型当前的推理方式特别像System 1——反应快,但缺少System 2那种“停下来多想几步”的能力。
而System 2的“思考”到底是什么?早在1950年代,Newell、Shaw和Simon就给出过一个影响深远的答案:人类解题,本质是在一个组合问题空间里做搜索——把问题分解成节点,把可能的操作看成边,形成一棵搜索树,再用启发式规则决定先走哪条分支。
一个是缺“慢思考”的大模型,一个是大半个世纪前的搜索理论。来自普林斯顿大学谷歌DeepMind的研究团队把这两者缝合到了一起,提出了ToT框架(Tree of Thoughts,思维树)。
ToT的核心想法非常朴素:既然大模型一条道走到黑不行,那就让它像人类一样,每一步多试几个思路,评估一下哪个更有希望,不行就回头换一条路。每个“思路”就是树上的一颗节点,问题求解变成一次树上的搜索。
图1:用大语言模型解决问题的多种方法示意图。每个矩形框代表一个“思维”,即一段连贯的语言序列,作为解题的中间步骤。图2、图4、图6展示了思维如何生成、评估和搜索的具体例子。
用大语言模型解决问题的多种方法示意图。每个矩形框代表一个“思维”,即一段连贯的语言序列,作为解题的中间步骤。图2、图4、图6展示了思维如何生成、评估和搜索的具体例子。
ToT让大语言模型像人类一样“深思熟虑”——探索多条推理路径、自我评估、必要时回溯。
ToT让大语言模型像人类一样“深思熟虑”——探索多条推理路径、自我评估、必要时回溯。

核心机制拆解:思维生成、状态评估与搜索算法

有了树这个大框架,接下来要回答四个问题:怎么把问题拆成思维?怎么生成候选思维?怎么评估当前状态?用什么算法在树上搜索?
先看思维分解。CoT也讲“思维链”,但它不显式拆分,让模型一口气把中间过程吐完。ToT则要求根据问题特性,把推理过程切成一个个可独立评估的“思维”。思维切多大?论文给出的经验法则是:要“小”到能让模型生成有希望且多样的候选,又要“大”到能让模型评估出好坏。在24点游戏里,一个思维就是一步算式,比如“13-9=4(剩余4,4,10)”;在创意写作里,一个思维是一段简短的大纲;在填字游戏里,一个思维就是填一个单词。切得太细没法评估,切得太粗没法优化。
再看思维生成。给定当前状态,怎么生成下一步候选思维?论文提供了两种策略。第一种是独立采样,用CoT提示让模型随机生成k个不同的思维,适合思维空间很丰富的场景;第二种是顺序提议,用一个“提议提示”一次性提出k个候选,适合思维空间受限的场景——同一上下文里提出多个候选,天然避免重复。
然后是状态评估。生成了一堆候选,谁更有希望?论文给出了两种方式。第一种是独立打分:让模型对每个候选状态给1-10的分数,或者给“sure/maybe/impossible”三档判断。评估的基础可以是很轻量的前瞻模拟,比如看到5、5、14,马上想到5+5+14=24;也可以是基于常识的淘汰,比如12、3、4明显太小凑不出24。第二种是投票选择:把多个候选摆在一起,让模型比较后挑出最有希望的那个,适合判断“好不好”这类主观性问题。
最后是搜索算法。论文选了两款最经典的:广度优先搜索(BFS)每一层保留分数最高的b个状态继续探索,适合深度较浅、层数固定的问题;深度优先搜索(DFS)沿着最有希望的分支一直往下挖,直到找到答案或评估器判定此路不通,然后回溯换路,适合深度较深、分支较多的搜索问题。
图2:24点游戏中的ToT示例。(a) 提示模型生成下一个思维步骤;(b) 提示模型评估每个候选思维,判断为sure(确定可行)、maybe(可能可行)或impossible(不可行)。
图2:24点游戏中的ToT示例。(a) 提示模型生成下一个思维步骤;(b) 提示模型评估每个候选思维,判断为sure(确定可行)、maybe(可能可行)或impossible(不可行)。
    ToT-BFS(广度优先搜索):
    初始化:S₀ ← {输入x}
    重复 t = 1 到 T:
      对每个状态s ∈ Sₜ₋₁,调用思维生成器G生成k个候选思维
      得到候选状态集合 S′ₜ
      用状态评估器V给S′ₜ里的每个状态打分
      保留分数最高的b个状态,作为下一层的Sₜ
    返回:对最终状态S_T中分数最高的状态,调用G生成一个输出
      ToT-DFS(深度优先搜索):
      初始化:从当前状态s出发
      如果达到步数上限T:记录输出并返回
      对当前状态s调用G生成k个候选思维:
        用评估器V给每个候选状态打分
        只对分数超过阈值v_th的状态,递归执行DFS
        如果一个状态被判定“不可能”,剪枝并回溯到父状态
      用伪代码可以更清楚地看到这两个算法的骨架:BFS是“层层筛选,优中选优”;DFS是“一条路走到黑,不行就回头”。两者的核心都是“生成-评估-搜索”的循环。

      三大实验验证:24点、创意写作与填字游戏的突破

      理论说得再漂亮,不如跑几个实验。论文设计了三个任务,分别考验数学推理、创造性写作和组合搜索,每个任务都精准击中了现有方法的软肋。
      表1:任务概览。输入、输出和思维示例如蓝框所示。
      表1:任务概览。输入、输出和思维示例如蓝框所示。
      首先是24点游戏。给定4个数字,用加减乘除凑24。论文从4nums.com网站抓了1362道题,按人类解题时间排序,取第901到1000号共100道较难题做测试。结果有多悬殊?直接看表2。
      表2:24点游戏的成功率对比。IO提示为7.3%,CoT提示为4.0%,CoT自一致性(k=100)为9.0%;ToT(b=1)达到45%,ToT(b=5)达到74%。
      表2:24点游戏的成功率对比。IO提示为7.3%,CoT提示为4.0%,CoT自一致性(k=100)为9.0%;ToT(b=1)达到45%,ToT(b=5)达到74%。
      IO提示成功率7.3%,CoT提示4.0%,CoT自一致性(采样100次取多数)9.0%。而ToT呢?每层只保留1个分支(b=1)就有45%,每层保留5个分支(b=5)直接冲到74%。
      speechless
      更让CoT阵营破防的是表2右侧两行:即便给CoT 100次机会取最好成绩(best of 100),成功率也只有49%;给IO加Refine迭代10次,也就27%。多次采样+多数票并不能弥补“一条道走到黑”的结构性缺陷。
      藏在数字背后还有一个惊人的事实:论文的错误分析显示,约60%的CoT样本在第一步就错了——也就是生成前三个词就废了。而ToT每步都有5个候选在竞争,还有评估器把关,优秀路径总有机会冒出来。
      图3:24点游戏(a)规模效应分析和(b)错误分析。横轴是访问的思维节点数,纵轴是成功率;CoT样本中约60%在第一步就产生了无效或不可能达到24的思维。
      图3:24点游戏(a)规模效应分析和(b)错误分析。横轴是访问的思维节点数,纵轴是成功率;CoT样本中约60%在第一步就产生了无效或不可能达到24的思维。
      然后是创意写作。输入4个随机句子,要求生成一篇4段落文章,每段结尾依次是这4个句子。这个任务没有标准答案,考查的是大局观和规划能力——先定大纲,再动笔。ToT的做法是:第一步先生成5个文章大纲,投票选出最好的,第二步基于最佳大纲生成5篇完整文章,再投票选最好的。
      图4:创意写作任务中一次随机挑选的搜索步骤。给定输入后,LM采样出5个不同的大纲,再投票5次选出最佳大纲。选定大纲后再用同样的采样-投票流程生成最终文章。
      图4:创意写作任务中一次随机挑选的搜索步骤。给定输入后,LM采样出5个不同的大纲,再投票5次选出最佳大纲。选定大纲后再用同样的采样-投票流程生成最终文章。
      图5:创意写作结果。(a) GPT-4打分对比,ToT平均7.56分,高于IO(6.19)和CoT(6.93);(b) 人类盲评对比,在100对文章中41对更偏好ToT,21对更偏好CoT,38对认为两者差不多。
      图5:创意写作结果。(a) GPT-4打分对比,ToT平均7.56分,高于IO(6.19)和CoT(6.93);(b) 人类盲评对比,在100对文章中41对更偏好ToT,21对更偏好CoT,38对认为两者差不多。
      结果上,GPT-4零样本打分:IO是6.19分,CoT是6.93分,ToT是7.56分。有人会说GPT-4自己打分有噪声,论文还安排了人类盲评:100对文章中,41对认为ToT更连贯,只有21对认为CoT更好,其余38对觉得差不多。
      最后是5x5迷你填字游戏。给5条横向线索和5条纵向线索,填出25个字母的棋盘。这个任务的搜索深度比前两个都大,因为填入的词会互相交叉,一个字母错了可能连锁崩盘。
      图6:迷你填字游戏中,(a)如何提议思维并把思维按优先级聚合,供深度优先搜索(DFS)使用;(b)如何评估每个状态能否填满剩余线索,若模型判定某个剩余线索“不可能”填出,就把该状态的分支剪掉,DFS回溯到父状态,继续探索下一个有希望的思维。
      图6:迷你填字游戏中,(a)如何提议思维并把思维按优先级聚合,供深度优先搜索(DFS)使用;(b)如何评估每个状态能否填满剩余线索,若模型判定某个剩余线索“不可能”填出,就把该状态的分支剪掉,DFS回溯到父状态,继续探索下一个有希望的思维。
      ToT用DFS:先顺着最有希望的线索往下填,一旦评估器发现某个剩余线索“不可能”凑出来,就剪掉这个分支,回溯到父节点换一条路。论文里有个有趣的细节:评估器偶尔会把正确答案也判成“不可能”——因为填字游戏里有些生僻词GPT-4也认不出来。
      表3:迷你填字游戏结果。ToT在字母级、词级、整局游戏三个层面都大幅领先;加了“best state”选择策略的ToT能解出7/20局,去掉剪枝或去掉回溯都很伤性能。
      表3:迷你填字游戏结果。ToT在字母级、词级、整局游戏三个层面都大幅领先;加了“best state”选择策略的ToT能解出7/20局,去掉剪枝或去掉回溯都很伤性能。
      最终效果看表3:IO词级成功率14%,CoT是15.6%,ToT干到60%,还能解出4/20局。去掉回溯操作后掉到20%——可见“回头路”有多重要。

      与现有方法的对比:ToT的通用性、模块化与适应性

      到这里,ToT的效果已经有了足够说服力。但更值得强调的是它在方法论层面的意义:IO、CoT、CoT-SC甚至Self-Refine,都可以看成ToT的特殊情况——深度和宽度都受限的“退化树”。ToT相当于把这一堆方法统一到了一个框架里。
      论文用四个关键词概括了ToT的优势。

      通用性:各种提示方法都不过是ToT的特例。

      模块化:基座模型、思维分解、生成策略、评估策略、搜索算法可以自由组合互换。

      适应性:不同问题可以定制不同的深度、宽度、生成方式和评估方式。

      便利性:不需要任何额外训练,给一个预训练大模型就能直接用。

      这个框架最优雅的地方在于——它没有改动模型本体任何一个参数,而是在“推理策略”层面加了一层外挂:用搜索换智能。这种思想后来影响了一大批推理优化工作。论文还在附录中补充了两个方向的扩展实验:新的零样本任务(表4),以及GPT-4与GPT-3.5的横向对比(表5、表6)。
      表4:零样本ToT与GPT-4在新任务上的表现。表5:24点游戏中GPT-4与GPT-3.5的对比。表6:创意写作中GPT-4与GPT-3.5的对比。
      表4:零样本ToT与GPT-4在新任务上的表现。表5:24点游戏中GPT-4与GPT-3.5的对比。表6:创意写作中GPT-4与GPT-3.5的对比。
      这些扩展实验进一步说明:ToT不挑任务、不挑模型,只要基座模型有一定基础能力,加上树搜索的“外挂”,都能获得稳定提升。

      局限与展望:成本、效率与未来方向

      世上没有免费的午餐。ToT效果爆表,代价是计算成本大幅上升。每一步都要生成多个思维、评估多个状态,API调用次数成倍增长。论文在附录中做了详细的成本分析(表7、表8),ToT在24点任务上的成本比CoT高出了一到两个数量级。
      表7:24点游戏的成本分析。
      表7:24点游戏的成本分析。
      当然,把24点成功率从4%提到74%,这个钱花得值不值,就看具体场景了。
      除了成本,ToT还有几个明显的软肋。

      第一,思维分解依赖人工设计。换一个任务就要重新设计思维切法、提示词和搜索参数,没法端到端自动化。

      第二,状态评估依赖基座模型自身的能力。如果模型不擅长自我评估,整个搜索就会走偏——填字游戏里误判生僻词就是例子。

      第三,搜索算法还比较朴素。论文用的是BFS和DFS两员老将,更高级的A*和蒙特卡洛树搜索(MCTS)都还没上阵,留给了后来者。

      未来方向:论文在总结里给出了几个方向——训练专用的过程奖励模型;把搜索算法升级到MCTS;用更大更强的模型当评估器。

      后来的故事大家都知道了——OpenAI的o1系列通过“思考和验证”在推理时投入更多计算,本质上和ToT想解决的问题是同一个,只是把显式的树搜索内化成了更长的思维链。可以说,ToT是这条“慢思考”路线的早期开路者。

      龙迷三问

      下面是龙哥对于大家可能的一些问题的解答:
      这篇论文到底在解决什么问题?普林斯顿大学与谷歌DeepMind联合提出思维树框架ToT,让大语言模型在推理时像人类一样探索多条思路、自我评估并回溯纠错。在24点游戏中,GPT-4成功率从思维链的4%跃升至74%,创意写作与填字游戏同样显著领先。
      这篇工作最值得看的点是什么?ToT在三个任务上均显著优于基线方法。Game of 24成功率从CoT的4%提升至74%;Creative Writing的GPT-4评分从CoT的6.93提升至7.56;Mini Crosswords的单词级成功率从CoT的15%提升至60%。
      这篇工作的边界或风险在哪里?优点:(1) 框架通用灵活,可适配不同任务和搜索算法;(2) 无需额外训练,直接使用预训练LM;(3) 显著提升需要规划或搜索的任务性能。缺点:(1) 计算成本高,需要生成和评估大量思维;(2) 思维分解和评估依赖人工设计提示;(3) 在简单任务上可能过度设计,收益有限。
      如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

      龙哥点评

      论文创新性分数:★★★★☆

      提出思维树(Tree of Thoughts, ToT)框架,将问题求解建模为对思维树的搜索,通过思维生成、状态评估和搜索算法(BFS/DFS)实现大语言模型的深思熟虑式决策。

      实验合理度:★★★★☆

      Game of 24成功率;Creative Writing使用GPT-4零样本打分(1-10分)和人工对比;Mini Crosswords的字母级、单词级和游戏级成功率

      学术研究价值:★★★★☆

      提出思维树(Tree of Thoughts, ToT)框架,将问题求解建模为对思维树的搜索,通过思维生成、状态评估和搜索算法(BFS/DFS)实现大语言模型的深思熟虑式决策;更关键的是问题定义是否可复用到同类任务。

      稳定性:★★★☆☆

      现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

      适应性以及泛化能力:★★★☆☆

      现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

      硬件需求及成本:★★★☆☆

      ToT的计算量显著高于IO和CoT,在Game of 24中每任务约需5.5k生成tokens,在Creative Writing中约需4k生成tokens,成本约为CoT的5倍。

      复现难度:★★★☆☆

      https://github.com/princeton-nlp/tree-of-thought-llm

      产品化成熟度:★★★☆☆

      论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

      可能的问题:(1) 计算成本高,需要生成和评估大量思维;(2) 思维分解和评估依赖人工设计提示;(3) 在简单任务上可能过度设计,收益有限。

      主要参考文献

      [1] Yao S, Yu D, Zhao J, et al. Tree of Thoughts: Deliberate Problem Solving with Large Language Models[C]. NeurIPS 2023. arXiv:2305.10601.
      [2] Wei J, Wang X, Schuurmans D, et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models[C]. NeurIPS 2022.
      [3] Wang X, Wei J, Schuurmans D, et al. Self-Consistency Improves Chain of Thought Reasoning in Language Models[C]. ICLR 2023.
      [4] Newell A, Shaw J C, Simon H A. Report on a general problem-solving program[C]//IFIP Congress. 1959.
      [5] 开源代码:https://github.com/princeton-nlp/tree-of-thought-llm

      融会贯通

      ToT这篇论文的价值,远不止于把24点从4%干到74%。它真正开启了一个研究方向:把大模型从“文本生成器”变成“问题求解器”。
      在ToT之后,大模型推理研究迎来了一波“搜索+推理”的复兴。RAP(Reasoning via Planning)把MCTS引入推理,LATS(Language Agent Tree Search)把ToT和强化学习结合,Self-Refine让模型自己批判自己——这些工作或多或少都能在ToT里找到源头。
      从PaperDaily已收录的论文来看,当下大模型推理优化的主流思路——无论是过程奖励模型(PRM)、推理时计算扩展(inference-time compute scaling),还是o1系列的长思维链——本质上都在回答ToT提出的同一个问题:如何让模型在生成答案之前“多想几步”。ToT给的答案是显式的树搜索,后续工作则探索了更高效的隐式方案。
      必须提醒的是,这里对后续工作的归纳仅基于PaperDaily已收录论文范围内的观察,并非全领域绝对结论。ToT的局限在今天的模型上依然存在——成本、思维分解的人工设计、评估器的不完美——这些也是整个“慢思考”路线共同的开放问题。对于普通从业者来说,ToT最大的启示可能不是某个具体算法,而是一个思维方式的转变:当模型能力不够时,与其硬换更大模型,不如在推理策略上花心思——用搜索、评估和回溯换智能,往往更划算。

      *本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

      end
      让大模型学会“多想几步”?来龙哥读论文粉丝群,和同好们一起拆解更多推理新范式!🧠💡
      扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 大模型推理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
      『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
      wechat_helper dianzan

      转发文章 微博 X LinkedIn Facebook
      龙哥读论文 · PaperDaily

      本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。